Лекция объясняет, как обратное распространение вычисляет нужные изменения весов и смещений и почему при обучении используют мини-пакеты.
Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.
На примере распознавания рукописных цифр лекция напоминает, что обучение сети — это подбор весов и смещений, уменьшающих функцию стоимости. Градиент показывает, насколько стоимость чувствительна к каждому параметру и в какую сторону его следует изменить. Чтобы интуитивно понять обратное распространение, автор рассматривает один пример — изображение цифры 2. На выходном слое нужный нейрон следует активировать сильнее, а остальные — ослабить; величина желаемого изменения зависит от того, насколько текущий ответ отличается от правильного.
Желаемое изменение активации можно получить, меняя смещение и веса нейрона. Сильнее всего влияют веса связей с активными нейронами предыдущего слоя. Затем желаемые изменения передаются назад: влияние каждого нейрона распределяется по его связям пропорционально весам, а вклады разных нейронов складываются. Повторяя этот процесс по слоям, получают для каждого параметра направление и относительную величину корректировки. Один пример не определяет обучение всей сети, поэтому изменения усредняют по множеству примеров. На практике вместо обработки всей выборки на каждом шаге используют случайные мини-пакеты: они дают приближенную оценку градиента и ускоряют вычисления. Повторение таких шагов помогает приблизиться к минимуму стоимости. Для работы метода нужны многочисленные размеченные данные.
Верный ответ: C. Функция стоимости связывает параметры сети с качеством её ответов, поэтому обучение направлено на поиск параметров, снижающих эту оценку.
Верный ответ: C. Алгоритм вычисляет градиент по весам и смещениям, который показывает, как изменение параметров связано с изменением стоимости.
Вставьте ссылку на видео — LearnReplay сделает тест на понимание.
Создать тест →