Главная › Лекции › 3Blue1Brown — Нейронные сети

Обратное распространение ошибки: интуитивное объяснение

Лекция объясняет, как обратное распространение вычисляет нужные изменения весов и смещений и почему при обучении используют мини-пакеты.

3Blue1Brown⏱ 13 минОткрыть на YouTube ↗
Пройти весь тест — 6 вопросов →

Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.

О чём лекция

На примере распознавания рукописных цифр лекция напоминает, что обучение сети — это подбор весов и смещений, уменьшающих функцию стоимости. Градиент показывает, насколько стоимость чувствительна к каждому параметру и в какую сторону его следует изменить. Чтобы интуитивно понять обратное распространение, автор рассматривает один пример — изображение цифры 2. На выходном слое нужный нейрон следует активировать сильнее, а остальные — ослабить; величина желаемого изменения зависит от того, насколько текущий ответ отличается от правильного.

Желаемое изменение активации можно получить, меняя смещение и веса нейрона. Сильнее всего влияют веса связей с активными нейронами предыдущего слоя. Затем желаемые изменения передаются назад: влияние каждого нейрона распределяется по его связям пропорционально весам, а вклады разных нейронов складываются. Повторяя этот процесс по слоям, получают для каждого параметра направление и относительную величину корректировки. Один пример не определяет обучение всей сети, поэтому изменения усредняют по множеству примеров. На практике вместо обработки всей выборки на каждом шаге используют случайные мини-пакеты: они дают приближенную оценку градиента и ускоряют вычисления. Повторение таких шагов помогает приблизиться к минимуму стоимости. Для работы метода нужны многочисленные размеченные данные.

Ключевые идеи

Примеры вопросов

При обучении нейронной сети на размеченных примерах веса и смещения изменяют так, чтобы уменьшить функцию стоимости, оценивающую работу сети. Какой смысл имеет такое обучение?

  1. AУвеличить значения всех весов и смещений независимо от ответов сети
  2. BУменьшить число обучающих примеров, не меняя параметры сети
  3. CПодобрать веса и смещения, при которых функция стоимости становится как можно меньше
  4. DДобиться одинакового ответа сети на всех входных данных
Показать ответ

Верный ответ: C. Функция стоимости связывает параметры сети с качеством её ответов, поэтому обучение направлено на поиск параметров, снижающих эту оценку.

В нейронной сети нужно определить, как изменение весов и смещений влияет на функцию стоимости. Для чего в этой задаче применяют обратное распространение ошибки?

  1. AЧтобы выбрать архитектуру сети до начала обучения
  2. BЧтобы автоматически увеличить объём обучающих данных
  3. CЧтобы вычислить градиент функции стоимости по параметрам сети и понять, в каком направлении их менять
  4. DЧтобы заменить функцию стоимости набором активаций нейронов
Показать ответ

Верный ответ: C. Алгоритм вычисляет градиент по весам и смещениям, который показывает, как изменение параметров связано с изменением стоимости.

Пройти весь тест — 6 вопросов →

Свой тест по любой лекции

Вставьте ссылку на видео — LearnReplay сделает тест на понимание.

Создать тест →