Главная › Лекции › 3Blue1Brown — Нейронные сети

Градиентный спуск: как обучаются нейронные сети

Лекция объясняет, как нейросеть учится распознавать цифры, минимизируя функцию ошибки с помощью градиентного спуска.

3Blue1Brown⏱ 21 минОткрыть на YouTube ↗
Пройти весь тест — 6 вопросов →

Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.

О чём лекция

На примере распознавания рукописных цифр показано устройство нейросети: 784 входа соответствуют пикселям изображения, а выходной слой из 10 нейронов выбирает цифру. Работа сети зависит от весов и смещений. Во время обучения их настраивают по размеченным изображениям, а качество проверяют на данных, которых сеть не видела.

Чтобы измерять ошибки, задают функцию стоимости: она сравнивает выход сети с правильным ответом и усредняет отклонения по обучающим примерам. Обучение сводится к поиску значений параметров, при которых эта стоимость уменьшается. Градиент показывает направление наиболее быстрого роста функции, поэтому шаг в противоположном направлении снижает стоимость. Повторяя такие шаги, алгоритм градиентного спуска приближается к локальному минимуму; величины компонентов градиента также указывают, какие параметры сильнее влияют на результат. Эффективное вычисление градиента выполняет обратное распространение ошибки.

Простая сеть из лекции правильно классифицирует около 96% новых изображений, а изменение структуры повышает результат примерно до 98%. Однако её скрытые слои не обязательно выделяют ожидаемые человеком края и формы: успешная классификация сама по себе не гарантирует такого представления. Сеть может уверенно ошибаться на случайном шуме, а эксперименты с перемешанными метками показывают, что сложные модели способны запоминать обучающие данные. При этом структурированные данные позволяют быстрее находить хорошее решение, чем случайные метки.

Ключевые идеи

Примеры вопросов

В нейронной сети входами нейрона служат активации предыдущего слоя a₁, …, aₙ. Для каждого входа задан вес wᵢ, а также смещение b и функция активации φ. Как вычисляется выходная активация этого нейрона?

  1. Aφ(w₁ + … + wₙ + a₁ + … + aₙ) + b
  2. Bφ(w₁a₁ + … + wₙaₙ + b)
  3. Cw₁φ(a₁) + … + wₙφ(aₙ) + b
  4. Dw₁a₁ + … + wₙaₙ + φ(b)
Показать ответ

Верный ответ: B. Сначала входные активации умножают на соответствующие веса, складывают и прибавляют смещение; к полученной сумме применяют функцию активации.

После обучения нейросети для распознавания изображений ей предъявляют новые изображения с известными правильными метками, которых не было среди обучающих примеров. Что позволяет оценить такая проверка?

  1. AСпособность сети распознавать закономерности на ранее не встречавшихся данных
  2. BМинимальное значение функции стоимости на обучающих примерах
  3. CСпособность сети запоминать случайно назначенные метки
  4. DТочность вычисления активации отдельного нейрона
Показать ответ

Верный ответ: A. Проверка на новых размеченных изображениях показывает, переносит ли сеть усвоенные закономерности за пределы обучающего набора.

Пройти весь тест — 6 вопросов →

Свой тест по любой лекции

Вставьте ссылку на видео — LearnReplay сделает тест на понимание.

Создать тест →