Главная › Лекции › 3Blue1Brown — Нейронные сети

Как работает механизм внимания в трансформерах

Лекция объясняет, как внимание связывает токены контекста, обновляет их представления и помогает трансформеру предсказывать следующий токен.

3Blue1Brown⏱ 26 минОткрыть на YouTube ↗
Пройти весь тест — 6 вопросов →

Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.

О чём лекция

Трансформер разбивает текст на токены и сопоставляет каждому векторное представление — эмбеддинг. Изначально оно отражает слово и его позицию, но не учитывает контекст. Механизм внимания позволяет уточнять значение токена по окружающим словам: например, различать смыслы слова «крот» или учитывать, что башня названа Эйфелевой и является миниатюрной. Внимание также передаёт информацию между позициями, чтобы итоговое представление последнего токена содержало сведения, важные для предсказания следующего.

В одной голове внимания из эмбеддингов с помощью обучаемых матриц получают запросы и ключи. Их скалярные произведения показывают, какие токены связаны; после softmax оценки становятся весами, по которым складываются векторы значений. Полученная сумма добавляется к исходному эмбеддингу и обогащает его контекстом. В авторегрессионных моделях маска не даёт токенам учитывать более поздние позиции: перед softmax соответствующие оценки заменяют на минус бесконечность.

Внимание состоит из множества голов, работающих параллельно: каждая может усваивать свой тип связей и предлагать отдельное изменение эмбеддинга. Несколько таких блоков чередуются с многослойными перцептронами, поэтому представления постепенно становятся сложнее и могут кодировать более абстрактный контекст. Размер матрицы внимания растёт пропорционально квадрату длины контекста, что затрудняет увеличение окна. Важное преимущество механизма — параллелизуемость вычислений.

Ключевые идеи

Примеры вопросов

В трансформере каждому токену соответствует вектор в пространстве эмбеддингов. Как следует понимать идею, что направление такого вектора может нести семантическую информацию?

  1. AНаправление вектора показывает, насколько сильно токен влияет на другие токены.
  2. BСмысл токена определяется только длиной вектора, а его направление несущественно.
  3. CСмысл токена может быть связан с тем, в какую сторону в пространстве направлен его вектор.
  4. DНаправление вектора задаёт позицию токена в предложении, но не связано со смыслом.
Показать ответ

Верный ответ: C. Векторное представление может кодировать смысл через геометрическую ориентацию: значение имеет не только сам факт наличия вектора.

В self-attention исходный эмбеддинг токена преобразуют с помощью матрицы W_Q в запрос меньшей размерности. Какая операция выполняет это преобразование?

  1. AНормировка эмбеддинга без матричного преобразования
  2. BУмножение эмбеддинга на матрицу W_Q после применения к нему маски будущих токенов
  3. CУмножение эмбеддинга на матрицу W_Q
  4. DСложение эмбеддинга с матрицей W_Q
Показать ответ

Верный ответ: C. Матрица W_Q проецирует исходное представление токена в пространство запросов; нормировка и маскирование сами по себе не создают запрос.

Пройти весь тест — 6 вопросов →

Свой тест по любой лекции

Вставьте ссылку на видео — LearnReplay сделает тест на понимание.

Создать тест →