Главная › Лекции › 3Blue1Brown — Нейронные сети

Как большие языковые модели хранят факты

Лекция разбирает устройство MLP в трансформерах и показывает, как они могут связывать имя человека с фактом, а также почему реальные признаки трудно выделить.

3Blue1Brown⏱ 23 минОткрыть на YouTube ↗
Пройти весь тест — 6 вопросов →

Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.

О чём лекция

В лекции рассматривается, как блоки многослойного перцептрона (MLP) могут участвовать в хранении фактов. На условном примере «Майкл Джордан играет в баскетбол» объясняется, что векторы токенов проходят через два линейных преобразования с нелинейной функцией ReLU между ними. Первое преобразование выявляет признаки входного вектора: строки матрицы можно понимать как направления, с которыми он сопоставляется. Если сочетание признаков имени активирует нейрон, второе преобразование добавляет к вектору направление, соответствующее баскетболу. Результат прибавляется к исходному вектору; операция применяется параллельно к каждому токену.

Эта схема — упрощённая модель, а не полное объяснение того, как устроена память реальных языковых моделей. В GPT-3 на MLP приходится около 116 млрд параметров — примерно две трети всех параметров модели. При этом отдельные нейроны редко соответствуют одному ясному признаку. Гипотеза суперпозиции предполагает, что множество признаков кодируется перекрывающимися, почти перпендикулярными направлениями. В высоких размерностях таких направлений может быть экспоненциально больше, чем самих измерений, поэтому модель потенциально способна представлять больше идей. Тогда признак может проявляться не в одном нейроне, а в сочетании активаций; для его поиска применяют, например, разреженные автоэнкодеры.

Ключевые идеи

Примеры вопросов

В высокоразмерном пространстве эмбеддингов направления векторов могут соответствовать разным типам смысла. Какой вывод из этого следует?

  1. AСмысл представления определяется исключительно числом измерений пространства.
  2. BКаждое направление соответствует только одному конкретному слову.
  3. CВсе векторы с одинаковой длиной обязательно кодируют одинаковый смысл.
  4. DСмысловое различие между представлениями может выражаться в том, куда направлены их векторы.
Показать ответ

Верный ответ: D. Если направления связаны с типами смысла, то ориентация вектора может нести семантическую информацию.

В упрощённой модели трансформера рассматривают, как может быть представлен факт «Michael Jordan играет в баскетбол». Какую роль приписывают MLP в этой модели?

  1. AMLP удаляет из представления сведения о конкретных людях
  2. BMLP гарантирует, что любой факт можно восстановить без дополнительных предположений
  3. CMLP служит дополнительным ресурсом для хранения фактов
  4. DMLP отвечает только за порядок слов в предложении
Показать ответ

Верный ответ: C. В этой модели MLP рассматривается как дополнительная ёмкость, в которой могут храниться фактические сведения; пример с Майклом Джорданом иллюстрирует эту роль.

Пройти весь тест — 6 вопросов →

Свой тест по любой лекции

Вставьте ссылку на видео — LearnReplay сделает тест на понимание.

Создать тест →