Главная › Лекции › 3Blue1Brown — Нейронные сети

Трансформеры: как устроена технология больших языковых моделей

Лекция объясняет, как трансформер превращает текст в токены и векторы, учитывает контекст и предсказывает следующий токен.

3Blue1Brown⏱ 27 минОткрыть на YouTube ↗
Пройти весь тест — 6 вопросов →

Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.

О чём лекция

Большая языковая модель генерирует текст, многократно предсказывая следующий токен и выбирая его из распределения вероятностей. Трансформер обрабатывает последовательность токенов: сначала каждому соответствует вектор, затем блоки внимания обновляют векторы с учётом контекста, а многослойные перцептроны преобразуют каждый из них. Эти операции повторяются, после чего модель использует последний вектор, чтобы оценить возможные продолжения. Чат-бот можно построить, задав модели инструкцию и вопрос пользователя как начало диалога.

Параметры модели — обучаемые веса, организованные преимущественно в матрицы; вычисления с ними сводятся главным образом к умножению матриц на векторы. В обучаемой матрице эмбеддингов каждому токену соответствует вектор. Векторы могут отражать смысловые сходства и отношения, а в ходе обработки обогащаются информацией о контексте. Размер контекстного окна ограничивает объём текста, доступный модели при предсказании.

В конце модели матрица преобразует последний вектор в значения для токенов словаря — логиты. Функция softmax превращает их в вероятности: большие значения получают больший вес, но менее вероятные варианты тоже могут быть выбраны. Температура регулирует случайность выбора: при низкой модель чаще выбирает наиболее вероятный токен, при высокой — чаще рассматривает менее вероятные.

Ключевые идеи

Примеры вопросов

При генерации текста языковая модель получает начальную строку и затем несколько раз предсказывает и выбирает продолжение. Как формируется текст в таком процессе?

  1. AКаждое новое продолжение добавляется к уже созданному тексту и становится частью контекста для следующего шага.
  2. BМодель дописывает текст по заранее заданному сценарию, не используя выбранные продолжения.
  3. CМодель один раз выбирает весь готовый текст, а последующие шаги только отображают его по частям.
  4. DПосле каждого шага начальная строка заменяется новым продолжением, поэтому предыдущий текст не влияет на генерацию.
Показать ответ

Верный ответ: A. Генерация продолжается шаг за шагом: выбранное продолжение присоединяется к исходному тексту, и модель использует обновлённый текст для следующего предсказания.

В трансформере каждому слову сопоставляют числовой вектор, представляющий его смысл. Если два слова близки по значению, какое отношение между их векторами ожидается в многомерном пространстве?

  1. AОни находятся на максимально возможном расстоянии.
  2. BИх расположение определяется только длиной слов.
  3. CОни обязательно совпадают по всем координатам.
  4. DОни расположены близко друг к другу.
Показать ответ

Верный ответ: D. Векторное представление отражает смысловые связи: близкие по значению слова оказываются рядом в пространстве векторов.

Пройти весь тест — 6 вопросов →

Свой тест по любой лекции

Вставьте ссылку на видео — LearnReplay сделает тест на понимание.

Создать тест →