Главная › Лекции › Лекции одного дата-шрушера (ВШЭ) — Глубокое обучение
Трансформеры, BERT и GPT: устройство и применение
Лекция объясняет устройство трансформера, механизм внимания и различия между BERT и GPT, а также знакомит с позиционными эмбеддингами и токенизацией BPE.
Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.
О чём лекция
Лекция начинается с причин, по которым трансформеры пришли на смену рекуррентным сетям в задачах работы с последовательностями: они быстрее обучаются и позволяют распараллеливать вычисления. Центральный механизм архитектуры — самовнимание. Для каждого токена модель формирует запрос, ключ и значение, сопоставляет запросы с ключами, вычисляет веса внимания и объединяет значения в контекстное представление. Несколько независимых «голов» внимания помогают учитывать разные отношения между словами. Поскольку самовнимание само по себе не кодирует порядок слов, к представлениям добавляют позиционную информацию.
Затем разбираются блоки трансформера: энкодер последовательно обогащает представления, а декодер использует маскированное внимание, чтобы не заглядывать в будущие токены, и взаимодействует с выходами энкодера. Остаточные связи и нормализация помогают строить глубокие и устойчиво обучаемые модели. BERT использует часть энкодера и предварительно обучается, в частности, восстанавливая замаскированные слова; затем его дообучают для конкретных задач. GPT использует декодер и генерирует текст по одному токену, предсказывая следующий. В лекции также упоминаются модели для длинных последовательностей и улучшения BERT, включая RoBERTa. В завершение объясняется токенизация BPE: частые сочетания символов объединяются, поэтому незнакомые слова можно разложить на известные части, и рассматриваются библиотека Transformers от Hugging Face и её применение.
Ключевые идеи
Рекуррентные модели медленно обучаются и с трудом сохраняют информацию о длинных последовательностях.
Трансформер заменяет рекуррентность полносвязными слоями и благодаря распараллеливанию ускоряет обучение.
Самовнимание формирует для каждого токена запрос, ключ и значение, чтобы учитывать контекст других токенов.
Многоголовое внимание выполняет несколько независимых операций самовнимания и объединяет их результаты.
Позиционные представления добавляют информацию о порядке слов, которой нет в механизме самовнимания.
BERT предварительно обучается восстанавливать замаскированные слова, после чего его можно дообучить для конкретной задачи.
GPT использует декодер трансформера и генерирует текст, последовательно предсказывая следующие токены.
BPE разбивает текст на частотные сочетания символов, позволяя представлять незнакомые слова известными фрагментами.
Примеры вопросов
Почему авторегрессионной рекуррентной модели может быть трудно эффективно учитывать всю информацию из длинной последовательности при её обработке?
AПотому что рекуррентная модель не использует информацию о предыдущих токенах
BПотому что каждому токену обязательно назначается отдельная позиционная метка
CПотому что модель не может обрабатывать токены последовательно
DПотому что сведения о последовательности проходят через ограниченное по ёмкости промежуточное представление
Показать ответ
Верный ответ: D. При последовательной обработке модели приходится передавать накопленный контекст через ограниченное представление, которому может не хватить ёмкости для всей важной информации.
В архитектуре трансформера входное предложение обрабатывает энкодер, а декодер работает с его представлением. Известно, что энкодер устроен как последовательность повторяющихся одинаковых блоков. Какой вывод об устройстве этих частей обоснован?
AЭнкодер и декодер обязательно состоят из одинакового числа одинаковых блоков.
BДекодер формирует представление предложения до того, как его обрабатывает энкодер.
CЭнкодер содержит один блок, а декодер — последовательность повторяющихся блоков.
DЭнкодер состоит из повторяющихся блоков; сведений о внутреннем устройстве декодера недостаточно.
Показать ответ
Верный ответ: D. Указано, что энкодер построен из повторяющихся блоков, но устройство декодера не раскрыто, поэтому сравнивать их состав нельзя.