Лекция разбирает устройство MLP в трансформерах и показывает, как они могут связывать имя человека с фактом, а также почему реальные признаки трудно выделить.
Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.
В лекции рассматривается, как блоки многослойного перцептрона (MLP) могут участвовать в хранении фактов. На условном примере «Майкл Джордан играет в баскетбол» объясняется, что векторы токенов проходят через два линейных преобразования с нелинейной функцией ReLU между ними. Первое преобразование выявляет признаки входного вектора: строки матрицы можно понимать как направления, с которыми он сопоставляется. Если сочетание признаков имени активирует нейрон, второе преобразование добавляет к вектору направление, соответствующее баскетболу. Результат прибавляется к исходному вектору; операция применяется параллельно к каждому токену.
Эта схема — упрощённая модель, а не полное объяснение того, как устроена память реальных языковых моделей. В GPT-3 на MLP приходится около 116 млрд параметров — примерно две трети всех параметров модели. При этом отдельные нейроны редко соответствуют одному ясному признаку. Гипотеза суперпозиции предполагает, что множество признаков кодируется перекрывающимися, почти перпендикулярными направлениями. В высоких размерностях таких направлений может быть экспоненциально больше, чем самих измерений, поэтому модель потенциально способна представлять больше идей. Тогда признак может проявляться не в одном нейроне, а в сочетании активаций; для его поиска применяют, например, разреженные автоэнкодеры.
Верный ответ: D. Если направления связаны с типами смысла, то ориентация вектора может нести семантическую информацию.
Верный ответ: C. В этой модели MLP рассматривается как дополнительная ёмкость, в которой могут храниться фактические сведения; пример с Майклом Джорданом иллюстрирует эту роль.
Вставьте ссылку на видео — LearnReplay сделает тест на понимание.
Создать тест →