Лекция объясняет, как внимание связывает токены контекста, обновляет их представления и помогает трансформеру предсказывать следующий токен.
Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.
Трансформер разбивает текст на токены и сопоставляет каждому векторное представление — эмбеддинг. Изначально оно отражает слово и его позицию, но не учитывает контекст. Механизм внимания позволяет уточнять значение токена по окружающим словам: например, различать смыслы слова «крот» или учитывать, что башня названа Эйфелевой и является миниатюрной. Внимание также передаёт информацию между позициями, чтобы итоговое представление последнего токена содержало сведения, важные для предсказания следующего.
В одной голове внимания из эмбеддингов с помощью обучаемых матриц получают запросы и ключи. Их скалярные произведения показывают, какие токены связаны; после softmax оценки становятся весами, по которым складываются векторы значений. Полученная сумма добавляется к исходному эмбеддингу и обогащает его контекстом. В авторегрессионных моделях маска не даёт токенам учитывать более поздние позиции: перед softmax соответствующие оценки заменяют на минус бесконечность.
Внимание состоит из множества голов, работающих параллельно: каждая может усваивать свой тип связей и предлагать отдельное изменение эмбеддинга. Несколько таких блоков чередуются с многослойными перцептронами, поэтому представления постепенно становятся сложнее и могут кодировать более абстрактный контекст. Размер матрицы внимания растёт пропорционально квадрату длины контекста, что затрудняет увеличение окна. Важное преимущество механизма — параллелизуемость вычислений.
Верный ответ: C. Векторное представление может кодировать смысл через геометрическую ориентацию: значение имеет не только сам факт наличия вектора.
Верный ответ: C. Матрица W_Q проецирует исходное представление токена в пространство запросов; нормировка и маскирование сами по себе не создают запрос.
Вставьте ссылку на видео — LearnReplay сделает тест на понимание.
Создать тест →