Главная › Лекции › Лекции одного дата-шрушера (ВШЭ) — Глубокое обучение

Трансформеры, BERT и GPT: устройство и применение

Лекция объясняет устройство трансформера, механизм внимания и различия между BERT и GPT, а также знакомит с позиционными эмбеддингами и токенизацией BPE.

Лекции одного дата-шрушера⏱ 90 минОткрыть на YouTube ↗
Пройти весь тест — 9 вопросов →

Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.

О чём лекция

Лекция начинается с причин, по которым трансформеры пришли на смену рекуррентным сетям в задачах работы с последовательностями: они быстрее обучаются и позволяют распараллеливать вычисления. Центральный механизм архитектуры — самовнимание. Для каждого токена модель формирует запрос, ключ и значение, сопоставляет запросы с ключами, вычисляет веса внимания и объединяет значения в контекстное представление. Несколько независимых «голов» внимания помогают учитывать разные отношения между словами. Поскольку самовнимание само по себе не кодирует порядок слов, к представлениям добавляют позиционную информацию.

Затем разбираются блоки трансформера: энкодер последовательно обогащает представления, а декодер использует маскированное внимание, чтобы не заглядывать в будущие токены, и взаимодействует с выходами энкодера. Остаточные связи и нормализация помогают строить глубокие и устойчиво обучаемые модели. BERT использует часть энкодера и предварительно обучается, в частности, восстанавливая замаскированные слова; затем его дообучают для конкретных задач. GPT использует декодер и генерирует текст по одному токену, предсказывая следующий. В лекции также упоминаются модели для длинных последовательностей и улучшения BERT, включая RoBERTa. В завершение объясняется токенизация BPE: частые сочетания символов объединяются, поэтому незнакомые слова можно разложить на известные части, и рассматриваются библиотека Transformers от Hugging Face и её применение.

Ключевые идеи

Примеры вопросов

Почему авторегрессионной рекуррентной модели может быть трудно эффективно учитывать всю информацию из длинной последовательности при её обработке?

  1. AПотому что рекуррентная модель не использует информацию о предыдущих токенах
  2. BПотому что каждому токену обязательно назначается отдельная позиционная метка
  3. CПотому что модель не может обрабатывать токены последовательно
  4. DПотому что сведения о последовательности проходят через ограниченное по ёмкости промежуточное представление
Показать ответ

Верный ответ: D. При последовательной обработке модели приходится передавать накопленный контекст через ограниченное представление, которому может не хватить ёмкости для всей важной информации.

В архитектуре трансформера входное предложение обрабатывает энкодер, а декодер работает с его представлением. Известно, что энкодер устроен как последовательность повторяющихся одинаковых блоков. Какой вывод об устройстве этих частей обоснован?

  1. AЭнкодер и декодер обязательно состоят из одинакового числа одинаковых блоков.
  2. BДекодер формирует представление предложения до того, как его обрабатывает энкодер.
  3. CЭнкодер содержит один блок, а декодер — последовательность повторяющихся блоков.
  4. DЭнкодер состоит из повторяющихся блоков; сведений о внутреннем устройстве декодера недостаточно.
Показать ответ

Верный ответ: D. Указано, что энкодер построен из повторяющихся блоков, но устройство декодера не раскрыто, поэтому сравнивать их состав нельзя.

Пройти весь тест — 9 вопросов →

Свой тест по любой лекции

Вставьте ссылку на видео — LearnReplay сделает тест на понимание.

Создать тест →