Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.
О чём лекция
Большая языковая модель генерирует текст, многократно предсказывая следующий токен и выбирая его из распределения вероятностей. Трансформер обрабатывает последовательность токенов: сначала каждому соответствует вектор, затем блоки внимания обновляют векторы с учётом контекста, а многослойные перцептроны преобразуют каждый из них. Эти операции повторяются, после чего модель использует последний вектор, чтобы оценить возможные продолжения. Чат-бот можно построить, задав модели инструкцию и вопрос пользователя как начало диалога.
Параметры модели — обучаемые веса, организованные преимущественно в матрицы; вычисления с ними сводятся главным образом к умножению матриц на векторы. В обучаемой матрице эмбеддингов каждому токену соответствует вектор. Векторы могут отражать смысловые сходства и отношения, а в ходе обработки обогащаются информацией о контексте. Размер контекстного окна ограничивает объём текста, доступный модели при предсказании.
В конце модели матрица преобразует последний вектор в значения для токенов словаря — логиты. Функция softmax превращает их в вероятности: большие значения получают больший вес, но менее вероятные варианты тоже могут быть выбраны. Температура регулирует случайность выбора: при низкой модель чаще выбирает наиболее вероятный токен, при высокой — чаще рассматривает менее вероятные.
Ключевые идеи
Языковая модель-трансформер предсказывает распределение вероятностей для следующего токена, а генерация возникает при повторении этого шага.
Трансформер разбивает вход на токены, представляет их векторами и многократно обрабатывает блоками внимания и многослойными перцептронами.
В глубоком обучении параметры модели подстраивают по примерам, а обработка данных строится как последовательность преобразований числовых массивов.
Матрица эмбеддингов преобразует токены в векторы, чьи направления могут кодировать смысловые свойства и отношения.
Векторы токенов по мере обработки впитывают контекст, а доступная модели длина последовательности ограничена размером контекстного окна.
На выходе матрица преобразует последний вектор в логиты для токенов, а softmax переводит их в вероятности.
Температура меняет распределение вероятностей: высокая делает выбор разнообразнее, низкая усиливает преимущество наиболее вероятного токена.
Примеры вопросов
При генерации текста языковая модель получает начальную строку и затем несколько раз предсказывает и выбирает продолжение. Как формируется текст в таком процессе?
AКаждое новое продолжение добавляется к уже созданному тексту и становится частью контекста для следующего шага.
BМодель дописывает текст по заранее заданному сценарию, не используя выбранные продолжения.
CМодель один раз выбирает весь готовый текст, а последующие шаги только отображают его по частям.
DПосле каждого шага начальная строка заменяется новым продолжением, поэтому предыдущий текст не влияет на генерацию.
Показать ответ
Верный ответ: A. Генерация продолжается шаг за шагом: выбранное продолжение присоединяется к исходному тексту, и модель использует обновлённый текст для следующего предсказания.
В трансформере каждому слову сопоставляют числовой вектор, представляющий его смысл. Если два слова близки по значению, какое отношение между их векторами ожидается в многомерном пространстве?
AОни находятся на максимально возможном расстоянии.
BИх расположение определяется только длиной слов.
CОни обязательно совпадают по всем координатам.
DОни расположены близко друг к другу.
Показать ответ
Верный ответ: D. Векторное представление отражает смысловые связи: близкие по значению слова оказываются рядом в пространстве векторов.