Главная › Лекции › Лекции одного дата-шрушера (ВШЭ) — Машинное обучение

Линейные модели: переобучение, регуляризация и практическое обучение

Лекция объясняет устройство линейных моделей, функции потерь, регуляризацию, кросс-валидацию и реализацию моделей в scikit-learn.

Лекции одного дата-шрушера⏱ 78 минОткрыть на YouTube ↗
Пройти весь тест — 9 вопросов →

Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.

О чём лекция

Лекция начинается с формализации линейной модели: прогноз представляется как свободный член плюс взвешенная сумма признаков. Обсуждаются функции потерь MSE и MAE, их чувствительность к выбросам и проблемы дифференцируемости. На примере полиномиальной регрессии показано, как увеличение числа степеней приводит сначала к более гибкой модели, а затем к переобучению и запоминанию обучающей выборки.

Для борьбы с переобучением вводится регуляризация: L2-регуляризация соответствует Ridge, а L1-регуляризация — Lasso. Штраф за большие коэффициенты ограничивает чрезмерную изгибаемость модели; свободный член обычно не регуляризуют. Разбираются различия параметров и гиперпараметров, подбор силы регуляризации с помощью grid search, random search и кросс-валидации.

Практическая часть посвящена работе с данными о недвижимости в scikit-learn. Рассматриваются разделение на обучающую и тестовую выборки, выбросы, логарифмирование признаков и целевой переменной, стандартизация, предотвращение утечки данных, пайплайны и оценка качества. Подчеркивается, что стандартизатор нужно обучать только на трейне, а тестовую выборку использовать исключительно для финальной проверки модели.

Ключевые идеи

Примеры вопросов

В учебном примере сначала программно создают набор точек по известному правилу, связанному с косинусом. Какую роль такой шаг играет при изучении переобучения линейной регрессионной модели?

  1. AОн автоматически устраняет переобучение, поскольку данные получены по математическому правилу
  2. BОн создаёт контролируемые данные, на которых можно сравнить способность модели улавливать закономерность и запоминать отдельные наблюдения
  3. CОн заменяет настройку модели точным вычислением всех её параметров без использования данных
  4. DОн нужен только для преобразования целевого признака в категориальный формат
Показать ответ

Верный ответ: B. Известное правило генерации даёт контролируемую зависимость. Поэтому легче отделить изучение общей закономерности от подгонки под конкретные точки.

При моделировании зависимости одного целевого показателя от одного признака базовая модель имеет вид \(y=w_0+w_1x\). Как корректно расширить её до полиномиальной регрессии, сохранив линейность модели по оцениваемым коэффициентам?

  1. AЗаменить целевую переменную на случайную величину, чтобы модель могла описывать любые зависимости
  2. BПодставить коэффициенты в нелинейные функции и отказаться от представления модели через сумму слагаемых
  3. CОставить только свободный член \(w_0\), поскольку степени признака не влияют на результат
  4. DДобавить признаки \(x^2, x^3\) и соответствующие им коэффициенты, например \(y=w_0+w_1x+w_2x^2+w_3x^3\)
Показать ответ

Верный ответ: D. Полиномиальная регрессия расширяет набор признаков степенями исходного признака. При этом выражение остаётся линейным относительно коэффициентов, которые обучает модель.

Пройти весь тест — 9 вопросов →

Свой тест по любой лекции

Вставьте ссылку на видео — LearnReplay сделает тест на понимание.

Создать тест →