Главная › Лекции › Лекции одного дата-шрушера (ВШЭ) — Анализ данных на Python

Анализ данных на Python: линейная регрессия

Лекция объясняет линейную регрессию, функции потерь, градиентный спуск и построение прогнозов в Python.

Лекции одного дата-шрушера⏱ 72 минОткрыть на YouTube ↗
Пройти весь тест — 9 вопросов →

Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.

О чём лекция

Лекция вводит линейную регрессию как базовый инструмент анализа данных и машинного обучения. Разбирается различие между прогнозированием будущих значений и интерпретацией зависимости между переменными: в первом случае важнее качество прогноза, во втором — корректность и интерпретируемость коэффициентов. На простом примере показывается модель без свободного члена, где число решённых задач зависит от количества съеденных конфет.

Затем рассматриваются функции потерь MAE и MSE. Объясняется, почему простое усреднение ошибок приводит к взаимному сокращению положительных и отрицательных отклонений, а модуль или квадрат ошибки устраняет эту проблему. Для MSE коэффициент линейной модели находится аналитически через минимизацию функции потерь; для более сложных функций предлагается использовать градиентный спуск.

В практической части линейная регрессия строится в statsmodels и scikit-learn на данных о продажах и рекламных расходах. Показаны интерпретация коэффициентов, прогнозирование, логарифмирование переменных для описания убывающей отдачи от рекламы и метрика R². В завершение обсуждаются ограничения R² и переобучение: высокая точность на обучающей выборке не гарантирует хороших прогнозов, поэтому данные следует разделять на обучающую и тестовую части.

Ключевые идеи

Примеры вопросов

При выборе модели машинного обучения для задачи, где главный результат — получить как можно более точный прогноз и использовать его на практике, а объяснение влияния каждого признака не является целью, какой критерий должен иметь наибольший приоритет?

  1. AМинимальное число признаков в модели
  2. BПростота интерпретации коэффициентов
  3. CКачество получаемых прогнозов
  4. DВозможность представить модель в виде линейного уравнения
Показать ответ

Верный ответ: C. Если задача ориентирована на практическое прогнозирование, модель прежде всего оценивают по тому, насколько хорошо она предсказывает целевой показатель; прозрачность объяснения становится вторичной.

При оценке линейной регрессии для каждого объекта сравнивают фактическое значение целевой переменной y с прогнозом модели ŷ. Какой показатель измеряет среднюю величину ошибки в исходных единицах, усредняя модули разностей |y − ŷ| по всем объектам?

  1. AСредняя абсолютная ошибка (MAE)
  2. BДоля объектов, для которых прогноз полностью совпал с фактическим значением
  3. CСредняя квадратичная ошибка (MSE)
  4. DСумма ошибок со знаками, которая может взаимно сократиться
Показать ответ

Верный ответ: A. MAE усредняет абсолютные отклонения прогнозов от фактических значений, поэтому показывает типичный размер ошибки без взаимного погашения положительных и отрицательных отклонений.

Пройти весь тест — 9 вопросов →

Свой тест по любой лекции

Вставьте ссылку на видео — LearnReplay сделает тест на понимание.

Создать тест →