Главная › Лекции › Лекции одного дата-шрушера (ВШЭ) — Теория вероятностей и статистика

Как спланировать A/B-тест для долей

Лекция объясняет проверку гипотез в A/B-тестах, ошибки первого и второго рода, p-value и расчёт размера выборки.

Лекции одного дата-шрушера⏱ 107 минОткрыть на YouTube ↗
Пройти весь тест — 10 вопросов →

Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.

О чём лекция

A/B-тест рассматривается на примере сравнения долей: контрольная группа получает старый вариант продукта, тестовая — новый. Для проверки эффекта формулируют нулевую гипотезу об отсутствии изменений и альтернативу, например о росте доли положительных откликов. Решение принимают с помощью статистического критерия. Ошибка первого рода возникает при ошибочном отклонении нулевой гипотезы и контролируется уровнем значимости α; ошибка второго рода — при непринятии эффекта, который существует, и обозначается β. На примере проверки гипотезы о «честной» монетке показано, что мощность критерия равна 1 − β, а состоятельный критерий снижает β при росте объёма выборки.

Для долей используется асимптотический z-критерий, основанный на центральной предельной теореме: разность оценок долей нормальна при больших независимых выборках и конечной дисперсии. Обсуждаются односторонние и двусторонние альтернативы, критическая область и p-value как вероятность получить наблюдаемое или ещё более экстремальное значение при верной нулевой гипотезе. Затем разбирается планирование эксперимента: нужно заранее задать α, β и минимальный обнаруживаемый эффект (MDE), выбрать соотношение размеров групп и рассчитать необходимое число наблюдений. При малых эффектах выборка может стать настолько большой, что тест окажется практически невыполнимым; тогда используют более чувствительные метрики или специальные методы ускорения. Лекция также предупреждает о влиянии сезонности, редких событий и ошибочном сравнении отдельных доверительных интервалов вместо тестирования разности.

Ключевые идеи

Примеры вопросов

В A/B-эксперименте сравнивают долю пользователей, совершивших целевое действие: в группе B используется новая версия, в группе A — текущая. Обозначим разность долей как \(p_B-p_A\). Если проверяют предположение, что новая версия повышает конверсию, какая пара гипотез сформулирована корректно?

  1. A\(H_0: p_B-p_A>0\), \(H_1: p_B-p_A=0\)
  2. B\(H_0: p_B-p_A\ne0\), \(H_1: p_B-p_A=0\)
  3. C\(H_0: p_B-p_A=0\), \(H_1: p_B-p_A>0\)
  4. D\(H_0: p_B-p_A=0\), \(H_1: p_B-p_A<0\)
Показать ответ

Верный ответ: C. Поскольку проверяется улучшение новой версии, альтернативная гипотеза должна указывать положительное значение разности. Нулевая гипотеза фиксирует отсутствие различий.

В A/B-эксперименте нулевая гипотеза утверждает, что новая версия страницы не меняет конверсию по сравнению с контрольной. Исследователь отверг нулевую гипотезу и объявил новую версию эффективной, хотя на самом деле различия в конверсии нет. Какую ошибку совершили?

  1. AОшибку второго рода: не отвергли ложную нулевую гипотезу
  2. BОшибку измерения: перепутали конверсию с числом пользователей
  3. CОшибку первого рода: отвергли истинную нулевую гипотезу
  4. DОшибку выборки: использовали независимые группы
Показать ответ

Верный ответ: C. Ошибка первого рода возникает, когда истинную нулевую гипотезу ошибочно отвергают и принимают отсутствие эффекта за наличие эффекта.

Пройти весь тест — 10 вопросов →

Свой тест по любой лекции

Вставьте ссылку на видео — LearnReplay сделает тест на понимание.

Создать тест →