Главная › Лекции › Лекции одного дата-шрушера (ВШЭ) — Теория вероятностей и статистика

Ratio-метрики: дельта-метод, линеаризация и бакетизация

Лекция объясняет, как тестировать ratio-метрики и строить для них интервалы с помощью дельта-метода, линеаризации и бакетизации.

Лекции одного дата-шрушера⏱ 96 минОткрыть на YouTube ↗
Пройти весь тест — 10 вопросов →

Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.

О чём лекция

Сначала лекция связывает A/B-тестирование с ROC-кривой. Ось ложноположительных решений соответствует ошибке первого рода α, а мощность критерия — величине 1−β. При фиксированном размере выборки между ними существует компромисс. Также объясняется поведение p-value: при верной нулевой гипотезе оно имеет равномерное распределение, а при альтернативе концентрируется около нуля. Это позволяет проверять корректность критерия по A/A-тестам.

Затем вводятся ratio-метрики — отношения случайных величин или средних, например CTR, средняя длина сессии и risk ratio. Числитель и знаменатель таких метрик часто зависимы, поэтому стандартные методы для обычных средних могут работать некорректно. Для построения доверительных интервалов разбирается дельта-метод, включая многомерный случай, и показываются два подхода к risk ratio: работа с отношением напрямую и логарифмическое преобразование с последующим обратным переходом через экспоненту. Оба метода являются приближёнными и требуют небольшой дисперсии.

Также рассматриваются линеаризация и бакетизация. Линеаризация превращает ratio-метрику в обычную пользовательскую метрику через регрессию числителя на знаменатель, сохраняя направление эффекта и статистическую значимость. При бакетизации пользователей объединяют в группы, считают метрику по каждому бакету и усредняют результаты; метод чувствителен к размерам бакетов и внутрибакетной дисперсии. На симуляциях сравниваются дельта-метод, бутстрэп, критерий Манна—Уитни и другие подходы; подчёркивается необходимость проверять их на данных конкретного сервиса.

Ключевые идеи

Примеры вопросов

В бинарном A/B-тесте для оценки качества классификации получена таблица ошибок: истинно положительных результатов — 80, ложно отрицательных — 20, ложно положительных — 15, истинно отрицательных — 885. Чему равна пара показателей false positive rate и recall?

  1. A20% и 85%
  2. B15% и 8%
  3. C1,5% и 80%
  4. D1,67% и 80%
Показать ответ

Верный ответ: D. False positive rate рассчитывается как FP/(FP+TN) = 15/(15+885) = 1,67%. Recall — как TP/(TP+FN) = 80/(80+20) = 80%.

В статистическом A/B-тесте нулевая гипотеза неверна, а выбранный тест способен обнаруживать существующее различие. Какое распределение p-value наиболее вероятно получить при многократном повторении эксперимента на больших выборках?

  1. AБольшинство p-value будет равномерно распределено от 0 до 1, поэтому доля отклонений нулевой гипотезы будет примерно равна α
  2. Bp-value будут систематически близки к α, поэтому результат теста почти всегда окажется на границе решения
  3. CВсе p-value будут равны единице, поскольку нулевая гипотеза используется только как контрольная модель
  4. DБольшинство p-value будет близко к нулю, поэтому нулевую гипотезу обычно будут отвергать при уровне значимости α
Показать ответ

Верный ответ: D. При истинной альтернативе тест чаще фиксирует реальное различие, что приводит к малым p-value и частому отклонению нулевой гипотезы.

Пройти весь тест — 10 вопросов →

Свой тест по любой лекции

Вставьте ссылку на видео — LearnReplay сделает тест на понимание.

Создать тест →