Почему стратегия «остановили, как только стало значимо» часто приводит к завышенному размеру эффекта и наблюдаемому приросту?

AПотому что размер эффекта при ранней остановке всегда становится несмещённой оценкой истинного значения по выборке
BПотому что наблюдаемый прирост фиксируется ровно на истинном значении и больше не меняется при дальнейшем наборе данных
CПотому что при многократных подглядываниях вы чаще останавливаетесь на шумовом всплеске, и оценка эффекта систематически завышается
DПотому что рандомизация при ранней остановке делает дальнейший набор данных невозможным и отменяет результат теста
Правильный ответ. При многократных подглядываниях вы чаще фиксируете шумовой пик, поэтому оценка размера эффекта склонна завышаться.

Разбор

Если эксперимент останавливают в момент, когда метрика случайно оказалась выше обычного, именно это значение попадает в отчёт. При продолжении теста эффект часто «усредняется» и становится меньше. Поэтому без корректных процедур последовательного тестирования ранняя остановка может создать иллюзию большого прироста и привести к неверным решениям.

Можно заниматься бесплатно

Готовим вопросы…

Три вопроса по теме этой страницы, с объяснениями.

Тренировать A/B в браузере

Ещё вопросы по теме «Секвенциальное тестирование»