Эксперимент рандомизируется по пользователям, а метрика CTR считается как клики/показы. Как корректнее всего настроить bootstrap для оценки разницы вариантов?

AРесэмплировать отдельные показы случайно, игнорируя принадлежность пользователю и считая CTR по всему пулу
BРесэмплировать пользователей с возвращением в каждой группе и пересчитывать CTR как отношение суммы кликов к сумме показов
CРесэмплировать клики и показы независимо друг от друга и брать отношение средних значений в каждой реплике
DРесэмплировать только дни и считать CTR по дням, усредняя дневные значения для каждой из групп эксперимента
Правильный ответ. В bootstrap нужно ресэмплировать на уровне единицы рандомизации и пересчитывать отношение метрики как отношение сумм.

Разбор

Если рандомизация по пользователю, внутри пользователя наблюдения зависимы и это нужно сохранять. Поэтому в каждом бутстрап-репликате выбирают пользователей с возвращением, суммируют клики и показы по выбранным пользователям и считают CTR. Так получают эмпирическое распределение эффекта без жёстких предположений о форме распределения.

Можно заниматься бесплатно

Готовим вопросы…

Три вопроса по теме этой страницы, с объяснениями.

Тренировать A/B в браузере

Ещё вопросы по теме «Ratio-метрики и бутстреп»