d Коена
Стандартизований розмір ефекту: різниця середніх, поділена на об'єднане стандартне відхилення.
d Коена виражає різницю між середніми двох груп у стандартних відхиленнях:
Тут — об'єднане стандартне відхилення, зважене поєднання розкиду обох груп. Якщо групи однакового розміру, формула спрощується до . d = 0,5 означає, що середні віддалені одне від одного на половину типового розкиду.
d не має одиниць виміру, тож можна порівнювати ефекти на зовсім різних метриках (сума замовлення в доларах, тривалість сесії в хвилинах, оцінка задоволеності від 1 до 10) і використовувати його в розрахунках потужності. Для t-критерію Стьюдента для незалежних вибірок при α = 0,05 і потужності 80% потрібно приблизно користувачів у кожній групі: удвічі менший d — учетверо більша вибірка.
Коен запропонував орієнтовні пороги: 0,2 — малий ефект, 0,5 — середній, 0,8 — великий. Він задумував їх як запасний варіант, коли кращих орієнтирів немає, а не як оцінку цінності. У продуктовій аналітиці d = 0,05 на виручці з користувача може коштувати мільйони, а d = 1 на «марнославній» метриці — нічого, тож завжди перекладайте результат і в природні одиниці.
d тісно пов'язаний зі статистикою t. Для рівних груп розміру маємо : t зростає з вибіркою, а d — ні. Саме тому t (і p-значення) відповідає на питання «чи це реально?», а d — «наскільки це велике?». Для конверсій краще наводити приріст у відсоткових пунктах (або h Коена — аналог для часток).
Приклад
Тест віджета допродажу в Котокормі: по 10 замовлень у групі.
- Контроль: середнє $42,50, s_1 \approx \3{,}03\approx 9{,}17$)
- Віджет: середнє $52,50, s_2 \approx \3{,}37\approx 11{,}39$)
- Об'єднане стандартне відхилення (групи рівні): s_p = \sqrt{\frac{9{,}17 + 11{,}39}{2}} = \sqrt{10{,}28} \approx \3{,}21$.
- d Коена: .
- Звірка з t-критерієм: — те саме t, що й в уроці про t-критерій.
d = 3,1 — величезний ефект, далеко за «великою» межею 0,8. Він такий великий, бо суми замовлень у цій маленькій синтетичній вибірці майже не розкидані, тож різниця у $10 — це понад три типові розкиди.
А тепер уявімо реальні замовлення Котокорму, де стандартне відхилення суми замовлення ближче до $25. Та сама різниця у $10 дає — між малим і середнім ефектом. Щоб спланувати тест, який його виявить: замовлень у кожній групі.
Типові помилки
- Сприймати 0,2 / 0,5 / 0,8 як закон. Це орієнтовні домовленості з поведінкових досліджень, а не міра бізнесової цінності.
- Ділити на стандартну похибку замість стандартного відхилення. Стандартна похибка зменшується з обсягом вибірки, тож виходить роздутий «d», який насправді є замаскованою статистикою t.
- Порівнювати d між дуже різними сукупностями. У вузькому сегменті (скажімо, лише клієнти з підпискою) стандартне відхилення менше, і та сама різниця в доларах виглядає як більший d.
- Ігнорувати асиметрію та викиди. Кілька дуже великих замовлень роздувають стандартне відхилення й зменшують d; для виручки з «важкими хвостами» варто взяти логарифмічну шкалу, усічене середнє або ранговий показник.
- Рахувати d для конверсії. Для результатів «так/ні» наводьте приріст у відсоткових пунктах (або h Коена), а не d.