Перейти до змісту
КурсиУвійти
← Глосарій статистики

d Коена

Стандартизований розмір ефекту: різниця середніх, поділена на об'єднане стандартне відхилення.

d Коена виражає різницю між середніми двох груп у стандартних відхиленнях:

d=xˉ1−xˉ2sp,sp=(n1−1)s12+(n2−1)s22n1+n2−2d = \frac{\bar x_1 - \bar x_2}{s_p}, \qquad s_p = \sqrt{\frac{(n_1 - 1)s_1^2 + (n_2 - 1)s_2^2}{n_1 + n_2 - 2}}

Тут sps_p — об'єднане стандартне відхилення, зважене поєднання розкиду обох груп. Якщо групи однакового розміру, формула спрощується до sp=(s12+s22)/2s_p = \sqrt{(s_1^2 + s_2^2)/2}. d = 0,5 означає, що середні віддалені одне від одного на половину типового розкиду.

d не має одиниць виміру, тож можна порівнювати ефекти на зовсім різних метриках (сума замовлення в доларах, тривалість сесії в хвилинах, оцінка задоволеності від 1 до 10) і використовувати його в розрахунках потужності. Для t-критерію Стьюдента для незалежних вибірок при α = 0,05 і потужності 80% потрібно приблизно n≈16/d2n \approx 16 / d^2 користувачів у кожній групі: удвічі менший d — учетверо більша вибірка.

Коен запропонував орієнтовні пороги: 0,2 — малий ефект, 0,5 — середній, 0,8 — великий. Він задумував їх як запасний варіант, коли кращих орієнтирів немає, а не як оцінку цінності. У продуктовій аналітиці d = 0,05 на виручці з користувача може коштувати мільйони, а d = 1 на «марнославній» метриці — нічого, тож завжди перекладайте результат і в природні одиниці.

d тісно пов'язаний зі статистикою t. Для рівних груп розміру nn маємо t=d×n/2t = d \times \sqrt{n/2}: t зростає з вибіркою, а d — ні. Саме тому t (і p-значення) відповідає на питання «чи це реально?», а d — «наскільки це велике?». Для конверсій краще наводити приріст у відсоткових пунктах (або h Коена — аналог для часток).

Приклад

Тест віджета допродажу в Котокормі: по 10 замовлень у групі.

  • Контроль: середнє $42,50, s_1 \approx \3{,}03(дисперсія(дисперсія\approx 9{,}17$)
  • Віджет: середнє $52,50, s_2 \approx \3{,}37(дисперсія(дисперсія\approx 11{,}39$)
  1. Об'єднане стандартне відхилення (групи рівні): s_p = \sqrt{\frac{9{,}17 + 11{,}39}{2}} = \sqrt{10{,}28} \approx \3{,}21$.
  2. d Коена: d=52,50−42,503,21=10,003,21≈3,12d = \frac{52{,}50 - 42{,}50}{3{,}21} = \frac{10{,}00}{3{,}21} \approx 3{,}12.
  3. Звірка з t-критерієм: t=3,12×10/2=3,12×2,236≈6,97t = 3{,}12 \times \sqrt{10/2} = 3{,}12 \times 2{,}236 \approx 6{,}97 — те саме t, що й в уроці про t-критерій.

d = 3,1 — величезний ефект, далеко за «великою» межею 0,8. Він такий великий, бо суми замовлень у цій маленькій синтетичній вибірці майже не розкидані, тож різниця у $10 — це понад три типові розкиди.

А тепер уявімо реальні замовлення Котокорму, де стандартне відхилення суми замовлення ближче до $25. Та сама різниця у $10 дає d=10/25=0,4d = 10 / 25 = 0{,}4 — між малим і середнім ефектом. Щоб спланувати тест, який його виявить: n≈16/0,42=16/0,16=100n \approx 16 / 0{,}4^2 = 16 / 0{,}16 = 100 замовлень у кожній групі.

Типові помилки

  • Сприймати 0,2 / 0,5 / 0,8 як закон. Це орієнтовні домовленості з поведінкових досліджень, а не міра бізнесової цінності.
  • Ділити на стандартну похибку замість стандартного відхилення. Стандартна похибка зменшується з обсягом вибірки, тож виходить роздутий «d», який насправді є замаскованою статистикою t.
  • Порівнювати d між дуже різними сукупностями. У вузькому сегменті (скажімо, лише клієнти з підпискою) стандартне відхилення менше, і та сама різниця в доларах виглядає як більший d.
  • Ігнорувати асиметрію та викиди. Кілька дуже великих замовлень роздувають стандартне відхилення й зменшують d; для виручки з «важкими хвостами» варто взяти логарифмічну шкалу, усічене середнє або ранговий показник.
  • Рахувати d для конверсії. Для результатів «так/ні» наводьте приріст у відсоткових пунктах (або h Коена), а не d.