Перейти до змісту
КурсиУвійти
← Глосарій статистики

розмір ефекту

Наскільки великою є різниця чи зв'язок незалежно від обсягу вибірки, наприклад абсолютний приріст, відносний приріст чи d Коена.

Розмір ефекту відповідає на запитання «наскільки?», а не «чи є взагалі щось?». Це величина різниці чи зв'язку, виражена так, що вона не росте лише через те, що ви зібрали більше даних. p-значення змішує дві речі — величину ефекту та обсяг вибірки, а розмір ефекту виокремлює першу.

У продуктовій і маркетинговій роботі трапляється кілька поширених форм:

  • абсолютний приріст: pB−pAp_B - p_A, у відсоткових пунктах;
  • відносний приріст: pB−pApA\frac{p_B - p_A}{p_A}, у відсотках;
  • різниця середніх у природних одиницях: доларах середнього чека, хвилинах на сесію;
  • стандартизована різниця, найчастіше d Коена: різниця середніх, поділена на об'єднане стандартне відхилення. Корисна, щоб порівнювати ефекти в метриках із різними одиницями або для розрахунку потужності;
  • сила зв'язку: коефіцієнт кореляції rr, R2R^2 чи відношення шансів.

Чому значущість без розміру ефекту вводить в оману: «значущий» означає лише, що ефект, імовірно, не нульовий. На мільйоні користувачів приріст у 0,05 в. п. значущий, а на тисячі користувачів приріст у 1,6 в. п. може таким і не бути. Звіт, у якому написано тільки «p < 0,05», приховує, в якому з цих світів ви опинилися.

Тож завжди наводьте розмір ефекту разом із довірчим інтервалом, а тести плануйте від найменшого ефекту, який варто виявити, — мінімального виявлюваного ефекту (MDE). Саме він визначає, який обсяг вибірки потрібен для достатньої потужності. Для бізнесових рішень найзручніші природні одиниці (замовлення, долари, відсоткові пункти); стандартизовані міри допомагають там, де одиниці умовні, як-от бали в опитуваннях.

Приклад

Два тести Котокорму з одного кварталу:

Тест
Користувачів у групі
Контроль
Варіант
Абсолютний приріст
Відносний приріст
p
Новий чекаут
1000
5,2%
6,8%
+1,6 в. п.
+30,8%
≈ 0,13
Банер «безкоштовна доставка»
600 000
4,00%
4,10%
+0,10 в. п.
+2,5%
≈ 0,005

Відносні прирости: 6,8−5,25,2=1,65,2≈30,8%\frac{6{,}8 - 5{,}2}{5{,}2} = \frac{1{,}6}{5{,}2} \approx 30{,}8\% і 4,10−4,004,00=2,5%\frac{4{,}10 - 4{,}00}{4{,}00} = 2{,}5\%.

Статистично значущий лише банер, проте спостережуваний ефект нового чекауту у 16 разів більший (1,6/0,101{,}6 / 0{,}10).

Переведімо обидва в гроші. Припустімо, чекаут щомісяця відвідують 100 000 людей, а середній чек — $50:

  • новий чекаут: 100 000×0,016=1600100\,000 \times 0{,}016 = 1600 додаткових замовлень, це близько $80 000 на місяць;
  • банер: 100 000×0,001=100100\,000 \times 0{,}001 = 100 додаткових замовлень, близько $5000 на місяць.

Правильне прочитання: ефект банера реальний, але невеликий. Ефект нового чекауту може бути великим, але поки невизначений (його 95% довірчий інтервал — приблизно від −0,5 до +3,7 в. п.), тож наступний крок — довший тест, а не вирок.

Типові помилки

  • Повідомляти лише вердикт. «Значущий переможець, p = 0,01» без приросту та його інтервалу не дає керівництву змоги оцінити, чи це має значення.
  • Плутати відсоткові пункти й відсотки. 5,0% → 5,5% — це +0,5 в. п. або +10% відносно. Щоразу уточнюйте, що саме маєте на увазі.
  • Захоплюватися відносним приростом на мізерній базі. 0,1% → 0,2% — це «+100%», але за цим може стояти жменька замовлень.
  • Довіряти ефекту з малого або передчасно зупиненого тесту. Тести, що ледве перетнули поріг значущості, зазвичай завищують справжній ефект («прокляття переможця»). Дивіться на весь довірчий інтервал і чекайте, що після запуску ефект дещо зменшиться.
  • Оцінювати бізнесову цінність загальними ярликами. Назва «малий» для d = 0,2 нічого не каже про те, чи це варте грошей; переведіть ефект у замовлення або виручку.

Вивчити в курсі