розмір ефекту
Наскільки великою є різниця чи зв'язок незалежно від обсягу вибірки, наприклад абсолютний приріст, відносний приріст чи d Коена.
Розмір ефекту відповідає на запитання «наскільки?», а не «чи є взагалі щось?». Це величина різниці чи зв'язку, виражена так, що вона не росте лише через те, що ви зібрали більше даних. p-значення змішує дві речі — величину ефекту та обсяг вибірки, а розмір ефекту виокремлює першу.
У продуктовій і маркетинговій роботі трапляється кілька поширених форм:
- абсолютний приріст: , у відсоткових пунктах;
- відносний приріст: , у відсотках;
- різниця середніх у природних одиницях: доларах середнього чека, хвилинах на сесію;
- стандартизована різниця, найчастіше d Коена: різниця середніх, поділена на об'єднане стандартне відхилення. Корисна, щоб порівнювати ефекти в метриках із різними одиницями або для розрахунку потужності;
- сила зв'язку: коефіцієнт кореляції , чи відношення шансів.
Чому значущість без розміру ефекту вводить в оману: «значущий» означає лише, що ефект, імовірно, не нульовий. На мільйоні користувачів приріст у 0,05 в. п. значущий, а на тисячі користувачів приріст у 1,6 в. п. може таким і не бути. Звіт, у якому написано тільки «p < 0,05», приховує, в якому з цих світів ви опинилися.
Тож завжди наводьте розмір ефекту разом із довірчим інтервалом, а тести плануйте від найменшого ефекту, який варто виявити, — мінімального виявлюваного ефекту (MDE). Саме він визначає, який обсяг вибірки потрібен для достатньої потужності. Для бізнесових рішень найзручніші природні одиниці (замовлення, долари, відсоткові пункти); стандартизовані міри допомагають там, де одиниці умовні, як-от бали в опитуваннях.
Приклад
Два тести Котокорму з одного кварталу:
Відносні прирости: і .
Статистично значущий лише банер, проте спостережуваний ефект нового чекауту у 16 разів більший ().
Переведімо обидва в гроші. Припустімо, чекаут щомісяця відвідують 100 000 людей, а середній чек — $50:
- новий чекаут: додаткових замовлень, це близько $80 000 на місяць;
- банер: додаткових замовлень, близько $5000 на місяць.
Правильне прочитання: ефект банера реальний, але невеликий. Ефект нового чекауту може бути великим, але поки невизначений (його 95% довірчий інтервал — приблизно від −0,5 до +3,7 в. п.), тож наступний крок — довший тест, а не вирок.
Типові помилки
- Повідомляти лише вердикт. «Значущий переможець, p = 0,01» без приросту та його інтервалу не дає керівництву змоги оцінити, чи це має значення.
- Плутати відсоткові пункти й відсотки. 5,0% → 5,5% — це +0,5 в. п. або +10% відносно. Щоразу уточнюйте, що саме маєте на увазі.
- Захоплюватися відносним приростом на мізерній базі. 0,1% → 0,2% — це «+100%», але за цим може стояти жменька замовлень.
- Довіряти ефекту з малого або передчасно зупиненого тесту. Тести, що ледве перетнули поріг значущості, зазвичай завищують справжній ефект («прокляття переможця»). Дивіться на весь довірчий інтервал і чекайте, що після запуску ефект дещо зменшиться.
- Оцінювати бізнесову цінність загальними ярликами. Назва «малий» для d = 0,2 нічого не каже про те, чи це варте грошей; переведіть ефект у замовлення або виручку.
Вивчити в курсі
- Потужність і розмір вибірки · Скільки користувачів потрібно експерименту, щоб виявити важливий для вас ефект.
- p-значення та значущість · Що насправді каже p-значення, чого воно не каже, і статистична значущість проти практичної.