рівень значущості (α)
Поріг для відхилення H0, що фіксується до тесту, зазвичай 0,05; дорівнює допустимій частці хибнопозитивних результатів.
Рівень значущості, позначається α (альфа), — це межа, яку проводять до тесту: якщо p-значення менше за неї, результат називають статистично значущим. Зазвичай обирають α = 0,05, тобто 5%.
Це також частка хибних тривог, яку ви погоджуєтеся прийняти. Якщо різниці насправді немає, тест з α = 5% все одно «знайде» її приблизно в 5% випадків, суто випадково. Якщо знизити α до 1%, хибних тривог стане менше, але для виявлення справжнього ефекту знадобиться більше даних; якщо підняти до 10%, ви вловите більше справжніх ефектів і більше хибних.
Тож рівень — це бізнес-рішення, а не закон природи. Беріть суворіший рівень, коли хибна перемога дорога або її важко скасувати, і м'якший — для дешевих змін, які легко відкотити. Найважливіше — коли ви його обираєте: до того, як подивитеся на дані. Обрати α, побачивши p = 0,07 («візьмімо 10%»), означає перетворити поріг на прикрасу.
Якщо порівнянь багато і кожне на рівні 5%, шанс, що хоча б одне дасть хибну тривогу, значно перевищує 5%, тому в тестах із кількома варіантами рівень коригують.
Приклад
Котокорм порівнює дві версії оформлення замовлення: 120 замовлень із 3000 проти 150 із 3000. Двобічне p-значення — 0,062.
- За α = 5% результат не значущий: 0,062 > 0,05.
- За α = 10% він був би значущим: 0,062 < 0,10.
Дані ті самі; змістилася лише межа. Тому команда записує α = 5% у план тесту до запуску і не переглядає його, побачивши 0,062.
Типові помилки
- Обирати α, побачивши p-значення. Поріг захищає, лише якщо його зафіксовано заздалегідь.
- Вважати α ймовірністю того, що результат хибний. Це частка хибних тривог за відсутності ефекту, а не ймовірність того, що саме ця перемога хибна.
- Сприймати 0,05 як прірву. p = 0,049 і p = 0,051 — майже однакові докази.
- Лишати 5% для кожного порівняння в тесті з кількома варіантами. Загальна частка хибних тривог зростає з кожним порівнянням.
Вивчити в курсі
- t-тест · Порівняння середніх двох груп і рішення, чи різниця більша за випадкову.
- p-значення та значущість · Що насправді каже p-значення, чого воно не каже, і статистична значущість проти практичної.
- Потужність і розмір вибірки · Скільки користувачів потрібно експерименту, щоб виявити важливий для вас ефект.
- Пастки: підглядання, множинні порівняння, ефект новизни · Найпоширеніші способи, якими реальні A/B-тести йдуть не так, і як цього уникнути.