нульова гіпотеза (H0)
Початкове твердження про відсутність різниці чи ефекту, наприклад «новий checkout не змінює конверсію».
Кожен статистичний критерій починається з двох конкурентних тверджень. Нульова гіпотеза — нудний варіант за замовчуванням: різниці немає, ефекту немає, нічого не відбувається. Альтернативна гіпотеза — те, що хотілося б підтвердити: різниця є. В A/B-тесті на конверсію:
Чому відштовхуються саме від «нічого не сталося»? Бо лише це твердження достатньо точне, щоб з ним рахувати. Припустивши, що правдива, можна з'ясувати, наскільки результати коливалися б суто через випадковість вибірки, і запитати, наскільки несподіваними в такому світі були б наші дані. Міра цієї несподіваності — p-значення. Якщо (зазвичай 0,05), дані погано узгоджуються з , і ми її відхиляємо на користь . Якщо ні — не маємо підстав відхилити .
Формулювання тут важливе. Те, що не відхилено, не доводить відсутності ефекту: просто цей критерій на цій вибірці не знайшов переконливих доказів. Як у суді: «вину не доведено» — ще не «невинний». Так само відхилення означає, що ефект, імовірно, не нульовий, але не що він великий чи вартий запуску; це вже питання розміру ефекту і практичної значущості.
Альтернатива буває двобічною («B відрізняється від A», безпечний варіант за замовчуванням) або однобічною («B краще за A»). Обирайте її, разом з і основною метрикою, до того, як побачите результати. Якщо обрати напрям уже після погляду на дані, імовірність хибнопозитивного результату, тобто помилки першого роду, непомітно подвоюється.
Приклад
Котокорм тестує редизайн чекауту: 1000 користувачів бачать старий чекаут (A), ще 1000 — новий (B).
Гіпотези, записані до запуску:
- : редизайн не змінює конверсію,
- : редизайн змінює конверсію, (двобічна, )
Результати: A — 52 конверсії з 1000 (5,2%), B — 68 з 1000 (6,8%). Різниця — 1,6 відсоткового пункту.
Перевірка за умови . Якби різниці справді не було, обидві групи мали б один коефіцієнт конверсії, який оцінюють за об'єднаними даними: . Стандартна похибка різниці:
отже . Двобічне p-значення — приблизно 0,13.
Рішення. , тож підстав відхилити немає. Правильний підсумок — не «редизайн не працює», а «такий розрив у 1,6 в. п. суто випадково виникає приблизно в 13% випадків, тож 1000 користувачів на групу поки не дають відповіді». 95% довірчий інтервал для різниці, приблизно від −0,5 до +3,7 в. п., досі містить нуль, але містить і відчутний виграш. Наступний крок — більший тест, а не вирок.
Типові помилки
- Казати «ми прийняли H0» чи «тест довів, що ефекту немає». Незначущий результат означає лише, що доказів забракло, часто через замалу вибірку.
- Формулювати гіпотези після погляду на дані. Якщо обрати однобічну H1 чи нову метрику, коли вже видно, куди пішли цифри, хибнопозитивних результатів стає більше.
- Сприймати «відхиляємо H0» як «H1 — це великий і важливий ефект». На величезних вибірках значущими стають дрібні різниці; дивіться на розмір ефекту і довірчий інтервал.
- Формулювати H0 про вибірку, а не про генеральну сукупність. Вибіркові середні такі, які є; гіпотези стосуються справжніх коефіцієнтів конверсії чи середніх, що за ними стоять.
- Перевіряти розмиту H1. «Редизайн щось покращить» — замало: до старту тесту потрібні метрика, напрям і, бажано, мінімальний ефект, який варто виявити.
Вивчити в курсі
- p-значення та значущість · Що насправді каже p-значення, чого воно не каже, і статистична значущість проти практичної.
- t-тест · Порівняння середніх двох груп і рішення, чи різниця більша за випадкову.
- Потужність і розмір вибірки · Скільки користувачів потрібно експерименту, щоб виявити важливий для вас ефект.
- ANOVA: порівняння багатьох груп · Перевірка трьох і більше варіантів одночасно без зростання хибнопозитивних результатів.