Перейти до змісту
КурсиУвійти
← Глосарій статистики

нульова гіпотеза (H0)

Початкове твердження про відсутність різниці чи ефекту, наприклад «новий checkout не змінює конверсію».

Кожен статистичний критерій починається з двох конкурентних тверджень. Нульова гіпотеза H0H_0 — нудний варіант за замовчуванням: різниці немає, ефекту немає, нічого не відбувається. Альтернативна гіпотеза H1H_1 — те, що хотілося б підтвердити: різниця є. В A/B-тесті на конверсію:

H0:pB=pAH1:pB≠pAH_0: p_B = p_A \qquad H_1: p_B \neq p_A

Чому відштовхуються саме від «нічого не сталося»? Бо лише це твердження достатньо точне, щоб з ним рахувати. Припустивши, що H0H_0 правдива, можна з'ясувати, наскільки результати коливалися б суто через випадковість вибірки, і запитати, наскільки несподіваними в такому світі були б наші дані. Міра цієї несподіваності — p-значення. Якщо p<αp < \alpha (зазвичай 0,05), дані погано узгоджуються з H0H_0, і ми її відхиляємо на користь H1H_1. Якщо ні — не маємо підстав відхилити H0H_0.

Формулювання тут важливе. Те, що H0H_0 не відхилено, не доводить відсутності ефекту: просто цей критерій на цій вибірці не знайшов переконливих доказів. Як у суді: «вину не доведено» — ще не «невинний». Так само відхилення H0H_0 означає, що ефект, імовірно, не нульовий, але не що він великий чи вартий запуску; це вже питання розміру ефекту і практичної значущості.

Альтернатива буває двобічною («B відрізняється від A», безпечний варіант за замовчуванням) або однобічною («B краще за A»). Обирайте її, разом з α\alpha і основною метрикою, до того, як побачите результати. Якщо обрати напрям уже після погляду на дані, імовірність хибнопозитивного результату, тобто помилки першого роду, непомітно подвоюється.

Приклад

Котокорм тестує редизайн чекауту: 1000 користувачів бачать старий чекаут (A), ще 1000 — новий (B).

Гіпотези, записані до запуску:

  • H0H_0: редизайн не змінює конверсію, pB=pAp_B = p_A
  • H1H_1: редизайн змінює конверсію, pB≠pAp_B \neq p_A (двобічна, α=0,05\alpha = 0{,}05)

Результати: A — 52 конверсії з 1000 (5,2%), B — 68 з 1000 (6,8%). Різниця — 1,6 відсоткового пункту.

Перевірка за умови H0H_0. Якби різниці справді не було, обидві групи мали б один коефіцієнт конверсії, який оцінюють за об'єднаними даними: 120/2000=0,06120 / 2000 = 0{,}06. Стандартна похибка різниці:

SE=0,06×0,94×(11000+11000)=0,0001128≈0,0106SE = \sqrt{0{,}06 \times 0{,}94 \times \left(\tfrac{1}{1000} + \tfrac{1}{1000}\right)} = \sqrt{0{,}0001128} \approx 0{,}0106

отже z=0,016/0,0106≈1,51z = 0{,}016 / 0{,}0106 \approx 1{,}51. Двобічне p-значення — приблизно 0,13.

Рішення. 0,13>0,050{,}13 > 0{,}05, тож підстав відхилити H0H_0 немає. Правильний підсумок — не «редизайн не працює», а «такий розрив у 1,6 в. п. суто випадково виникає приблизно в 13% випадків, тож 1000 користувачів на групу поки не дають відповіді». 95% довірчий інтервал для різниці, приблизно від −0,5 до +3,7 в. п., досі містить нуль, але містить і відчутний виграш. Наступний крок — більший тест, а не вирок.

Типові помилки

  • Казати «ми прийняли H0» чи «тест довів, що ефекту немає». Незначущий результат означає лише, що доказів забракло, часто через замалу вибірку.
  • Формулювати гіпотези після погляду на дані. Якщо обрати однобічну H1 чи нову метрику, коли вже видно, куди пішли цифри, хибнопозитивних результатів стає більше.
  • Сприймати «відхиляємо H0» як «H1 — це великий і важливий ефект». На величезних вибірках значущими стають дрібні різниці; дивіться на розмір ефекту і довірчий інтервал.
  • Формулювати H0 про вибірку, а не про генеральну сукупність. Вибіркові середні такі, які є; гіпотези стосуються справжніх коефіцієнтів конверсії чи середніх, що за ними стоять.
  • Перевіряти розмиту H1. «Редизайн щось покращить» — замало: до старту тесту потрібні метрика, напрям і, бажано, мінімальний ефект, який варто виявити.

Вивчити в курсі