критерій хі-квадрат Пірсона
Перевіряє зв'язок категоріальних змінних, підсумовуючи (спостережувана - очікувана)^2 / очікувана за всіма клітинками.
Критерій хі-квадрат Пірсона перевіряє, чи пов'язані між собою дві категоріальні змінні: наприклад, варіант (А / Б / В) і результат (замовив / не замовив) чи канал залучення й обраний тариф. Дані зводять у таблицю спряженості з кількостями: рядок для кожної категорії першої змінної, стовпець — для кожної категорії другої.
Ідея в тому, щоб порівняти спостережене з тим, що мало б бути, якби змінні були незалежні. Очікувана (теоретична) частота для кожної клітинки:
а статистика критерію підсумовує квадрати розбіжностей, поділені на очікувані частоти:
Ступенів свободи — . Для таблиці 2×2 (df = 1) критичне значення на рівні 5% — 3,84; точне p-значення дасть будь-яка програма.
Хі-квадрат чи t-критерій. t-критерій Стьюдента порівнює середні кількісної змінної (скажімо, середній чек) у двох групах. Хі-квадрат працює з кількостями в категоріях. Для звичайного A/B-тесту конверсії хі-квадрат для таблиці 2×2 (без поправки на неперервність) рівносильний z-критерію для двох часток: , і p-значення збігаються. Справжня користь хі-квадрат — коли варіантів чи категорій результату три й більше, і потрібен один загальний тест замість купи попарних порівнянь.
Перевірте припущення: кожен користувач врахований один раз, у таблиці сирі кількості, а не відсотки, і кожна очікувана частота — приблизно 5 або більше (інакше беріть точний критерій Фішера). Значущий результат каже лише, що якийсь зв'язок є. Щоб зрозуміти, звідки він і наскільки сильний, дивіться на розбіжності в клітинках і на самі конверсії.
Приклад
Тест нового чекауту Котокорму у вигляді таблиці спряженості:
Очікувані частоти, якби варіант нічого не змінював:
- замовили: у кожній групі;
- не замовили: у кожній групі.
Статистика хі-квадрат:
При df = (2 − 1)(2 − 1) = 1 критичне значення — 3,84. Оскільки 2,27 < 3,84, результат незначущий (p ≈ 0,13).
Перевірка: z-критерій для двох часток на тих самих даних дав , а . Той самий тест, лише в іншому вбранні. Якби Котокорм додав третій варіант чекауту, таблиця стала б 3×2 з df = 2, і один критерій хі-квадрат перевірив би всі три конверсії одразу.
Типові помилки
- Підставляти відсотки замість кількостей. Статистика залежить від обсягу вибірки; «5,2% проти 6,8%» без кількостей, що за ними стоять, перевірити не вийде.
- Рахувати одного користувача кілька разів. Таблиця сесій чи переглядів, де той самий клієнт трапляється багато разів, порушує припущення незалежності, і результат виглядає значно певнішим, ніж є насправді.
- Не зважати на малі очікувані частоти. Якщо хоч одна очікувана частота менша приблизно за 5 (часто буває у вузьких сегментах), беріть точний критерій Фішера.
- Читати значущий результат для трьох варіантів як «переміг В». Хі-квадрат каже лише, що конверсії не всі однакові. Далі потрібні попарні порівняння з поправкою на множинні порівняння.
- Вважати великий χ² сильним ефектом. χ² зростає з обсягом вибірки; як розмір ефекту наводьте самі конверсії та приріст.