Перейти до змісту
КурсиУвійти
← Глосарій статистики

критерій хі-квадрат Пірсона

Перевіряє зв'язок категоріальних змінних, підсумовуючи (спостережувана - очікувана)^2 / очікувана за всіма клітинками.

Критерій хі-квадрат Пірсона перевіряє, чи пов'язані між собою дві категоріальні змінні: наприклад, варіант (А / Б / В) і результат (замовив / не замовив) чи канал залучення й обраний тариф. Дані зводять у таблицю спряженості з кількостями: рядок для кожної категорії першої змінної, стовпець — для кожної категорії другої.

Ідея в тому, щоб порівняти спостережене з тим, що мало б бути, якби змінні були незалежні. Очікувана (теоретична) частота для кожної клітинки:

E=сума рядка×сума стовпцязагальна сумаE = \frac{\text{сума рядка} \times \text{сума стовпця}}{\text{загальна сума}}

а статистика критерію підсумовує квадрати розбіжностей, поділені на очікувані частоти:

χ2=∑(O−E)2E\chi^2 = \sum \frac{(O - E)^2}{E}

Ступенів свободи — (рядки−1)(стовпці−1)(\text{рядки} - 1)(\text{стовпці} - 1). Для таблиці 2×2 (df = 1) критичне значення на рівні 5% — 3,84; точне p-значення дасть будь-яка програма.

Хі-квадрат чи t-критерій. t-критерій Стьюдента порівнює середні кількісної змінної (скажімо, середній чек) у двох групах. Хі-квадрат працює з кількостями в категоріях. Для звичайного A/B-тесту конверсії хі-квадрат для таблиці 2×2 (без поправки на неперервність) рівносильний z-критерію для двох часток: χ2=z2\chi^2 = z^2, і p-значення збігаються. Справжня користь хі-квадрат — коли варіантів чи категорій результату три й більше, і потрібен один загальний тест замість купи попарних порівнянь.

Перевірте припущення: кожен користувач врахований один раз, у таблиці сирі кількості, а не відсотки, і кожна очікувана частота — приблизно 5 або більше (інакше беріть точний критерій Фішера). Значущий результат каже лише, що якийсь зв'язок є. Щоб зрозуміти, звідки він і наскільки сильний, дивіться на розбіжності в клітинках і на самі конверсії.

Приклад

Тест нового чекауту Котокорму у вигляді таблиці спряженості:

Замовили
Не замовили
Разом
Контроль
52
948
1000
Новий варіант
68
932
1000
Разом
120
1880
2000

Очікувані частоти, якби варіант нічого не змінював:

  • замовили: 1000×1202000=60\frac{1000 \times 120}{2000} = 60 у кожній групі;
  • не замовили: 1000×18802000=940\frac{1000 \times 1880}{2000} = 940 у кожній групі.

Статистика хі-квадрат:

χ2=(52−60)260+(68−60)260+(948−940)2940+(932−940)2940\chi^2 = \frac{(52-60)^2}{60} + \frac{(68-60)^2}{60} + \frac{(948-940)^2}{940} + \frac{(932-940)^2}{940}

=1,067+1,067+0,068+0,068≈2,27= 1{,}067 + 1{,}067 + 0{,}068 + 0{,}068 \approx 2{,}27

При df = (2 − 1)(2 − 1) = 1 критичне значення — 3,84. Оскільки 2,27 < 3,84, результат незначущий (p ≈ 0,13).

Перевірка: z-критерій для двох часток на тих самих даних дав z≈1,51z \approx 1{,}51, а 1,512≈2,271{,}51^2 \approx 2{,}27. Той самий тест, лише в іншому вбранні. Якби Котокорм додав третій варіант чекауту, таблиця стала б 3×2 з df = 2, і один критерій хі-квадрат перевірив би всі три конверсії одразу.

Типові помилки

  • Підставляти відсотки замість кількостей. Статистика залежить від обсягу вибірки; «5,2% проти 6,8%» без кількостей, що за ними стоять, перевірити не вийде.
  • Рахувати одного користувача кілька разів. Таблиця сесій чи переглядів, де той самий клієнт трапляється багато разів, порушує припущення незалежності, і результат виглядає значно певнішим, ніж є насправді.
  • Не зважати на малі очікувані частоти. Якщо хоч одна очікувана частота менша приблизно за 5 (часто буває у вузьких сегментах), беріть точний критерій Фішера.
  • Читати значущий результат для трьох варіантів як «переміг В». Хі-квадрат каже лише, що конверсії не всі однакові. Далі потрібні попарні порівняння з поправкою на множинні порівняння.
  • Вважати великий χ² сильним ефектом. χ² зростає з обсягом вибірки; як розмір ефекту наводьте самі конверсії та приріст.