Перейти до змісту
Увійти

Калькулятор результатів A/B/n-тесту

Порівняйте від трьох до шести варіантів завершеного тесту конверсії. Калькулятор перевіряє кожну пару варіантів і робить поправку на кількість порівнянь, щоб додатковий варіант непомітно не підвищував ризик хибної перемоги.

Чому порівнювати багато варіантів ризиковано? Безкоштовний урок пояснює це на прикладах. Розберіться з помилками множинного тестування

Ваші результати

Цілі числа, лише цифри. Один учасник означає одну незалежно рандомізовану людину з одним результатом «так або ні».

Варіант A

Конверсія: 5%

Варіант B

Конверсія: 6%

Варіант C

Конверсія: 6,2%

Від трьох до шести варіантів.

Прийнятний ризик хоча б одного хибного висновку в усіх порівняннях разом.

Порівняння
Усі 3 пари варіантів, двосторонній тест
Поправка
Бонферроні: кожну пару перевіряють на рівні 1,667%
Порівняння та поправка фіксовані. Вони випливають із кількості варіантів, і їх не можна обирати після перегляду результатів.

Результат

Введіть підрахунки кожного варіанта й порівняйте їх. Приклад у формі вже готовий.

Як працює калькулятор

Введіть кількість учасників і конверсій для кожного варіанта. Калькулятор порівнює кожну пару варіантів: для трьох варіантів це три порівняння, для чотирьох шість, для шести п’ятнадцять.

Для кожної пари виконується двосторонній тест на різницю конверсій і будується інтервал для цієї різниці. Оскільки порівнянь кілька, імовірність хоча б одного хибного висновку зростає. Поправка Бонферроні це компенсує: p-значення множаться на кількість порівнянь, а інтервали відповідно розширюються.

Набір порівнянь визначається кількістю варіантів. Прибрати пару після перегляду результатів не можна, бо вибір порівнянь заднім числом повертає хибні висновки.

Приклад розрахунку

Три варіанти, по 10 000 учасників у кожному. У A (контроль) 500 конверсій, у B 600, у C 620. Спостережувані конверсії становлять 5%, 6% і 6,2%, тож найвища спостережувана конверсія у варіанта C.

Після поправки B відрізняється від A (скориговане p = 0,0058) і C відрізняється від A (скориговане p = 0,0007). Але C не відрізняється від B: скориговане p = 1, а інтервал для різниці простягається від −0,61 до 1,01 відсоткового пункта.

Отже, обидві альтернативи кращі за контроль, а розрізнити B і C за цими даними неможливо. Це не робить їх рівними чи спільними переможцями. Це означає, що тест не дає статистичних підстав віддати перевагу C перед B.

Припущення та обмеження

  • Один бінарний результат на учасника: конверсія відбулася або ні. Для виручки та інших неперервних метрик потрібен інший метод.
  • Учасників рандомізовано незалежно, кожен належить лише до одного варіанта, усі з одного тесту й одного періоду.
  • Тест завершено, і його аналізують один раз. Багаторазові перевірки, доки щось не стане значущим, поправка не покриває.
  • Усі пари для трьох–шести варіантів. Порівняння лише з контролем та інші поправки не передбачені.
  • Калькулятор не перевіряє, чи спрацював розподіл між варіантами. Однакові чи різні розміри груп нічого про це не доводять.
  • Якщо в будь-якому варіанті менше ніж 10 конверсій або 10 учасників без конверсії, статистичне порівняння не показується.

Запитання та відповіді

Найвища конверсія очевидна. Чому лідера немає?
Найвища спостережувана конверсія є фактом про цю вибірку. Щоб стати лідером, варіант має ще й статистично значуще відрізнятися від кожного іншого варіанта після поправки. Два близькі варіанти часто неможливо розрізнити, навіть коли обидва кращі за контроль.
Мене цікавить лише порівняння з контролем. Чому враховуються всі пари?
Щоб назвати найкращий варіант, альтернативи потрібно порівняти й між собою. Калькулятор заздалегідь фіксує повний набір пар, тому поправка відповідає запитанню. Порівняння лише з контролем є іншим аналізом, і тут його немає.
Чого поправка не виправляє?
Вона враховує порівняння в межах цього тесту й однієї метрики. Вона не враховує багаторазовий перегляд результатів, перевірку кількох метрик чи сегментів, а також варіанти, які запускали, але не включили.
Чому деякі результати не розраховуються?
Метод спирається на наближення, якому потрібно щонайменше 10 конверсій і 10 учасників без конверсії в кожному варіанті. За менших значень числа виглядали б точними, але були б ненадійними, тому калькулятор показує лише спостережувані конверсії.
Чому не порахувати кожну пару в окремому A/B-калькуляторі?
Кожен окремий тест на рівні 5% має власний 5-відсотковий ризик хибного висновку. Для трьох пар ризик хоча б одного вже становить близько 12%, а для шести варіантів він у кілька разів перевищує задумані 5%. Окремі калькулятори не знають один про одного, тому не можуть це скоригувати.

Терміни на цій сторінці