Перейти до змісту
Увійти

Калькулятор результатів A/B-тесту

Введіть кількість учасників і конверсій для двох варіантів завершеного тесту. Ви отримаєте різницю у відсоткових пунктах, відносний приріст, довірчий інтервал і p-значення, а також пояснення простими словами: що ці числа кажуть, а що ні.

Уперше читаєте результати тесту? Безкоштовний урок пояснює все крок за кроком. Як працюють тести конверсії

Тестуєте більше ніж два варіанти? Скористайтеся калькулятором результатів A/B/n-тесту

Ваші результати

Цілі числа, лише цифри. Один учасник означає одну незалежно рандомізовану людину, для якої враховано не більше однієї конверсії.

Варіант A

Конверсія: 5%

Варіант B

Конверсія: 6%

Вища конверсія краща. Калькулятор рахує B мінус A: додатна різниця означає, що B конвертує більше.

Додаткові налаштування
Рівень значущості (α)

Прийнятний ризик визнати різницю справжньою, коли її немає. Тест двосторонній. Оберіть рівень до того, як дивитися на результати.

Що вводити в ці поля
Учасники
Люди, яких випадково розподілили у варіант і які могли конвертуватися. Рахуйте людей, а не сесії чи перегляди сторінок. Ціле число від 1 до 1 000 000 000.
Конверсії
Учасники, які конвертувалися хоча б раз. Кожну людину рахуйте один раз, навіть якщо вона купила двічі. Від 0 до кількості учасників.
Період спостереження
Використовуйте однаковий завершений період для обох варіантів: наприклад, конверсії протягом 7 днів після потрапляння в тест для всіх, хто потрапив у нього за час тесту.

Групи можуть бути різного розміру. Для розрахунку це не проблема, але так не видно, чи розподіл між варіантами спрацював як задумано.

Результат

Введіть дані обох варіантів і натисніть «Проаналізувати результати». Приклад у формі вже готовий.

Як працює калькулятор

Ви вводите, скільки людей побачили кожен варіант і скільки з них конвертувалися. Калькулятор перетворює ці кількості на дві конверсії та їхню різницю, B мінус A.

Двосторонній тест перевіряє, чи ймовірна така різниця, якщо обидва варіанти конвертують однаково. Якщо p-значення менше за обраний рівень значущості, результат називають статистично значущим.

Довірчий інтервал показує, якою великою чи малою правдоподібно може бути справжня різниця. Вузький інтервал далеко від нуля є сильним свідченням; широкий інтервал, що перетинає нуль, означає, що тест поки не може розрізнити варіанти.

Хочете побачити p-значення на рисунку або зробити однобічний тест? Скористайтеся калькулятором статистичної значущості.

Приклад

У тесті було по 10 000 учасників у кожному варіанті. A (контроль) мав 500 конверсій, B мав 600. Конверсії становлять 5% і 6%.

Різниця становить +1 відсотковий пункт, тобто відносний приріст +20% щодо A. Інтервал 95% простягається приблизно від +0,37 до +1,63 відсоткового пункта, p-значення приблизно 0,0019.

Отже, у цьому тесті B конвертував краще, і така різниця була б незвичною, якби варіанти були однаковими. Чи варто запускати зміну заради +1 пункта, вирішує бізнес: зважте витрати та захисні метрики.

Метод і формули

Конверсії рахуються як pA = xA / nA і pB = xB / nB, де x означає кількість конверсій, а n кількість учасників. Різниця d = pB − pA; відносний приріст d / pA.

Тест об’єднує обидва варіанти, щоб оцінити конверсію за припущення «різниці немає», а потім порівнює d з її стандартною похибкою. p-значення береться з нормального розподілу, двостороннє.

Інтервал для d побудовано методом Ньюкомба: він поєднує інтервали Вілсона для кожного варіанта. Такий інтервал поводиться розумно біля 0% і 100%, де проста формула «оцінка ± 1,96 × стандартна похибка» дає збій.

pA = xA / nA,  pB = xB / nB,  d = pB − pA
pPool = (xA + xB) / (nA + nB)
SE0 = √(pPool (1 − pPool) (1/nA + 1/nB)),  z = d / SE0
p = erfc(|z| / √2)
lower = d − √((pB − L_B)² + (U_A − pA)²)
upper = d + √((U_B − pB)² + (pA − L_A)²)

Обидва методи наближені. Їм потрібно щонайменше 10 конверсій і 10 учасників без конверсії в кожному варіанті; якщо менше, калькулятор показує лише спостережувані конверсії.

Запитання та відповіді

Що рахувати: людей, сесії чи події?
Людей. Кожного учасника рахують один раз, а конверсія означає, що людина конвертувалася хоча б раз. Якщо рахувати сесії чи повторні покупки, порушується припущення про незалежність спостережень, і результат здається точнішим, ніж є.
Чим відсоткові пункти відрізняються від відносного приросту?
Відсоткові пункти отримують відніманням: 6% − 5% = 1 пункт. Відносний приріст ділить цю різницю на конверсію контролю: 1 / 5 = +20%. Обидва числа описують той самий результат, тому завжди уточнюйте, яке з них маєте на увазі.
Результат незначущий. Це означає, що варіанти однакові?
Ні. Це означає, що тест не виявив різниці. Справжня різниця може бути меншою, ніж тест здатен помітити. Подивіться на інтервал: якщо він охоплює різниці, важливі для вас, тест був замалим, щоб ухвалити рішення.
Чи можна перевіряти результати щодня й зупинитися, коли стане значуще?
З цим методом ні. Він передбачає один аналіз у запланований момент. Якщо перевіряти багато разів і зупинитися на першому значущому результаті, хибні перемоги трапляються набагато частіше, ніж обіцяє рівень значущості.
Чому відносний приріст «не визначено»?
Відносний приріст ділить на конверсію контролю. Якщо в контролі немає жодної конверсії, ділити немає на що, тому калькулятор показує лише різницю у відсоткових пунктах, а не нескінченний відсоток.
Чому для мого невеликого тесту немає p-значення?
Коли у варіанті менше ніж 10 конверсій або 10 учасників без конверсії, наближення, на якому ґрунтуються тест та інтервал, стає ненадійним. Калькулятор показує спостережувані конверсії й прямо про це каже, замість числа, яке лише виглядає точним.

Терміни на цій сторінці