Калькулятор результатів A/B-тесту
Введіть кількість учасників і конверсій для двох варіантів завершеного тесту. Ви отримаєте різницю у відсоткових пунктах, відносний приріст, довірчий інтервал і p-значення, а також пояснення простими словами: що ці числа кажуть, а що ні.
Уперше читаєте результати тесту? Безкоштовний урок пояснює все крок за кроком. Як працюють тести конверсії
Тестуєте більше ніж два варіанти? Скористайтеся калькулятором результатів A/B/n-тесту
Результат
Введіть дані обох варіантів і натисніть «Проаналізувати результати». Приклад у формі вже готовий.
Як працює калькулятор
Ви вводите, скільки людей побачили кожен варіант і скільки з них конвертувалися. Калькулятор перетворює ці кількості на дві конверсії та їхню різницю, B мінус A.
Двосторонній тест перевіряє, чи ймовірна така різниця, якщо обидва варіанти конвертують однаково. Якщо p-значення менше за обраний рівень значущості, результат називають статистично значущим.
Довірчий інтервал показує, якою великою чи малою правдоподібно може бути справжня різниця. Вузький інтервал далеко від нуля є сильним свідченням; широкий інтервал, що перетинає нуль, означає, що тест поки не може розрізнити варіанти.
Хочете побачити p-значення на рисунку або зробити однобічний тест? Скористайтеся калькулятором статистичної значущості.
Приклад
У тесті було по 10 000 учасників у кожному варіанті. A (контроль) мав 500 конверсій, B мав 600. Конверсії становлять 5% і 6%.
Різниця становить +1 відсотковий пункт, тобто відносний приріст +20% щодо A. Інтервал 95% простягається приблизно від +0,37 до +1,63 відсоткового пункта, p-значення приблизно 0,0019.
Отже, у цьому тесті B конвертував краще, і така різниця була б незвичною, якби варіанти були однаковими. Чи варто запускати зміну заради +1 пункта, вирішує бізнес: зважте витрати та захисні метрики.
Метод і формули
Конверсії рахуються як pA = xA / nA і pB = xB / nB, де x означає кількість конверсій, а n кількість учасників. Різниця d = pB − pA; відносний приріст d / pA.
Тест об’єднує обидва варіанти, щоб оцінити конверсію за припущення «різниці немає», а потім порівнює d з її стандартною похибкою. p-значення береться з нормального розподілу, двостороннє.
Інтервал для d побудовано методом Ньюкомба: він поєднує інтервали Вілсона для кожного варіанта. Такий інтервал поводиться розумно біля 0% і 100%, де проста формула «оцінка ± 1,96 × стандартна похибка» дає збій.
pA = xA / nA, pB = xB / nB, d = pB − pA
pPool = (xA + xB) / (nA + nB)
SE0 = √(pPool (1 − pPool) (1/nA + 1/nB)), z = d / SE0
p = erfc(|z| / √2)
lower = d − √((pB − L_B)² + (U_A − pA)²)
upper = d + √((U_B − pB)² + (pA − L_A)²)Обидва методи наближені. Їм потрібно щонайменше 10 конверсій і 10 учасників без конверсії в кожному варіанті; якщо менше, калькулятор показує лише спостережувані конверсії.
Запитання та відповіді
- Що рахувати: людей, сесії чи події?
- Людей. Кожного учасника рахують один раз, а конверсія означає, що людина конвертувалася хоча б раз. Якщо рахувати сесії чи повторні покупки, порушується припущення про незалежність спостережень, і результат здається точнішим, ніж є.
- Чим відсоткові пункти відрізняються від відносного приросту?
- Відсоткові пункти отримують відніманням: 6% − 5% = 1 пункт. Відносний приріст ділить цю різницю на конверсію контролю: 1 / 5 = +20%. Обидва числа описують той самий результат, тому завжди уточнюйте, яке з них маєте на увазі.
- Результат незначущий. Це означає, що варіанти однакові?
- Ні. Це означає, що тест не виявив різниці. Справжня різниця може бути меншою, ніж тест здатен помітити. Подивіться на інтервал: якщо він охоплює різниці, важливі для вас, тест був замалим, щоб ухвалити рішення.
- Чи можна перевіряти результати щодня й зупинитися, коли стане значуще?
- З цим методом ні. Він передбачає один аналіз у запланований момент. Якщо перевіряти багато разів і зупинитися на першому значущому результаті, хибні перемоги трапляються набагато частіше, ніж обіцяє рівень значущості.
- Чому відносний приріст «не визначено»?
- Відносний приріст ділить на конверсію контролю. Якщо в контролі немає жодної конверсії, ділити немає на що, тому калькулятор показує лише різницю у відсоткових пунктах, а не нескінченний відсоток.
- Чому для мого невеликого тесту немає p-значення?
- Коли у варіанті менше ніж 10 конверсій або 10 учасників без конверсії, наближення, на якому ґрунтуються тест та інтервал, стає ненадійним. Калькулятор показує спостережувані конверсії й прямо про це каже, замість числа, яке лише виглядає точним.
Терміни на цій сторінці
Схожі інструменти
- Калькулятор результатів A/B/n-тесту
Аналіз результатів завершеного тесту з трьома–шістьма варіантами.
- Калькулятор розміру вибірки для A/B-тесту
Планування для двох варіантів (A/B) до початку тесту.
- Калькулятор довірчого інтервалу
Побачити, наскільки точна одна конверсія.