Перейти до змісту
Увійти

Довірчий інтервал в A/B-тесті: що він насправді показує

Що показує 95-відсотковий довірчий інтервал в A/B-тесті, як читати інтервал, що містить нуль, і чому для рішення він корисніший за p-значення.

Автор: Sergey BruhОпубліковано 8 хв читання

Довірчий інтервал — це діапазон значень справжньої конверсії або справжньої різниці між двома варіантами, який узгоджується із зібраними даними. Ваш тест показав приріст 0,7 відсоткового пункту, але інша вибірка відвідувачів дала б трохи інше число. 95-відсотковий довірчий інтервал замінює одне число чесним діапазоном, наприклад «від +0,13 до +1,27 відсоткового пункту». Цей діапазон відповідає на три питання, від яких залежить рішення про запуск: чи може ефект бути нульовим, чи може він бути від'ємним і чи достатньо він великий, щоб окупитися. p-значення відповідає лише на перше.

Приклад: тест дати доставки

Котокорм, інтернет-магазин кормів для тварин, додає на сторінку товару очікувану дату доставки («Привеземо в четвер»). Дату розраховує платний API перевізника, тож функція має постійні витрати. Через два тижні:

Група
Відвідувачі
Замовлення
Конверсія
Контроль (без дати)
12 000
600
5,0 %
Варіант (з датою доставки)
12 000
684
5,7 %

Варіант попереду на 0,7 відсоткового пункту (в. п.), тобто відносний приріст становить 14 %.

Інтервал для кожного варіанта

Для конверсії p^\hat p, виміряної на nn відвідувачах, стандартна похибка показує, наскільки ця конверсія коливалася б від вибірки до вибірки. 95-відсотковий інтервал — це конверсія плюс-мінус 1,96 стандартної похибки:

p^±1,96⋅p^ (1−p^)n\hat p \pm 1{,}96 \cdot \sqrt{\frac{\hat p\,(1-\hat p)}{n}}
  • Контроль: 0,05×0,95/12 000≈0,0020\sqrt{0{,}05 \times 0{,}95 / 12\,000} \approx 0{,}0020, тобто 0,20 в. п. Похибка оцінки — 1,96×0,20≈0,391{,}96 \times 0{,}20 \approx 0{,}39 в. п., тож інтервал — від 4,61 % до 5,39 %.
  • Варіант: стандартна похибка 0,21 в. п., похибка оцінки 0,41 в. п., інтервал — від 5,29 % до 6,11 %.

Інтервал для різниці

Рішення стосується розриву між варіантами, тому головний інтервал саме цей. Дві стандартні похибки складаються, як катети прямокутного трикутника:

SEdiff=SE12+SE22=0,1992+0,2122≈0,29 в. п.SE_{diff} = \sqrt{SE_1^2 + SE_2^2} = \sqrt{0{,}199^2 + 0{,}212^2} \approx 0{,}29 \text{ в. п.}

Похибка оцінки — 1,96×0,29≈0,571{,}96 \times 0{,}29 \approx 0{,}57 в. п., тож 95-відсотковий довірчий інтервал приросту — від +0,13 до +1,27 в. п. Для тих самих даних z-критерій для двох часток дає p≈0,016p \approx 0{,}016; цей розрахунок крок за кроком розібрано в уроці «Конверсія та тести для часток».

Що насправді означає «95 %»

Хочеться прочитати так: «з імовірністю 95 % справжній приріст лежить між 0,13 і 1,27 в. п.». Це класичне хибне тлумачення. Справжній приріст невідомий, але це одне конкретне число, і цей інтервал або містить його, або ні.

95 % описують метод, а не ваш інтервал. Якби Котокорм міг провести той самий тест сто разів і щоразу будувати інтервал за тим самим рецептом, приблизно 95 інтервалів накрили б справжній приріст, а близько 5 промахнулися б. У вас у руках один із них, і ви не знаєте, який саме.

Безпечне формулювання на щодень: «дані узгоджуються з приростом від 0,13 до 1,27 в. п.». Із цього випливають два практичні наслідки:

  • Не приписуйте ймовірності частинам інтервалу. Твердження «з імовірністю 97,5 % приріст більший за 0,13 в. п.» з інтервалу не випливає.
  • 95 % враховують лише випадковий шум вибірки. Помилка в трекінгу, зламаний розподіл трафіку чи ефект новизни в інтервал не входять.

Чому інтервал корисніший за саме p-значення

«p=0,016p = 0{,}016» каже, що такий великий розрив був би рідкістю, якби дата доставки нічого не давала (докладніше — у статті «Що таке p-значення»). Інтервал показує одразу три речі:

  • Значущість. Якщо 95-відсотковий інтервал різниці не містить нуля, то p<0,05p < 0{,}05 (за винятком граничних випадків).
  • Розмір. Приріст лежить десь між 0,13 і 1,27 в. п.: від ледь помітного до великого.
  • Точність. Ширина показує, скільки тест насправді з'ясував.

Діапазон легко перевести в одиниці бізнесу. Сторінки товарів Котокорму мають близько 50 000 відвідувачів на місяць, тож інтервал означає приблизно від 65 до 635 додаткових замовлень на місяць, а точкова оцінка — 350.

Ширина залежить від обсягу вибірки

Ті самі спостережувані конверсії, 5,0 % і 5,7 %, за трьох розмірів тесту:

Відвідувачів у групі
Похибка оцінки
95-відсотковий інтервал приросту
3 000
±1,14 в. п.
від −0,44 до +1,84 в. п.
12 000
±0,57 в. п.
від +0,13 до +1,27 в. п.
48 000
±0,28 в. п.
від +0,42 до +0,98 в. п.

Обсяг вибірки стоїть під коренем, тому вчетверо більше відвідувачів звужує інтервал лише вдвічі. Саме тому точність визначають до запуску, коли розраховують розмір вибірки, а не після того, як прийшли результати.

На ширину впливає і довірчий рівень. За рівня 90 % тест із 12 000 відвідувачів у групі дає від +0,22 до +1,18 в. п., за рівня 99 % — від −0,05 до +1,45 в. п. Вища впевненість коштує ширшого інтервалу, тому рівень обирають до тесту, а не після того, як побачили результати.

Як читати інтервал, що містить нуль

Візьмімо перший рядок таблиці: 3 000 відвідувачів у групі, інтервал від −0,44 до +1,84 в. п., p≈0,23p \approx 0{,}23. Дані узгоджуються і з невеликою втратою, і з відсутністю ефекту, і з великим виграшем. Це не «дата доставки не працює». Це «тест не зміг розрізнити».

Тепер інший тест: 200 000 відвідувачів у групі, 5,00 % проти 5,03 %. Інтервал — від −0,11 до +0,17 в. п. Він теж містить нуль, але висновок протилежний: хоч яким є ефект, він крихітний.

p-значення називає обидва тести «незначущими» (0,23 і 0,66). Інтервали показують, що першому бракує даних, а другий дав чітку відповідь.

Порівнюйте інтервал із мінімальним ефектом, важливим для бізнесу

Для бізнесу межа рідко проходить через нуль. API перевізника коштує Котокорму 1 500 доларів на місяць, а середнє замовлення приносить близько 12 доларів маржі. Щоб вийти в нуль, потрібно 125 додаткових замовлень на місяць. За 50 000 відвідувачів це приріст 0,25 в. п. — мінімальний ефект, заради якого варто запускати.

Де лежить 95-відсотковий інтервал
Що це означає
Типове рішення
Повністю вище мінімального ефекту
Ефект реальний і достатньо великий
Запускати
Вище нуля, але містить мінімальний ефект
Ефект реальний, але може не окупитися
Зважити витрати й ризики або тестувати далі
Містить нуль і сягає вище мінімального ефекту
Тест не зміг розрізнити
Збирати більше даних
Повністю нижче мінімального ефекту, довкола нуля
Будь-який ефект замалий, щоб мати значення
Зупинитися і йти далі
Повністю нижче нуля
Зміна шкодить
Не запускати

Інтервал Котокорму, від +0,13 до +1,27 в. п., — це другий рядок. На нижній межі функція приносить близько 780 доларів маржі на місяць за витрат 1 500 доларів. За точковою оцінкою вона дає близько 2 700 доларів на місяць понад витрати. Значення ближче до середини інтервалу дані підтримують краще, ніж значення на його краях, тому запустити й перевірити цифри через квартал — розумне рішення. Але це рішення бізнесу, і саме інтервал робить його видимим.

Якщо варіантів більше двох

Коли варіантів три, порівнювати доводиться три пари, і шансів на хибну тривогу більше. Наш калькулятор результатів A/B/n-тесту приймає від трьох до шести варіантів і для кожної пари показує різницю, p-значення з поправкою Бонферроні та скоригований інтервал для різниці.

Скориговані інтервали ширші. Якби в тесті дати доставки був третій варіант, інтервал для того самого розриву між B і A становив би приблизно від +0,004 до +1,40 в. п. замість від +0,13 до +1,27 в. п., а скориговане p-значення — 0,048 замість 0,016. Калькулятор використовує точнішу формулу, ніж класична з прикладу вище (метод Ньюкомба на основі інтервалів Вілсона); на вибірках такого обсягу обидві збігаються до другого знака після коми.

Типові помилки

Судити за перетином. Інтервали двох варіантів перетинаються (4,61–5,39 % і 5,29–6,11 %), проте інтервал різниці не містить нуля. Перетин інтервалів — це не тест. Дивіться на інтервал для різниці.

Читати інтервал як діапазон поведінки користувачів. Інтервал не каже, куди потрапляють 95 % відвідувачів чи днів. Він описує невизначеність одного числа — справжньої конверсії.

Плутати відсотки й відсоткові пункти. Від +0,13 до +1,27 в. п. — це абсолютний приріст. Відносно базових 5,0 % це приблизно від +3 % до +25 %. Завжди уточнюйте, про що мова.

Довіряти інтервалу тесту, в який підглядали. Якщо зупинити тест, щойно інтервал відірвався від нуля, він уже не має 95-відсоткового покриття.

Як сказати про результат одним реченням

Дата доставки підняла конверсію з 5,0 % до 5,7 %: приріст 0,7 в. п. (95 % ДІ від +0,13 до +1,27 в. п.), тобто приблизно від 65 до 635 додаткових замовлень на місяць за точки беззбитковості у 125 замовлень.

Структура така: що змінилося, точкова оцінка, інтервал, той самий діапазон в одиницях бізнесу і поріг, з яким його порівнюють.

Головне

  • Довірчий інтервал — це діапазон справжніх значень, сумісних із вашими даними; точкова оцінка — лише його середина.
  • 95 % описують, як часто метод накриває справжнє значення, а не ймовірність того, що це зробив саме ваш інтервал.
  • Інтервал для різниці показує значущість, розмір ефекту і точність водночас.
  • Учетверо більша вибірка звужує інтервал удвічі.
  • Порівнюйте інтервал не лише з нулем, а й із мінімальним ефектом, заради якого варто запускати.

FAQ

Чи означає 95-відсотковий довірчий інтервал, що справжнє значення лежить у ньому з імовірністю 95 %?

Ні. Справжнє значення фіксоване, тож конкретний інтервал або містить його, або ні. 95 % — це частка успіхів методу на довгій дистанції: приблизно 95 зі 100 інтервалів, побудованих так само, накривають справжнє значення.

Що означає, коли довірчий інтервал містить нуль?

Дані узгоджуються з відсутністю ефекту, тож на цьому рівні результат не є статистично значущим. Але це не доводить, що ефект нульовий: широкий інтервал означає, що тест був замалий, а вузький — що будь-який ефект невеликий.

Який довірчий рівень обрати: 90, 95 чи 99 %?

95 % — стандарт, який відповідає рівню значущості 0,05. Беріть 99 %, коли помилковий запуск дорого відкотити, і 90 % для дешевих змін, які легко скасувати. Обирайте до початку тесту.

Чому мій довірчий інтервал такий широкий?

Зазвичай вибірка замала для ефекту, який ви шукаєте. Щоб звузити інтервал удвічі, потрібно вчетверо більше трафіку.

Спробуйте на практиці

Безкоштовний урок «Довірчі інтервали» крок за кроком будує інтервал на даних про замовлення Котокорму. У ньому є тести на хибні тлумачення, про які йшлося вище, і практичне завдання з перевіркою ШІ. Це частина безкоштовного курсу «Статистика для продакт-менеджерів і маркетологів».

Вивчіть це в курсі

Вивчайте статистику на практиці

Безкоштовний курс для продактів і маркетологів: короткі уроки, реальні продуктові дані та вправи з миттєвим фідбеком.

Почати безкоштовний курс

Схожі статті

8 хв читання

Підглядання в A/B-тестах: чому «вже значущий» — ще не результат

Підглядання в A/B-тестах множить хибні перемоги: у 100 000 симульованих A/A-тестів щоденні перевірки дали 27,6 % помилок замість 5 %. Що робити натомість.