Калькулятор мінімального виявлюваного ефекту
Дізнайтеся, наскільки мале зростання конверсії здатен виявити експеримент із трафіком і часом, які у вас є. Безкоштовно, без акаунта, а введені дані не залишають ваш браузер.
Відповідь залежить від потужності, рівня значущості та розміру вибірки. Безкоштовний урок пояснює їх на прикладі. Розберіться з потужністю та розміром вибірки
Результат
Оновлюється під час введення
- Відносний приріст
- ≈ +21,67%
- Від базової конверсії 5%
- Приріст у відсоткових пунктах
- ≈ +1,08
- Від 5% до приблизно 6,08%
- Учасників на варіант
- 7 000
- У моделі 14 000, A і B разом
Інша тривалість набору
Та сама базова конверсія, трафік, α і потужність. Кожна тривалість має власну вибірку та власний результат.
7 днів
- Відносний приріст
- ≈ +31,26%
- Відсоткові пункти
- ≈ +1,56
- Цільова конверсія
- ≈ 6,56%
- На варіант
- 3 500
14 днівваша тривалість
- Відносний приріст
- ≈ +21,67%
- Відсоткові пункти
- ≈ +1,08
- Цільова конверсія
- ≈ 6,08%
- На варіант
- 7 000
28 днів
- Відносний приріст
- ≈ +15,11%
- Відсоткові пункти
- ≈ +0,76
- Цільова конверсія
- ≈ 5,76%
- На варіант
- 14 000
Довший тест виявляє менші ефекти, але це не завжди кращий план: рішення відкладається, а на результат встигає вплинути більше змін трафіку та сезонності.
На чому ґрунтується оцінка
- Конверсія
- 5% → приблизно 6,08%
- Доступно учасників
- 14 000 = 1 000 на день × 14 днів
- У моделі
- 14 000: по 7 000 на варіант
- Набір учасників
- 14 днів, без часу, потрібного учасникам на конверсію
- Рівень значущості
- 5%, двосторонній тест
- Потужність
- 80%
- Розподіл
- Два варіанти, 50/50
- Метод
- Обернення формули розміру вибірки: нормальне наближення для двох незалежних часток, фіксований розмір вибірки, без поправки на неперервність
Як це читати
- За цих припущень зростання від 5% до приблизно 6,08% відповідає обраній потужності 80% в цьому плановому наближенні.
- Це не прогноз приросту й не гарантія значущого результату, а 80% не є ймовірністю того, що B кращий.
- Менший справжній ефект теж іноді вдається виявити. Просто за цих припущень він не досягає заданої потужності.
- MDE описує чутливість тесту, а не цінність для бізнесу. Чи реалістичний ефект такого розміру і чи вартий він зусиль, вирішують окремо.
- Час набору не враховує відкладених конверсій, бізнес-циклів, як-от будні та вихідні, і коливань трафіку.
Як працює калькулятор
Калькулятор відповідає на запитання, обернене до розрахунку розміру вибірки. Ви вже знаєте, скільки маєте трафіку й часу, і хочете з’ясувати, яке зростання здатен виявити тест такого розміру.
Він множить денний трафік на тривалість, ділить результат на дві рівні групи й шукає найменше зростання, для якого формула розміру вибірки потребує не більше учасників, ніж є в одній групі. Формула та сама, що й у нашому калькуляторі розміру вибірки: нормальне наближення для двох незалежних часток із двостороннім тестом і без поправки на неперервність.
Розмір вибірки важить менше, ніж здається. Учетверо більше учасників зменшує виявлюваний ефект лише вдвічі: у прикладі нижче 7 днів дають близько 31%, а 28 днів близько 15%.
Приклад розрахунку
Сторінка оформлення замовлення конвертує 5% відвідувачів. Щодня в експеримент можуть потрапляти близько 1000 нових учасників, а на набір команда має 14 днів. Це 14 000 учасників, по 7000 на варіант.
За рівня значущості 5% і потужності 80% мінімальний виявлюваний ефект становить приблизно +21,67% відносно. Це приблизно +1,08 відсоткового пункта: від 5% до приблизно 6,08%.
Якщо зміна навряд чи підніме конверсію на п’яту частину, такий тест, найімовірніше, її ефекту не помітить. Чесні варіанти такі: більше часу, сторінка з більшим трафіком, сміливіша зміна або визнання, що зараз A/B-тест на це запитання не відповість.
Припущення та обмеження
- Один бінарний результат на учасника: конверсія відбулася або ні. Для виручки та інших неперервних метрик потрібен інший метод.
- Учасників рандомізовано незалежно й пораховано один раз. Сесії, перегляди сторінок і повторні візити не є учасниками.
- За кожним учасником спостерігають однаковий час після входу в тест.
- Аналіз заплановано заздалегідь і виконано один раз, наприкінці. Багаторазове підглядання, кілька метрик і кілька порівнянь потребують поправок, яких тут немає.
- Два варіанти з розподілом 50/50. Для трьох і більше варіантів виявлюваний ефект більший, ніж показано тут.
- Лише зростання. Зниження та метрики, де менше означає краще, калькулятор не охоплює.
- Щодня однаковий середній трафік. Справжній трафік коливається, тож реальна вибірка може бути меншою або більшою.
- Результат отримано наближеним методом. За рідкісних конверсій, конверсій близько 100% або малої кількості учасників він не працює, і калькулятор не показує числа.
Запитання та відповіді
- MDE показує приріст, який дасть моя зміна?
- Ні. MDE показує чутливість експерименту, а не результат зміни. Це найменший справжній ефект, який тест виявляє з обраною потужністю. Фактичний ефект може бути більшим, меншим або його може не бути зовсім.
- Чим відносний приріст відрізняється від відсоткових пунктів?
- Відносний приріст є часткою від базової конверсії: +20% від 5% дає 6%. Відсоткові пункти додаються до базової конверсії: +1 пункт від 5% теж дає 6%, а +20 пунктів дали б 25%. Калькулятор завжди показує обидві одиниці разом із базовою та цільовою конверсією.
- Трафік вводити на один варіант чи на обидва?
- На обидва разом. Введіть усіх нових учасників, які потрапляють в експеримент за день, а калькулятор розділить їх 50/50. Якщо умовам тесту відповідає або бере в ньому участь лише частина відвідувачів, введіть цю частину.
- На що впливають α і потужність?
- α є прийнятним ризиком хибної тривоги, а потужність є ймовірністю виявити справжній ефект розміром з MDE. Суворіший α або вища потужність збільшують виявлюваний ефект за тієї самої вибірки. Обирайте обидва параметри до тесту, а не після того, як побачили результат.
- Тривалість означає весь час експерименту?
- Це період набору: дні, коли в тест потрапляють нові учасники. Якщо конверсія потребує часу, наприклад покупка відбувається через тиждень після першого візиту, експеримент триватиме довше, ніж набір. Зазвичай варто брати повні тижні, бо будні й вихідні відрізняються.
- Чому для рідкісної або дуже високої конверсії результату немає?
- Метод є наближенням, якому потрібно достатньо очікуваних конверсій і учасників без конверсії в кожному варіанті: щонайменше по 10. Коли їх менше, число виглядало б точним, але мало б що означало, тому калькулятор його не показує. Це не означає, що експеримент неможливий: йому потрібно більше учасників або точний метод.
- Чому інші калькулятори показують інший MDE?
- Калькулятори відрізняються формулою, одно- чи двостороннім тестом, поправками на неперервність, а також тим, чи розв’язують вони рівняння потужності, чи обертають формулу розміру вибірки, як цей. Порівнюйте результати лише за однакових налаштувань. Різниця в кілька відсотків є нормальною.
Обернене запитання
Уже знаєте, який ефект потрібно виявити? Розрахуйте, скільки для цього потрібно учасників. Калькулятор розміру вибірки для A/B-тесту