парадокс Сімпсона
Тенденція, що є в кожній підгрупі, змінюється на протилежну після об'єднання груп через різні їх розміри.
Парадокс Сімпсона — це ситуація, коли порівняння, правильне в кожній підгрупі, змінюється на протилежне або зникає, щойно підгрупи об'єднують. Це не арифметична помилка. Загальний коефіцієнт конверсії — це зважене середнє конверсій сегментів, а ваги (склад сегментів) у групах, які порівнюють, можуть бути різними. Якщо одна група отримує більшу частину трафіку з сегмента з низькою конверсією, її загальний показник тягнеться вниз, хоч би як добре вона працювала всередині кожного сегмента.
Змінна сегмента тут працює як змішувальний чинник (конфаундер): вона пов'язана і з тим, до якої групи належить користувач, і з результатом. У продуктовій і маркетинговій роботі парадокс зазвичай з'являється, коли:
- порівнюють канали з різною аудиторією (здебільшого нові чи здебільшого постійні відвідувачі);
- порівнюють «до» і «після» релізу, а склад трафіку тим часом змінився (скажімо, зросла частка мобільних користувачів);
- аналізують функції, які користувачі вмикають самі, і найактивніші відбираються туди самі;
- об'єднують кілька країн чи кампаній дуже різного розміру;
- посеред A/B-тесту змінюють розподіл трафіку, а потім зводять періоди докупи.
Якому числу вірити? Це залежить від причинної картини, а не від арифметики. Якщо сегмент впливає на результат, але сам не спричинений тим, що ви порівнюєте, порівнюйте всередині сегментів або перезважте всіх до спільного складу. Якщо ж сегмент сам є наслідком втручання (наприклад, функція підштовхує людей оформлювати підписку), розбиття за ним може, навпаки, заплутати.
Вбудований захист — коректна рандомізація. Чистий A/B-тест у середньому зберігає однаковий склад сегментів, тож розворот у дусі Сімпсона всередині рандомізованого тесту — тривожний сигнал про невідповідність співвідношення вибірок (SRM) або зміну розподілу трафіку посеред тесту.
Приклад
Маркетинг Котокорму порівнює два канали за місяць: email-розсилку й рекламу в Instagram, по 1000 візитів на сайт із кожного.
Instagram конвертує краще в обох сегментах (13,0% проти 12,0% і 2,5% проти 2,0%), але загалом виглядає більш ніж удвічі гіршим (4,6% проти 10,0%).
Чому так: підсумки — це зважені середні з дуже різними вагами. 80% візитів з email дають постійні клієнти, а 80% візитів з Instagram — нові відвідувачі, які з першого візиту купують рідко.
- Email:
- Instagram:
Перезважмо обидва канали до однакового складу 50/50 — і порядок знову змінюється:
- Email:
- Instagram:
То який канал «кращий»? Якщо питання «який канал краще конвертує відвідувача певного типу?», то Instagram. Якщо «який канал сьогодні дає більше замовлень на 1000 візитів?», то email. Це різні питання, і зведена таблиця сама по собі відповідає лише на друге.
Типові помилки
- Оцінювати канали, когорти чи релізи лише за загальним показником. Завжди перевіряйте, чи відрізняється склад сегментів у тому, що порівнюєте.
- Звинувачувати реліз у падінні, яке насправді спричинила зміна складу трафіку. Якщо частка мобільного трафіку зросла з 30% до 60% візитів, загальна конверсія може впасти, навіть якщо і мобільна, і десктопна покращилися.
- Вишукувати розворот навмисно. Якщо різати дані на достатньо сегментів, якесь порівняння випадково перевернеться. Малі сегменти шумні, а велика кількість зрізів тягне за собою проблему множинних порівнянь.
- Завжди вірити розбивці за сегментами. Якщо саме втручання змінює, в який сегмент потрапляють люди, розбиття за цим сегментом порівнює непорівнянні групи. Вирішуйте, спираючись на причинну картину.
- Зводити періоди A/B-тесту з різним розподілом трафіку. Якщо посеред тесту перейти від 10/90 до 50/50 і просто скласти цифри, можна штучно отримати розворот; аналізуйте кожен період окремо або правильно зважуйте їх.
Вивчити в курсі
- Багатофакторний ANOVA та взаємодії · Коли два чинники діють разом, наприклад акція, що працює на мобільних, але не на десктопі.