коефіцієнт детермінації (R²)
Частка дисперсії результату, пояснена моделлю, від 0 до 1.
R², коефіцієнт детермінації, — це частка мінливості результату, яку пояснює модель, порівняно з найлінивішою можливою моделлю: завжди прогнозувати середнє.
показує, наскільки результат коливається навколо свого середнього; — скільки лишається в залишках після прогнозів моделі. R² = 0 означає, що модель не краща за середнє; R² = 1 — що вона ідеально проходить через кожну точку. У простій лінійній регресії R² дорівнює квадрату коефіцієнта кореляції Пірсона .
Що R² каже: наскільки щільно дані лягають навколо підібраної лінії чи поверхні саме в цьому наборі даних. Чого не каже: чи модель правильна, чи описує причинність і чи добре вона прогнозує. Високий R² — ще не ознака хорошої моделі:
- дві метрики, що обидві ростуть із часом (витрати на рекламу й замовлення в рік зростання), можуть дати високий R² без жодного причинного зв'язку;
- додавання предикторів ніколи не знижує R² на даних, на яких модель навчали, навіть якщо це чистий шум, тож перевантажена множинна регресія виглядає чудово, а прогнозує погано. Дивіться на скоригований R² і перевіряйте на відкладеній вибірці;
- лінія може мати високий R² і водночас хибну форму, що видно лише на графіку залишків.
Низький R² теж не завжди поганий. Поведінка окремих клієнтів дуже шумна, тож модель окремих замовлень може мати R² = 0,15 і все одно виявляти надійний і цінний ефект. Для рішень дивіться на графіки залишків, похибку на нових даних і довірчі інтервали коефіцієнтів, а не лише на R².
Приклад
Десять тижнів даних Котокорму: тижневі витрати на рекламу від $200 до $700, замовлення з реклами — від 20 до 48 (середнє 34,2).
- Загальна мінливість: .
- Лінія за методом найменших квадратів: . Сума квадратів її залишків .
- .
Що з цього випливає: лінія пояснює близько 90% тижневих коливань замовлень, і кожні додаткові $100 витрат супроводжуються приблизно 5,4 замовлення більше.
Що з цього не випливає:
- «Тиждень із бюджетом $900 дасть 57 замовлень» (). $900 — поза діапазоном $200–$700, на якому будували лінію, а високий R² усередині діапазону нічого не каже про форму залежності за його межами.
- «Реклама дає 90% наших замовлень». R² описує, наскільки добре лінія пасує до даних, а не скільки замовлень спричиняє реклама. Якщо Котокорм зазвичай витрачав більше у святкові тижні, частину роботи могла зробити сезонність.
Типові помилки
- «Високий R² = хороша модель». Високий R² може з'явитися через спільний тренд, перенавчання або підгонку, яка добра лише в межах наявних даних. Перевіряйте залишки й похибку на нових даних.
- Напихати модель предикторами, щоб підняти R². Кожен новий предиктор підвищує R² на навчальних даних. Порівнюйте моделі за скоригованим R² або за похибкою на відкладеній вибірці.
- Порівнювати R² для різних результатів чи наборів даних. R² = 0,6 для денних замовлень і 0,3 для суми окремого кошика непорівнянні: природного шуму в цих величинах різна кількість.
- Відкидати модель через низький R². Для шумної поведінки окремих клієнтів скромний R² цілком може поєднуватися з точним і цінним коефіцієнтом.
- Тлумачити R² як причинність чи «частку результату, спричинену X». Він вимірює якість підгонки, а не причину.
Вивчити в курсі
- Лінійна регресія · Передбачення однієї метрики з іншої прямою лінією та перевірка якості.