статистическая значимость.

Метрики, которые врут: ошибка выжившего, p-hacking и другие ловушки данных

Когда метрика наконец пошла вверх, хочется сразу найти причину: что сработало, какую гипотезу закрепить, куда теперь докинуть ресурсов. Но сначала стоит понять, из каких пользователей и событий собран показатель.Например, retention растёт — звучит хорошо. Но если в расчёт попали только те, кто уже вернулся хотя бы раз, то из картины выпали все, кто открыл продукт один раз и ушёл. А без них нельзя сказать, что продукт стал лучше удерживать новую аудиторию.

продолжить чтение

Почему +0.3% к ROC‑AUC почти всегда шум, и как это проверить

Вы поменяли набор признаков, прогнали кросс‑валидацию, ROC‑AUC вырос с 0.871 до 0.874. Изменение уезжает в продакшен как улучшение, в чате ставят плюсы, через месяц на свежих данных «улучшенная» модель работает не лучше прежней, а иногда хуже. Прирост на третьем знаке утонул в шуме самой процедуры валидации, и отличить его от настоящего сдвига по одному числу было нельзя с самого начала.

продолжить чтение