Метрики, которые врут: ошибка выжившего, p-hacking и другие ловушки данных
Когда метрика наконец пошла вверх, хочется сразу найти причину: что сработало, какую гипотезу закрепить, куда теперь докинуть ресурсов. Но сначала стоит понять, из каких пользователей и событий собран показатель.Например, retention растёт — звучит хорошо. Но если в расчёт попали только те, кто уже вернулся хотя бы раз, то из картины выпали все, кто открыл продукт один раз и ушёл. А без них нельзя сказать, что продукт стал лучше удерживать новую аудиторию.
Все внедрили AI. Почти никто им не пользуется. Разбор самого массового вранья года
В прошлом году я наблюдал одно и то же внедрение AI в четырёх разных компаниях. Разные индустрии, разные бюджеты, один сценарий, вплоть до реплик.Сценарий такой. Сверху приходит: «нам нужен AI, все уже внедрили». Спешно выкатывают корпоративного ассистента — чат поверх LLM, обёрнутый в фирменные цвета. Через месяц готов слайд: «AI-ассистентом воспользовались 10 000 раз». Совет доволен. В письме инвесторам — строчка про «AI-трансформацию». Продукту — премия.
Сказ о том, как нейросеть занялась reward hacking прямо у меня на кухне
С чего все началось
Почему бенчмарки в AI сломались — и что с этим делать в понедельник
В январе 2026 года Янн Лекун, уходя из Meta, сказал в интервью Financial Times про релиз Llama 4: «The results were fudged a little bit» (Fast Company, 6 января 2026). Команда показывала на LMArena одну версию модели, в продакшен ушла другая. На бенчмарке всё было правильно. В реальности код был хуже DeepSeek V3.Я хочу разобрать эту историю. Не потому что Meta — исключение. Потому что они — симптом.TL;DR.
Что мы считаем, когда считаем эффективность: от парового двигателя до нейросетей
"Новые времена" (Modern Times, 1936)

