Гайд по switchback‑экспериментам: длина окна, кластеризация ошибок и мощность
Привет, Хабр!Новая логика распределения заказов по курьерам выиграла A/B с запасом: время доставки минус восемь процентов, интервал узкий, p‑value с тремя нулями.Раскатали на сто, подождали две недели — время доставки осталось ровно там, где было. Логирование в порядке, сплит честный, пользователи делились случайно.Так ломается обычный тест в системах, где варианты дерутся за один ресурс.Курьер, доставшийся тестовой группе, отобран у контрольной, и разница надувается с обеих сторон сразу.Лечится это рандомизацией не по пользователям, а по времени:
Как ИИ‑агент помог автоматизировать рекламу на площадке без API, быстро проверить гипотезу и вовремя свернуть проект
Привет! Я Катерина Лапаева, руководитель GIGASCHOOL. В этой статье хочу разобрать кейс Максима Тодорова. Максим собрал систему в качестве итогового проекта на практическом курсе по автоматизации бизнес‑процессов с помощью ИИ‑агентов, который мы разработали вместе с экспертом Андреем Кузьминых, @Dataist. В течение курса участники выбирали реальный процесс, проектировали его целевую схему, определяли роль человека и агента, а затем собирали рабочий прототип и считали его экономику.
Когда недостаточно ошибок I-II рода и нужно уточнить результат A-B теста
Для запуска А/В теста необходимым минимумом является фиксация ошибок первого и второго рода, расчет MDE (минимальный наблюдаемый эффект). Однако при расчете результатов теста далеко не всегда получается достичь MDE заданного размера, в таком случае вероятность достижения значимости значительно уменьшается. Помимо этого даже при статистически значимом результате существует вероятность ошибки, что наши результаты являются выбросом или просто случайностью. В таких случаях необходимо применить дополнительный арсенал инструментов для работы с данными.
Как стартап с суперсилой для родителей не смог и почему даже «святые» идеи нужно проверять
На связи Анатолий Шостак. Я стартап-валидатор. Человек, который хладнокровно проверяет бизнес-идеи на прочность. Но этот кейс особенный. Здесь я чуть снова не попал в эмоциональную ловушку, в которую попадают 90% фаундеров - влюбился в свой продукт.Это история о том, как желание сделать мир лучше столкнулось с суровой реальностью рынка, и почему умение вовремя остановиться - это тоже победа.
Линеаризация в офлайн-тестах: как не стереть сигнал вместе с шумом
Если хочешь навести порядок в шуме — сначала разберись, не затёр ли ты в нём сам сигнал.
Как проверять ИИ гипотезы быстро и дешево – гайд в CRISP-DM Light фреймворк
Делали ли вы работу в стол? Вопрос риторический…Но больше, чем остальным это грустное чувство “проекта в стол” знакомо тем, кто занимается разработкой и внедрением ИИ решений: по статистике за 2024 год из них доходят до продакшена только от 15 до 30%И большинство неудач здесь не из-за плохих моделей или технической сложности, а из-за несогласованных бизнес-потребностей. Наши партнеры из Яндекса на CTO Conf-2025 презентовали новый фреймворк – CRISP-DM Light – он призван исправить эту ситуацию.
Офлайн А-Б тесты в ресторанах фастфуда. Часть 2: Анализ и интерпретация результатов A-B-тестов
Методология — это не шаблон, это компас. А его стрелка — всегда на стороне ваших данных. В первой части «
Офлайн А-Б тесты в ресторанах фастфуда. Часть 1: Планирование и верификация офлайн A-B-тестов
"Основа надёжного A/B — не магия формул, а понимание, с чего вы стартуете и с чем работаете."
Тестирование платформы DeepSeek для проверки гипотез по анализу данных
Привет, Хабр!Мы, ребята из Центра эксплуатации Блока ИТ Страхового Дома ВСК, занимаемся управлением автоматизации ИТ-процессов. И у нас, как у всех —

