метрики.

Jev, Laya и Gemini Flash на трёх задачах классификации в поддержке

За неделю я прогнал три задачи из своего прода через модели, которые только выбирают из списка, ставят оценку по шкале или возвращают вероятность. Jev как закрытая, Laya как опенсорсный аналог, плюс gemini flash lite как третий кандидат. Две задачи из трёх они закрывают, третью не закроет ни одна, и понять это можно было до всякого замера.Меня интересовал не обзор моделей. Хотелось рамки: какие задачи вообще имеет смысл отдавать такому инструменту. Ниже три замера на живом трафике, шесть признаков подходящей задачи и раздел с оговорками, где я честно перечисляю, чего эти цифры не доказывают.

продолжить чтение

Метрика стала хуже на 20%, и вот почему так правильно

Мы прогнозируем загруженность московских парковок на сутки вперёд. В скрипте, который обучает модель, лежал такой список:# --- Список аномальных парковок (замороженные > 24ч, exclude from training) --- ANOMALOUS_PARKING_IDS = [7, 8, 11, 12, 14, 21, 24, 31, 32, 37, 47, 49, 50, 51, 52, 53, 54, 56, 58, 61, 66, 70, 72, 81, 82, 84, 95, 100, 106, 113, 121, 122, 128, 133, 134, 136, 146, 149, 162] Тридцать девять парковок, которые год назад отдавали одно и то же значение сутками. Логика понятная: на замороженном ряде модель учится предсказывать константу, поэтому такие парковки из обучения убрали.

продолжить чтение

Гайд по switchback‑экспериментам: длина окна, кластеризация ошибок и мощность

Привет, Хабр!Новая логика распределения заказов по курьерам выиграла A/B с запасом: время доставки минус восемь процентов, интервал узкий, p‑value с тремя нулями.Раскатали на сто, подождали две недели — время доставки осталось ровно там, где было. Логирование в порядке, сплит честный, пользователи делились случайно.Так ломается обычный тест в системах, где варианты дерутся за один ресурс.Курьер, доставшийся тестовой группе, отобран у контрольной, и разница надувается с обеих сторон сразу.Лечится это рандомизацией не по пользователям, а по времени:

продолжить чтение

Кто нашёл больше багов — агент или человек? Мои замеры 11 недель работы с AI-тестировщиком

Одиннадцать недель я вёл дневник каждой рабочей сессии с Claude Code: сколько часов работал агент, сколько я был рядом, кто нашёл каждый дефект и что случилось с каждым кандидатом — подтверждён, снят или ушёл вопросом. Вместо впечатлений — таблица: 277 агентских часов, 213 моих, 94 подтверждённые находки. Первая версия этого счёта оказалась завышенной почти вдвое — куда делась половина, тоже расскажу.Это четвёртая статья про paranoid-qa — опенсорсный пак скиллов, который заставляет Claude Code тестировать с доказательной дисциплиной. В первых трёх я показывал методику: вердикты только с пруфами,

продолжить чтение

Правда ли, что медицинский ИИ точнее врачей? Наш фреймворк помогает это выяснить

Привет, Хабр! Меня зовут Илья Копаничук, я старший научный сотрудник лаборатории «Сильный ИИ в медицине» AIRI. Мы с коллегами создаём ИИ‑инструменты, задача которых сделать качественную медицину доступнее. Например, основанное на нашей технологии приложение «Помощник по здоровью» стало лучшим ИИ‑решением в клиентском сервисе по версии Generation AI Awards 2025. Но речь сегодня не об этом.

продолжить чтение

Цена, которой не существовало: две недели поиска бага, который не видел мониторинг

Есть класс ошибок, которые невозможно найти простой сверкой. Не потому, что данные хорошо спрятаны, а потому, что искомого состояния нет ни в одной системе. Оно собирается на лету из двух правильных половинок, каждая из которых по отдельности абсолютно валидна.Хочу рассказать про случай, где искали причину две недели, но при этом мониторинг всё это время показывал, что всё в порядке, и формально он был прав.Оговорюсь сразу:

продолжить чтение

Как оценивать эффективность разработки

Меня зовут Антон Омельяненко, я Head of Software Development в EXANTE. Менеджер управляет командой так, чтобы она приносила бизнесу результат. Чтобы понимать, насколько хорошо люди справляются с задачами, ему нужны данные о работе и система оценки. С разработкой это сложнее, чем кажется.В статье я разберу три вопроса: почему классические метрики не подходят для оценки эффективности разработчиков, как измерять её правильно и что делать, если вам кажется, что сотрудник работает не только на вас.Строчки кода, коммиты и стори-поинты: почему они не работают

продолжить чтение

Метрики, которые врут: ошибка выжившего, p-hacking и другие ловушки данных

Когда метрика наконец пошла вверх, хочется сразу найти причину: что сработало, какую гипотезу закрепить, куда теперь докинуть ресурсов. Но сначала стоит понять, из каких пользователей и событий собран показатель.Например, retention растёт — звучит хорошо. Но если в расчёт попали только те, кто уже вернулся хотя бы раз, то из картины выпали все, кто открыл продукт один раз и ушёл. А без них нельзя сказать, что продукт стал лучше удерживать новую аудиторию.

продолжить чтение

А сколько здесь твоими ручками?

Представьте себе два разговора.В первом – два ценителя сравнивают картины. Один говорит: «вот эта лучше – у нее диагональ 80 см, а у той только 50». Второй смотрит на него и не знает, как отвечать.Во втором – два инженера обсуждают компьютеры. Один говорит: «вот этот производительнее – у него корпус серебристый, а у того черный». Второй тоже не знает, как отвечать.Абсурд узнается мгновенно.А теперь – руководитель регионального подразделения смотрит на результат работы, сделанной экспертом с помощью AI, и спрашивает: «А сколько здесь твоими ручками?»

продолжить чтение

Все внедрили AI. Почти никто им не пользуется. Разбор самого массового вранья года

В прошлом году я наблюдал одно и то же внедрение AI в четырёх разных компаниях. Разные индустрии, разные бюджеты, один сценарий, вплоть до реплик.Сценарий такой. Сверху приходит: «нам нужен AI, все уже внедрили». Спешно выкатывают корпоративного ассистента — чат поверх LLM, обёрнутый в фирменные цвета. Через месяц готов слайд: «AI-ассистентом воспользовались 10 000 раз». Совет доволен. В письме инвесторам — строчка про «AI-трансформацию». Продукту — премия.

продолжить чтение