Работает, но не готово: definition of done для ИИ-систем
Три моих ИИ-проекта живут в проде от полугода до двух лет. Месяц назад я попробовал ответить, готов ли хоть один, и не смог.Не «работает ли». Работают все три. Агентом, который пишет SQL, аналитики пользуются каждый день, руками SQL почти не пишут. Ассистент поддержки выдаёт операторам черновики на боевом трафике. Вопрос был другой: могу ли я уйти в отпуск на месяц и про них не думать.Оказалось, что нет. Я не знал, сколько агент стоит в месяц. Точность ассистента последний раз мерили для версии, которой уже не существует. Каждый проект держится на том, что я помню, как он устроен.
Completion gate для локальных моделей: как отделить завершённый ответ от оценки качества
В одном из сравнений локальных моделей я получил результат, который приятно показывать в таблице: три маршрута выполнили по десять сценариев из десяти. Медиана быстрого маршрута составила 28,9 секунды. Более тяжёлому потребовалось 99,1 секунды, смешанному — 71,0.Если смотреть только на колонку «принято», маршруты равны. Если добавить время, победителем выглядит быстрый. Если учесть ремонты результата, картина снова меняется: маршрутам потребовалось соответственно три, два и одно исправление.
Сколько автономности должно быть у ИИ‑агента
ИИ‑агент не должен получать больше автономности только потому, что выглядит компетентным. Автономность должна расти тогда, когда система вокруг агента умеет надежно обнаруживать его ошибки. С какого *неправильного* вопроса все начинают
ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта
У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает?Судья, который читал только текст диалога, ставил 18/20, а проверка по реальным вызовам инструментов давала 8/20. Текстовые проверки считали правдоподобный ответ верным и не могли отличить его от подтвержденного. Самодельный «процент фантомных эскалаций» оказался измерением того, насколько слова бота согласованы с его же внутренними флагами. Каждая метрика что‑то измеряла, и ничего продуктового
Я объяснил KERNEL маме за пять минут. Потом проверил, переживёт ли он LLM в production
Почему хороший промпт подозрительно похож на техническое задание и где заканчивается prompt engineering, а начинается настоящая работа с LLMоригинальный пост в r/PromptEngineering
Внутри Claude нашли сознание у моделей. J-пространство в LLM
Привет, Хабр. 6 июля 2026 года Anthropic опубликовала исследование Verbalizable Representations Form a Global Workspace in Language Models. Разбираю технические детали и практические следствия.
С чего начать тестирование LLM: 5 проверок из практики
Пять проверок — первое, что я делаю на новом LLM-проекте

