Проверяем Jev на открытых и внутренних данных: классификаторили фильтр?
Jev отвечает только «да/нет» или выбирает один из предложенных вариантов. 16 000 вызовов:сначала сравнение с gpt-5.4-mini и gpt-5.6-luna на четырёх открытых датасетах, затем несколько тысяч реальных решений в рабочих процессах. Где он выигрывает, где ошибается и как его использовать.
Захватывающая история внедрения ИИ в умирающей не-IT-компании
Вся история выдумана. Любые совпадения с именами, должностями и компаниями случайны.Как компания забрала рынок
ИИ пишет тесты, но кто проверит ИИ: как меняется QA в 1С-командах
ИИ уже умеет генерировать тесты, разбирать легаси-код и помогать с автоматизацией QA. Но без правил и контроля он так же уверенно создает бесполезные проверки. Поэтому главный вопрос сегодня — не «можно ли применять ИИ в тестировании», а «как встроить его в процесс, чтобы качество действительно росло».Модераторы
История продолжений: что после действия участвует в следующем ходе
Человеку почти никогда не приходится начинать с нуля. К моменту его включения в ситуацию многое уже участвует в том, как она может продолжиться: язык сохраняет прежние различения, профессия — найденные способы решения, организация — правила и распределение работы, интерфейс — подготовленные действия. Благодаря этому следующий участник получает результаты работы, которую ему не приходится повторять.
Тупая модель с жёстким циклом проверки бьёт умную модель без него
Недавно читал тут статью про «Cost per Task» и про то, что самая дешёвая модель в линейке внезапно обгоняет самую умную по цене решённой задачи. С выводом согласен полностью, но хочу добавить то, чего в той статье не было: дело не только в модели. Дело в том, что происходит после того, как модель написала код.Последние восемь месяцев я строю агентную обвязку, в которой модель не просто пишет файлы, а обязана доказать, что написанное работает. Выяснилось следующее: если прикрутить к слабой модели честный цикл верификации, она уверенно обходит сильную модель, работающую в режиме «написал и отчитался».
Headroom на 80 запусках агента: что получилось с расходом токенов
Недавно увидел ещё один репозиторий с обещанием резко сократить расход контекста у LLM-агентов — Headroom. Я сейчас исследую эту тему на примере SKILL.state и уже писал о первых результатах на Хабре - это были первые инженерные эксперименты; более строгие проверки ещё продолжаются. Так что меня заинтересовал подход headroom и я решил заодно с прочими экспериментами наскоро прогнать Headroom через тот же тестовый стенд. Эта статья — о том, что получилось.
Почему regex больше не находит клиентов в Telegram: препарируем 12 081 сообщение с помощью каскадного AI-скоринга
## TL;DR (BLUF)Классический мониторинг Telegram-чатов по ключевым словам («ищу разработчика», «нужен сайт», «требуется подрядчик») в 2026 году технически мертв: регулярные выражения пропускают 79.5% целевых коммерческих заявок и одновременно генерируют более 60% ложноположительного шума (самореклама исполнителей, вакансии, взаимопиар). В этой статье мы разбираем инженерную архитектуру трехуровневого каскадного пайплайна: от легковесных эвристик (2 мс) и мультиязычных эмбеддингов (15 мс) до LLM Decision Logic со строгой JSON-схемой. Все выводы подкреплены открытым бенчмарком на выборке из

