llm.
Разрушители мИИфов – тестируем Headroom. Правда ли умная прокся может сэкономить вам токены?
Признаю: в прошлой статье про тестирование Caveman я в конце написал, что такие инструменты, как RTK, действительно, могут помочь сэкономить токены. Я доверял самому принципу возможности экономии токенов, но не доверял конкретным цифрам эффективности, которые заявляет Headroom. Был уверен, что, садясь за тесты, скорее всего, увижу, не 60–95% экономии токенов, а типа 10% — или что-то такое. Но результат меня удивил в худшую сторону. Итак, тестируем Headroom вместе:Как Headroom работает
120 выдуманных ссылок против 8: что агентный поиск делает с галлюцинациями LLM на строительных нормах
Один контрольный эксперимент — и один красивый ложный вывод, который мы чуть не опубликовалиTL;DRШесть систем × 100 вопросов по строительным нормам, отобранных из ~6 000 реальных запросов пользователей; 3000 оценок от пяти LLM-судей — вслепую, по единой рубрике, с проверкой ссылок по корпусу нормативов.Контрольный эксперимент: один и тот же генератор (DeepSeek V4-Pro) с агентным поисковым контуром и без. С контуром — достоверность ссылок 4,25 из 5 и 8 пометок «выдуманная ссылка»; соло — 2,60 и 120 пометок.Лучший генералист (GPT-5.5) обходит систему только по полноте ответа. Обе «доказательные» оси проигрывает.
89% моих трат на AI‑агентов — это кэш, а не генерация. Написал CLI, чтобы увидеть
Я много работаю с кодинг‑агентами в Claude Code. В какой‑то момент поймал себя на том, что не представляю, на что уходят токены. Счёт в конце месяца есть, а из чего он складывается, непонятно. Написал небольшую утилиту, которая читает то, что Claude Code и так пишет на диск, и раскладывает расходы по статьям. То, что она показала, мне не понравилось.Вывод ledgent report ‑redact
Как OpenRouter Fusion обошёл Claude Fable 5
С начала этого года я веду бенчмарк ИИ моделей для менеджеров, и после последнего обновления – есть о чем рассказать (прошла версия рейтинга тут). Первое место занял OpenRouter Fusion – оркестратор, который вызывает сразу несколько моделей, собирает их ответы и синтезирует финальный результат. Он обошёл всех: и Claude, и GPT, и Gemini поодиночке.
Как я готовился к сертификации по LLMархитектуре и понял, что три года путал промпты с архитектурой
Мок-экзамен, вопрос номер сорок с чем-то. Сценарий: система должна классифицировать входящие обращения, и ни при каких условиях категория не может выходить за пределы фиксированного списка. Какой вариант обеспечивает это требование? Я уверенно тыкаю в ответ с формулировкой «добавить в системный промпт строгую инструкцию с перечнем допустимых категорий и явным запретом на другие значения».
Вы не внедрили AI. Вы завели кладбище промптов
От личных промптов к командному процессуЯ технический лидер нескольких команд. В этих командах есть разные экспертизы: frontend, backend на NestJS и NextJS, QA, исследовательская работа. Поэтому проблема с LLM-наработками шире, чем "как мне самому писать код быстрее", а "как опыт и навыки одного человека превратить в автоматизированный процесс для команды или компании".

