Почему одна и та же модель может стоить в пять раз дороже
Исследователи из UC Berkeley и Arena сравнили семь моделей внутри Claude Code, Codex CLI и минималистичного Pi. На двух бенчмарках выбор харнесса почти не менял среднюю успешность, но увеличивал стоимость одной и той же модели до пяти раз. Результат хорошо объясняет, почему сравнивать coding-агентов только по названию моделей уже бессмысленно.А что именно измерили?
Я писал ИИ‑агента с помощью ИИ‑агента: полгода, 1600 коммитов и ноль рейтинга
Откуда это взялосьВ IT я больше двадцати пяти лет, в Android — почти пятнадцать. Оказалось, что этого мало.
Cognition выпустила Fusion для Devin Desktop и CLI: две ИИ‑модели делят одну задачу
11 сентября Cognition объявила о доступности Fusion в Devin Desktop и CLI. Ранее система работала в облачном Devin. Теперь связку из ведущей модели и исполнителя можно использовать в десктоп приложении и терминале. Компания рекомендует сочетание Claude Fable 5.1 и SWE-2.
Один ИИ кодит, второй командует: как устроен Devin Fusion
11 сентября Cognition объявила о доступности Fusion в Devin Desktop и CLI. Ранее система работала в облачном Devin. Теперь связку из ведущей модели и исполнителя можно использовать в десктоп приложении и терминале. Компания рекомендует сочетание Claude Fable 5.1 и SWE-2.
Anatomy of a Broken Benchmark Runner: How Seven AI Models Fixed (or Didn’t Fix) run-code.sh
IntroductionThere is a question quietly buried inside every task handed to a language model, and it rarely gets asked out loud. Do you trust one model? Do you go looking for the best model? Do you run several models side by side and keep whatever each of them happens to catch? Or — one turn further still — do you hand that whole pile of partial answers to yet another model and ask it to combine them into one? Each answer sounds reasonable on its own. Each is also, on its own, incomplete — and the only way to find out which incompleteness actually hurts you is to run the experiment rather than assume the answer.This article runs it, in four steps that build on each other.One model. A single broken bash script, with seven distinct bugs of varying severity, was handed to four models — Sonnet 5, HY3, Qwen3-Max, DeepSeek-V4-Flash — each working alone, each with no knowledge of what the others were doing. That's the first framing: one model, unaided, fixing only what it personally noticed.Best model.
TrueForge: открытая обвязка, которая превращает LLM в полноценного агента
Собрать демо-агента сегодня несложно. Подключаешь модель, добавляешь пару инструментов — и она уже читает файлы, вызывает API и бодро обещает выполнить любую задачу.Сложности начинаются, когда такого агента нужно запустить в проде.Кто будет хранить состояние между запросами? Как пережить перезапуск? Где выполнять сгенерированный код? Как не передать ему секреты? Когда запрашивать подтверждение пользователя? Что делать, когда контекст разрастается до сотен тысяч токенов?Обычно каждая команда собирает эту обвязку самостоятельно. TrueFoundry решила открыть свою реализацию — TrueForge.
Когда ИИ-агент ошибается молча: 6 отказов, которые не видно по ответу
ИИ-агент — не чат-бот. Чат-бот генерирует текст. Агент совершает действия: читает документ, решает, какие инструменты вызвать, выполняет многошаговый рабочий процесс и выдает результат, на основании которого без дополнительной проверки действуют системы-потребители — а иногда и люди.Когда агент составляет ответ, цена ошибки — неудачный абзац. Когда он одобряет кредит, подает регуляторную отчетность или запускает эскалацию, ошибка может обернуться операционными, финансовыми или репутационными потерями.
Шесть недель с agentic AI против фрода в adversarial-системе
Я слишком рано понёс первые результаты в наш продукт. Тогда это выглядело логично: мы прикрутили агентный ИИ к анализу логов и поведения пользователей в regulated продукте с реальными денежными операциями, качество обнаружения пошло вверх, аналитики по фроду стали меньше возвращать инженерам мусорные кейсы.Снаружи это уже выглядело рабочим слоем защиты: аналитики видели меньше мусора, инженеры получали более понятные issues, и продукт наконец увидел практическую пользу вместо очередного демо. Я примерно так и сказал: “смотрите, это уже не игрушка”. Плохая фраза, как оказалось.
ИИ в химии: история участия в хакатоне и рефлексия после
Всем привет! Меня зовут Константин Ушенин, я — ведущий научный сотрудник в AIRI, занимаюсь приложениями искусственного интеллекта в химии и фармакологии. В конце марта 2026 года мы с коллегами выиграли суточный хакатон от Сбера, ИТМО и СПБ ГБУ Молодёжного пространства «ПРОСТО» по созданию ИИ‑ассистента для планирования синтеза в лаборатории органической химии. Мероприятие прошло три месяца назад, однако мы завершили рефлексию результата только сейчас и решили сделать полный разбор.

