llm.
Почему Java-разработчики слишком доверяют рекомендациям ИИ
Представьте: в пятницу вечером руководитель уверенно сообщает, что переход со Spring Boot 3.5 на 4.0 будет простым и его можно закончить за выходные. Скорее всего, вы уточните, на чём основана такая оценка, и напомните о несовместимых изменениях.Теперь заменим руководителя на GitHub Copilot или другую большую языковую модель (LLM). Она предлагает рефакторинг метода, новую зависимость или готовый шаблон реализации. Ответ выглядит аккуратно и звучит уверенно. Модель не предупреждает, что может ошибаться. Возникает вопрос: проверяем ли мы такой код столь же строго, как заявление руководителя, или сразу принимаем его?По данным
INDB: когда все лгут, помнит, что вы видели
В любой записи в базу зашито допущение: у факта одно значение. Два несовпадающих наблюдения об одном объекте — конфликт, который положено разрешить до коммита, и разрешается он UPDATE. Пока данные генерирует ваш же код, допущение верное.Ломается оно на наблюдениях. Сенсоры расходятся в показаниях, и оба показания настоящие. Агент пишет о состоянии файла, который человек уже поправил руками. Два источника сообщают разное, и разрешить противоречие в момент записи нечем — контекст, в котором одно из них весит больше, появляется только в момент вопроса.INDB стоит на этом:
(Не)видимая цена интеллекта: почему экономия на LLM убивает ваши агентные системы
Разработчики агентных систем оказались в странной ситуации. Модели становятся дешевле, но задачи решают хуже. Провайдеры соревнуются в снижении цены за токен, а команды радостно переходят на облегчённые версии, экономя на вычислениях. Экономия очевидна — до первого столкновения с реальной задачей.
Что нового в Claude Code: разбор восьми августовских релизов
С 13 по 21 августа Anthropic выкатила восемь версий Claude Code, с 2.1.232 по 2.1.239. Список читается как обычные патчи CLI, пока не замечаешь, что почти всё в нём про одно: агентов у вас будет много, и работать они будут долго.Ниже — что реально приехало. Часть я прогнал на своей машине с 2.1.239 под Linux, часть взял из официального changelog, и я отмечаю, где что.Агенты перестали быть одиночкамиГлавное изменение серии лежит в 2.1.232, и его легко пропустить за строчкой про subagent forking.Субагент, запущенный с subagent_type: "fork", теперь наследует весь контекст текущего разговора и prompt cache
Что такое RAGFlow и с чем его едят
Если вы хоть раз пользовались LLM, то почти наверняка сталкивались с двумя ее классическими болячками: галлюцинациями и устаревшими знаниями. А когда дело доходит до рабочих задач, появляется еще одна проблема — как использовать внутренние документы компании, не выкладывая их в открытый доступ.
Цена за успешный результат: почему дешёвая модель может обойтись дороже дорогой
Всем привет, меня зовут Сергей Прощаев и в этой статье расскажу про то, почему выбор модели по цене за миллион
TrueForge: открытая обвязка, которая превращает LLM в полноценного агента
Собрать демо-агента сегодня несложно. Подключаешь модель, добавляешь пару инструментов — и она уже читает файлы, вызывает API и бодро обещает выполнить любую задачу.Сложности начинаются, когда такого агента нужно запустить в проде.Кто будет хранить состояние между запросами? Как пережить перезапуск? Где выполнять сгенерированный код? Как не передать ему секреты? Когда запрашивать подтверждение пользователя? Что делать, когда контекст разрастается до сотен тысяч токенов?Обычно каждая команда собирает эту обвязку самостоятельно. TrueFoundry решила открыть свою реализацию — TrueForge.
Как научить ИИ разгребать метрики, пока дежурный допивает чай
Конспект доклада про ИИ-агента для разбора инцидентов с первого занятия «Вечерней школы. ИИ для инженеров: польза и риски» от Слёрма
Почему мы не нашли готового PII-детектора для русского языка: грабли боевого контура перед LLM
Меня зовут Андрей Непряхин, я технический директор AGIMA. Этот текст — разбор контура, который мы построили и держим в бою: что в нём устроено так, а не иначе, и чем мы за это заплатили.

