llm. - страница 33

llm.

Токенная диета для ИИ-агентов: Caveman, Ponytail и Headroom

У агентных помощников есть неприятная привычка: они быстро раздувают работу.Сначала длинный ответ там, где хватило бы одной команды. Потом новый слой кода вокруг задачи на пять строк. Потом в контекст улетает полный лог, JSON на сотни элементов и кусок истории, который уже никто руками не читает.Каждая отдельная вещь выглядит терпимо. В длинной сессии это превращается в счет у провайдера, раннее сжатие истории, забитое окно контекста и потерянные детали. Агент вроде продолжает работать, но внезапно забывает ограничение, на котором держалась задача.

продолжить чтение

Куда делись мои токены?

Когда начинаешь плотно работать с AI-агентом, кажется, что бОльшая часть токенов улетает на сложные процессы - код написать, сайт разобрать, статью подготовить, браузером поуправлять, в логах покопаться. Вроде логично, задача сложная, модель думает, инструменты дергает, контекст растет.

продолжить чтение

Когда ИИ-агент ошибается молча: 6 отказов, которые не видно по ответу

ИИ-агент — не чат-бот. Чат-бот генерирует текст. Агент совершает действия: читает документ, решает, какие инструменты вызвать, выполняет многошаговый рабочий процесс и выдает результат, на основании которого без дополнительной проверки действуют системы-потребители — а иногда и люди.Когда агент составляет ответ, цена ошибки — неудачный абзац. Когда он одобряет кредит, подает регуляторную отчетность или запускает эскалацию, ошибка может обернуться операционными, финансовыми или репутационными потерями.

продолжить чтение

Как заставить ИИ соблюдать закон, не трогая веса. Выкладываем в открытый доступ внешний фильтр для LLM

В прошлом году я уже рассказывал об AVI

продолжить чтение

Аутентификация в MCP в 2026: как было, как есть и как будет

Пару лет назад мы масштабно столкнулись с совершенно новой технологией, которая пришла вместе с развитием агентов и LLM — MCP. Она заточена на то, чтобы дать модели интерфейс для общения с какой‑либо системой, программой или сервером. Изначально MCP были локальными и скромными: «запусти калькулятор», «проверь календарь», «удали лишние фоточки из галереи». Но очень быстро они доросли до remote‑серверов: вставляешь в Claude адрес своего MCP, и он сразу понимает, что сервер умеет, куда подключаться и как с ним общаться. Большое спасибо за это протоколу

продолжить чтение

Может ли LLM создать заготовку Django-проекта?

Мне всегда хотелось, чтобы генераторы Django-проектов работали совсем иначе:Вы пишете одно предложение: «Доска вакансий. Postgres, вход через Google, фоновые задачи, Stripe, деплой на мой VPS». Через пару минут у вас уже есть заготовка проекта: нужные пакеты подключены и связаны между собой, настройки для разработки и продакшена разделены, CI настроен, проект запускается.В теории всё выглядит идеально: вместо готового шаблона ИИ сам выбирает нужные компоненты, связывает их между собой и собирает проект под ваши требования. Но справляется ли он с этим на практике?

продолжить чтение

От Triton Inference Server к NVIDIA Dynamo: как изменился inference для агентов в 2026

продолжить чтение

От REST к MCP: как LLM меняют принципы проектирования API и архитектуры систем. Часть первая

Привет, Хабр! Говорит AvitoTech. Меня зовут Дмитрий Бондарев, я backend-разработчик, в Авито занимаюсь проектами на стыке разработки и машинного обучения. Из каждого утюга поют о том, как ИИ скоро нас всех заменит. Однако я хочу зайти в эту тему с более технической стороны и поговорить о существующих методах интеграции и якобы неизбежном использовании ИИ-агентов в бизнесе и повседневных задачах.

продолжить чтение

Как мы внедряли ИИ на 500 инженеров, а скорость не росла. Часть 1. Рост использования не равен ускорению разработки

ИИ в разработке сейчас внедряют почти все. Кто-то подключает чат, кто-то раздаёт доступ к кодинг-агентам, а кто-то обучает свои модели. На графиках пользователи и активность растут, инженеры пробуют инструменты и привыкают к новой реальности, но при проверке метрик очень часто выясняется, что работать ничего быстрее не стало.

продолжить чтение

Как на самом деле работают LLM

В статье подробно рассматриваются принципы работы больших языковых моделей (large language model, LLM). Поскольку в основе большинства современных LLM лежит архитектура трансформера (transformer), ее понимание дает представление о ключевых механизмах, обеспечивающих работу таких моделей.В этой статье мы разберем ключевые принципы работы современных LLM, построенных на архитектуре трансформера. Я постараюсь объяснить основные идеи без погружения в сложную математику. Конечно, для глубокого понимания темы математическая база важна, но для первого знакомства этого материала должно быть достаточно.

продолжить чтение