От промптов к циклам: как давать AI‑агенту проверяемые задачи
В работе с AI‑кодерами постепенно меняется формат задачи. Одного промпта часто недостаточно: агенту нужно не только выполнить разовую команду, но и повторять действия до понятного результата. Например: проверить CI, прочитать лог, внести минимальное исправление, снова запустить тест, остановиться при выполнении условий.
Квантование ломает вызов инструментов не так, как показывает BFCL: проверил на MCP-серверах
Есть простая практическая задача, из-за которой я вообще все это затеял. Вы берете маленькую модель, квантуете ее, чтобы она влезла в ноутбучную видеокарту, и хотите заранее понимать, насколько просядет ее способность вызывать инструменты. Обычно для этого смотрят на BFCL или ToolACE: там все измерено, есть таблицы, есть готовые цифры деградации по уровням квантования. И кажется логичным, что этими цифрами можно пользоваться.
Как я построил систему, внутри которой AI пишет код [Сгенерировано]
Последние полгода я почти не пишу код руками. И, пожалуй, это лучшее изменение в моём процессе разработки за последние годы.Нет, я не перестал быть разработчиком. Просто моя работа изменилась. Раньше большую часть времени я писал код сам. Теперь я проектирую инженерную систему, внутри которой этот код пишет AI. Моя задача — не объяснить модели, что нужно сделать, а создать среду, в которой она физически не сможет принять неправильное решение.В этой статье я покажу, как устроена моя система разработки и почему именно такой подход позволяет использовать AI в реальных проектах без потери качества.Вы узнаете:
Запускаем LLM локально на майнинг ферме из 4 GPU
В последнее время становится все более популярным локальный запуск LLM. У каждогг свои причины, но основные это: проблемы с западными сервисами, нестабильный интернет и утечка данных в открытый доступ (преценденты уже были).В этой статье я расскажу как запускал LLM локально на майнинговом железе, какие тонкости есть при запуске. Расскажу архитектуру моей сборки и примерную стоимость железа. Также протестирую скорость работы с некоторыми наиболее популярными MoE LLM, включая модели от гугла и ChatGPT. По поводу целесообразности подобных сборок решение каждый примет сам исходя из своих задач и финансовых ресурсов.
Я отдал разработку автономному ИИ — промежуточные итоги за 178 релизов
Продолжение эксперимента, в котором автономный пайплайн пишет и катит код в прод без человеческого ревью. 178 релизов, 1.4 млрд токенов, ноль строк кода, прочитанных человеком перед мержем. Что сработало, что сломалось и почему главная работа теперь — не код.
Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front
LLM inference benchmarkС чего все началосьУ меня была вполне приземленная задача: понять, на каком бэкенде гонять одну и ту же открытую модель — на vLLM, llama.cpp, ONNX Runtime или просто на transformers. Звучит как вопрос на пять минут, пока ты не начинаешь честно мерить.
LLM Sandbox: пример реализации агента с песочницей [часть 2, практика]
ВведениеСтатья посвящена практической реализации агента с изолированной средой исполнения кода. Рассказываю как устроен агент, который пишет и исполняет код в Docker песочнице.

