2. Рекурсивный движок llama.cpp на RTX 3050: тесты Qwen 32B и 7B Coder — прирост качества х3 и аппетиты по памяти
Всем привет! Это вторая часть статьи про форк llama.cpp. В ней я покажу реальные цифры и посмотрим, насколько лучше модель решает сложные задачи по сравнению с обычным движком, а также насколько вырастет потребление VRAM и загруженность видеокарты. Обозначения: D=0 — llama.cpp без патча, D=12 — улучшенный форк.ЖелезоВсе модели запускались на RTX 3050 6 ГБ, поэтому результаты на других видеокартах могут отличаться. Все модели запускались в формате Q4.
Почему агент на самом деле дешевле RAG
Наивная арифметика, которая всех обманываетКлассический RAG-ассистент работает так: пользователь пишет вопрос → эмбеддинг → поиск в векторе → один вызов LLM для синтеза. Одна итерация. Чисто, быстро, дёшево. Если ответ правильный.Проблема в том, что с первой попытки он правильный не всегда. Пользователь переспрашивает: «нет, я имел в виду другое». Ассистент делает второй запрос. Потом третий. К четвёртому переспросу пользователь машет рукой и зовёт живого оператора. Оператор тратит 10–15 минут, находит нужный документ, копирует абзац в чат. Вопрос закрыт. Стоимость вопроса — не 1 вызов LLM, а:
«Свой» уходит в опенсорс: вайб-темы, RAG поверх шифра и объектив, который знает контекст
Прошлая статья про «Свой» заканчивалась вопросом: что вообще делать с этим проектом — добивать и выкладывать в опенсорс, тянуть в «серую зону» на зарубежных моделях, или забыть. В итоге: я разобрался с 152-ФЗ, зарегистрировал все необходимые документы на обработку ПДн и трансграничную передачу и выложил проект в OpenSource.- основное приложение: https://github.com/Zazza/svoi-oss - внешний RAG (про него ниже — отдельная история): https://github.com/Zazza/svoi-oss-rag Лицензия — AGPL-3.0.
ИИ-агент работает, пока ему не дали доступ к реальным данным. Что ломается в проде?
На стенде ИИ-агенту легко быть умным. Все, что нужно для ответа, уже положили в контекст, а реальные системы оставили за пределами демо. В компании ему придется самому получать актуальные сведения из CRM, старой банковской системы, внутренних документов и сервисов. Для этого агенту выдают учетные данные и инструменты, то есть превращают его из чат-интерфейса в участника корпоративной системы. И только тогда выясняется: успешный пилот проверил возможности модели, но ничего не сказал о системе, которая должна снабжать ее данными, ограничивать и контролировать.
От чат-бота до ИИ-агента: 13 проектов российских компаний
Какие сценарии уже реализованы, какие результаты раскрываются публично и почему человек пока остается в контуре
Ассистент, а не агент: как спроектировать предсказуемую LLM-систему
Привет! Меня зовут Владимир Суворов, я Senior Data Scientist и core-разработчик open-source AutoML-фреймворка OutBoxML.В прошлой статье я разбирал четыре инженерных принципа, которые перенёс из расчётной механики в архитектуру ML-систем. Сегодня — про то, как спроектировать LLM-систему, которая надежно работает каждый день, не сжигает бюджет на токены и работает предсказуемо. Разберём на реальном примере: ассистенте, который сверяет входящий документ технического задания свободного формата со сводом документации и ставит комментарии наличии запрашиваемых пунктов в соотвествии с документацией.
Как я собирал AI-агентную команду для реального бизнеса, а не ассистента в чате
Схема работы главного агента XelaBot компании XelaGroupНемного оффтоп)
Ловушка модных фич: почему «хочу чат-бота» — плохое начало ИИ-проекта
Это продолжение разговора про то, что судьба автоматизации решается до первой строчки кода

