ии-ассистент. - страница 4

2. Рекурсивный движок llama.cpp на RTX 3050: тесты Qwen 32B и 7B Coder — прирост качества х3 и аппетиты по памяти

Всем привет! Это вторая часть статьи про форк llama.cpp. В ней я покажу реальные цифры и посмотрим, насколько лучше модель решает сложные задачи по сравнению с обычным движком, а также насколько вырастет потребление VRAM и загруженность видеокарты. Обозначения: D=0 — llama.cpp без патча, D=12 — улучшенный форк.ЖелезоВсе модели запускались на RTX 3050 6 ГБ, поэтому результаты на других видеокартах могут отличаться. Все модели запускались в формате Q4.

продолжить чтение

Почему агент на самом деле дешевле RAG

Наивная арифметика, которая всех обманываетКлассический RAG-ассистент работает так: пользователь пишет вопрос → эмбеддинг → поиск в векторе → один вызов LLM для синтеза. Одна итерация. Чисто, быстро, дёшево. Если ответ правильный.Проблема в том, что с первой попытки он правильный не всегда. Пользователь переспрашивает: «нет, я имел в виду другое». Ассистент делает второй запрос. Потом третий. К четвёртому переспросу пользователь машет рукой и зовёт живого оператора. Оператор тратит 10–15 минут, находит нужный документ, копирует абзац в чат. Вопрос закрыт. Стоимость вопроса — не 1 вызов LLM, а:

продолжить чтение

Практика программирования в эпоху ИИ (разбор реальной задачи на С++ с помощью ИИ агента)

продолжить чтение

«Свой» уходит в опенсорс: вайб-темы, RAG поверх шифра и объектив, который знает контекст

Прошлая статья про «Свой» заканчивалась вопросом: что вообще делать с этим проектом — добивать и выкладывать в опенсорс, тянуть в «серую зону» на зарубежных моделях, или забыть. В итоге: я разобрался с 152-ФЗ, зарегистрировал все необходимые документы на обработку ПДн и трансграничную передачу и выложил проект в OpenSource.- основное приложение: https://github.com/Zazza/svoi-oss - внешний RAG (про него ниже — отдельная история): https://github.com/Zazza/svoi-oss-rag Лицензия — AGPL-3.0.

продолжить чтение

ИИ-агент работает, пока ему не дали доступ к реальным данным. Что ломается в проде?

На стенде ИИ-агенту легко быть умным. Все, что нужно для ответа, уже положили в контекст, а реальные системы оставили за пределами демо. В компании ему придется самому получать актуальные сведения из CRM, старой банковской системы, внутренних документов и сервисов. Для этого агенту выдают учетные данные и инструменты, то есть превращают его из чат-интерфейса в участника корпоративной системы. И только тогда выясняется: успешный пилот проверил возможности модели, но ничего не сказал о системе, которая должна снабжать ее данными, ограничивать и контролировать.

продолжить чтение

От чат-бота до ИИ-агента: 13 проектов российских компаний

Какие сценарии уже реализованы, какие результаты раскрываются публично и почему человек пока остается в контуре

продолжить чтение

Ассистент, а не агент: как спроектировать предсказуемую LLM-систему

Привет! Меня зовут Владимир Суворов, я Senior Data Scientist и core-разработчик open-source AutoML-фреймворка OutBoxML.В прошлой статье я разбирал четыре инженерных принципа, которые перенёс из расчётной механики в архитектуру ML-систем. Сегодня — про то, как спроектировать LLM-систему, которая надежно работает каждый день, не сжигает бюджет на токены и работает предсказуемо. Разберём на реальном примере: ассистенте, который сверяет входящий документ технического задания свободного формата со сводом документации и ставит комментарии наличии запрашиваемых пунктов в соотвествии с документацией.

продолжить чтение

Как я собирал AI-агентную команду для реального бизнеса, а не ассистента в чате

Схема работы главного агента XelaBot компании XelaGroupНемного оффтоп)

продолжить чтение

Пишем свой Claude Code на Python: LLM, цикл и семь инженерных решений, о которых молчат туториалы

продолжить чтение

Ловушка модных фич: почему «хочу чат-бота» — плохое начало ИИ-проекта

Это продолжение разговора про то, что судьба автоматизации решается до первой строчки кода

продолжить чтение

1...234567...2030...36