rag. - страница 12

rag.

Мы меняли LLM и промпты, а ошибка оказалась совсем в другом месте

Это бонусный материл в серии о внедрении LLM в клиентские сервисы. Если в прошлых трех статьях

продолжить чтение

RAG для закупок: Qdrant и LlamaIndex в локальном контуре

Привет Хабр! Меня зовут Владимир, и недавно я решил изучить новую (для себя) технологию - LlamaIndex. А тут и задачка подвернулась - надоело копаться в Положении о закупках, поэтому понадобился RAG для ответов по ФЗ-44, ФЗ-223, ну и локальному положению.В этой статье разберу, как создать простенький RAG, не выходящий из локального контура, на базе LlamaIndex + Qdrant, напишем к нему API и UI на Gradio. Поехали.Конфигурация проектаДля сервиса понадобятся LLM, векторная БД Qdrant, эмбеддер и реранкер результатов. Сразу код конфигурации:Код конфигурации

продолжить чтение

Как мы создавали «умный» поиск по регламенту вуза

Сначала — пара слов о себе, иначе непонятно, откуда вообще взялся весь проект. Я преподаю на кафедре информационных технологий в одном из вузов нашего города и при этом больше двадцати лет пишу код не в учебных примерах, а в бою. Эти две роли — преподавателя и практикующего разработчика — в какой-то момент и сошлись в одном небольшом проекте, который я затеял для себя.

продолжить чтение

EventRAG: как научить RAG искать первопричину во времени, а не в тексте

On-prem RCA-ассистент для цеха + AR-HUD. Полный разбор: архитектура, формулы, расчёты, живой инцидент на роботе-паллетайзере Hyundai Hi5-N00 и что мы везём на международную конференциюTL;DR. Обычный RAG отлично отвечает по инструкциям, но проваливается на root-cause-анализе (RCA) в цеху: косинусная близость по эмбеддингам выбрасывает время и причинность — ровно то, без чего нельзя связать «наряд, отложенный 67 дней назад» с «алармом, который встал сегодня». EventRAG — архитектура, которая нормализует каждое событие в Temporal Event Unit, хранит его в двойном индексе (вектор + причинный граф), ищет по времени, обходит граф

продолжить чтение

Contextual Retrieval: техника, которая чинит главную проблему RAG за 50 центов на тысячу чанков

Привет, Хабр! В сентябре 2024 года Anthropic опубликовала технику Contextual Retrieval с обещанием снизить процент неудачных извлечений в RAG‑системах на 49% при использовании только embeddings и на 67% в сочетании с reranking. К середине 2026 года эта техника закрепилась как один из стандартов production‑RAG и применяется в подавляющем большинстве серьёзных корпоративных систем. Разберём, в чём её суть, почему она вообще работает, как её реализовать и где она ломается.Корневая проблема classical RAG, которую долго игнорировали

продолжить чтение

Как я обучил русский RAG‑сплиттер, который режет документы по индексам, а не по тексту

TL;DR. Из интереса обучил собственный русский RAG‑сплиттер — захотелось проверить, можно ли сделать context‑aware‑нарезку русских документов лучше готовых чанкеров.Я взял идею датской context-aware-splitter, пересобрал её под русский на базе T-lite-it-2.1 и изменил главное: модель возвращает индексы границ, а не переписанный текст. Хост потом режет оригинал по этим индексам.У index‑output оказалось три практических плюса:СвойствоЧто получаетсяLossless‑нарезкачанки совпадают с исходником байт‑в-байт

продолжить чтение

PAD+ AI v4.0: исследовательская когнитивная архитектура поверх LLM

Что происходит между запросом пользователя и ответом языковой модели?За последние несколько лет большие языковые модели совершили настоящую революцию. Сегодня они способны писать код, анализировать документы, помогать в исследованиях, создавать тексты и решать сложные задачи.Однако подавляющее большинство современных AI‑приложений имеют практически одинаковую архитектуру:Запрос → Prompt → LLM → ОтветВся интеллектуальная работа фактически сосредоточена внутри языковой модели, а внешняя система лишь подготавливает запрос и отображает результат.

продолжить чтение

Сжатие декодерных эмбеддеров: как ужать 8B до продакшена без потери recall

В прошлой статье мы разбирали, почему retrieval в 2026 переехал с энкодеров на декодерные LLM: Qwen3-Embedding, NV-Embed, E5-Mistral эмбеддят лучше BGE, держат 32k контекста и понимают инструкции в промпте.Проблема простая. Декодерный эмбеддер 7–8B действительно дает качество. Но за это качество вы платите трижды: память (8B в fp16 - не только веса модели, но и жирные векторы в индексе), latency (forward-pass большой модели) и деньги (GPU под нагрузкой или счет за эмбеддинг-API). И если latency лечится инференс-стеком (SGLang, батчинг - тема будущей статьи серии), то стоимость

продолжить чтение

Как мы встроили ИИ-агентов в платформу: архитектура, сценарии, безопасность

ИИ-ассистент в корпоративной среде довольно быстро упирается в одно ограничение: он отвечает на вопросы, но ничего не делает. Спросить можно, но создать задачу, собрать данные по инцидентам, отправить дайджест, найти связанные объекты — уже нет.В то же время в бизнесе только и разговоров, что об ИИ-агентах — эта сущность, в отличие от чат-бота или ассистента, может действовать самостоятельно. Получив запрос, ИИ-агент оценивает доступные инструменты и сам решает, в какой последовательности их вызвать. Жёсткого сценария нет, есть набор методов и инструкция, что этот агент умеет делать.

продолжить чтение

AI-база: LLM, языковые модели, агенты, агентные механизмы

Привет, хабр, меня зовут Кияшева Екатерина. Вообще я из QA, но сегодня сделаю шаг в сторону и разберу архитектуру агентов на базе языковых моделей.

продолжить чтение