Как устроен RAG для юридических документов и почему одной LLM оказалось недостаточно
Первый вариант системы выглядел вполне стандартно: документы разбиваются на фрагменты, для них считаются embeddings, пользователь задаёт вопрос, несколько наиболее подходящих фрагментов отправляются в LLM вместе с запросом. Модель формулирует ответ — на первых тестах этого было достаточно.Проблемы начались на вопросах, которые на первый взгляд мало чем отличаются друг от друга:Какая пеня установлена в договоре № 14/24.7645?Кто из арендаторов не заплатил за май?А у него предусмотрена индексация?Контрагент предлагает добавить пеню в 0,01%. Насколько это существенно?
Как мы сделали RAG, который почти не галлюцинирует
Привет, Хабр! На связи команда CVM (Customer Value Management) B2B из МТС — техлид Артём Каледин и ML-инженер Александр Швайко. Менеджер должен быстро разбираться, как строить обсуждение с техническим директором компании. Но даже если информация о продукте есть, иногда бывает сложно быстро найти нужные материалы и выбрать плюсы для конкретного клиента. Раньше коллеги готовились к встречам с помощью Telegram-бота, но недавно от бизнеса поступила задача: сократить время на подготовку и повысить качество рекомендаций и контента. В статье по мотивам доклада на Inside AI Meetup
Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline
Почему корпоративный RAG - это не «загрузить документы в векторную базу»В любой большой компании есть люди, которым регулярно пишут:«А как у нас оформляется постоплата?»«Кто согласует риски в сделке?»«За сколько дней нужно оформить командировку?»
Возвращение RAG в 2026 году
В прошлом году я попытался «убить» RAG в продукте, который мне был важен.У нас был retrieval-пайплайн, который в целом работал, но раздражал. В нём случались всплески задержек, были пограничные случаи, которые мы не могли воспроизвести, и копился бэклог правок: лучшее разбиение на фрагменты, более точные фильтры, более качественный реранкинг, более хорошие оценки (evals).Потом стало проще покупать большой контекст и проще его оправдывать. Искушение было очевидным: если мы просто будем вставлять больше текста в промпт, то сможем выкинуть пайплайн, убрать онколл и выкатить всё в прод.
Как мы учили поиск понимать контекст: практическое руководство Купера для маркетплейсов
Когда слов недостаточно, поможет семантический поиск на ElasticsearchВ IT-сообществе только и разговоров об эмбеддингах, metric learning, косинусных расстояниях и семантическом поиске. На конференциях все рассказывают про нейросети и векторные пространства. Но если заглянуть под капот и посмотреть, что реально работает в поиске крупных маркетплейсов и e-commerce платформ, то там, как правило, он — добрый, старый полнотекстовый индекс.

