rag.
120 выдуманных ссылок против 8: что агентный поиск делает с галлюцинациями LLM на строительных нормах
Один контрольный эксперимент — и один красивый ложный вывод, который мы чуть не опубликовалиTL;DRШесть систем × 100 вопросов по строительным нормам, отобранных из ~6 000 реальных запросов пользователей; 3000 оценок от пяти LLM-судей — вслепую, по единой рубрике, с проверкой ссылок по корпусу нормативов.Контрольный эксперимент: один и тот же генератор (DeepSeek V4-Pro) с агентным поисковым контуром и без. С контуром — достоверность ссылок 4,25 из 5 и 8 пометок «выдуманная ссылка»; соло — 2,60 и 120 пометок.Лучший генералист (GPT-5.5) обходит систему только по полноте ответа. Обе «доказательные» оси проигрывает.
52 открытых урока второй половины июля: LLM, C++, Playwright, Kubernetes, TOGAF и не только
Привет, хабровчане! Собрали открытые уроки второй половины июля по ключевым ИТ‑направлениям: от LLM, RAG и Claude Code до C++, Java, Go, Playwright, Kubernetes, сетей ЦОД, TOGAF и тестирования.Уроки проходят онлайн и бесплатны для участников. Можно выбрать одну тему, посмотреть, как преподаватель разбирает практическую задачу, задать вопросы и заодно понять, подходит ли вам формат обучения в OTUS.⬇️ Выбрать свое направлениеAI и ML Разработка Инфраструктура, DevOps и сети Архитектура и enterprise‑системы
Четыре истории внедрения ИИ в бизнесе: агент для заявок, RAG по документам и проверка сметы нейросетями
«Внедрить ИИ» — формулировка, за которой на практике скрываются совершенно разные по масштабу работы. Одной компании нужен агент, который годами живёт на сервере и разбирает входящие заявки. Другой — разовый прогон одного документа через связку нейросетей перед подписанием акта. Третьей автоматизация вообще ни к чему: важнее, чтобы команда сама умела ставить задачи агенту и проверять результат, без подрядчика на каждое изменение.
Метод, которого не существовало: как я собрал локальный RAG для CAD API
Локальный RAG для Smart3D API
Контекстная инженерия: что это такое, как работать с контекстом и почему за это начали платить
Вы собрали диалоговую систему — агента с RAG, инструментами и памятью. На коротких диалогах всё работает: модель выбирает нужный инструмент и достаёт данные. Но через несколько десятков итераций агент уже путает инструменты, тянет в ответ старые вызовы и опирается на ошибку, которая раньше попала в контекст.Новый промпт не всегда решает проблему: важно управлять тем, какая информация попадает к модели перед каждым следующим шагом. Это и называют контекстной инженерией.
Чек-лист тестирования поисковой системы: от engine sanity до RAG и графов знаний
Чек-лист для тестирования поисковых и RAG-систем — от базовой работоспособности поискового движка до качества генерации, агентных сценариев и поведения на неполных данных. Шесть уровней проверок, сводная таблица с инструментами для каждого уровня и глоссарий из 50+ терминов. Проверку стоит организовывать по порядку, нет смысла гонять RAG-метрики, если система не проходит Уровень 0, то проблема может быть в том, что поиск не находит документ из-за опечатки в запросе, а не в качестве генерации. Перед тестированием По каким полям/источникам поиск должен работать, по каким — нет
Жизнь после RAG: MCP, логи и автоматический анализ тикетов Jira
Привет, Хабр! Меня зовут Илья Парамошин, я ведущий инженер в МТС Web Services. В прошлый раз я рассказывал об архитектуре RAG-помощника для технической поддержки: индексации Confluence и Jira, гибридном поиске, генерации ответов с цитатами и оценке качества поиска. А недавно мы опубликовали продолжение — о том, как построили ИИ-агента для анализа тикетов.
You don’t need OpenClaw—write your own
Hello, Habr! My name is Nikita Pastukhov—author of FastStream, Principal Engineer, and maintainer of AG2 (a framework for agent development). I’ve been in development for 8 years, and for the last year, I’ve been up to my ears in agents.And I want to prove to you that writing your own agent is no more difficult than writing a CRUD application.Why does this even need to be proven? Because there’s a noticeable gap between what’s happening with AI in the world and what’s happening in the average Russian company:The WorldRussiaEvery company has a subscription to OpenAI / Claude / CopilotDANGEROUS, we host our own modelsA billion startups making AI productsUnclear

