галлюцинации LLM.

Я убил все RAG‑системы и понял, как делать AGI. Или просто заменил RAG правилом в шесть строк

продолжить чтение

Как мы построили ИИ‑аналитику, которая не галлюцинирует

Я руковожу командой аналитиков. Мы работаем с данными брендов на маркетплейсах. Начну не с технологии, а с проблемы, из которой всё выросло.Каждый день мы разбираем, где у селлера утекают деньги. С данными у нас все было в порядке. Витрины были нормальные, дашборды наглядные, цифры под рукой. Дело было не в данных, а в людях. Дашборд показывает, что произошло, а разобраться, что с этим делать, должен уже аналитик.

продолжить чтение

Запрещаем AI выдумывать методы КОМПАС-3D: 200К пар обучения, модель на 34М и KOMPAS Guard в одном процессе

С чего все началосьKOMPAS Guard - это набор инструментов, который бьет AI-агента по рукам, когда тот пытается выдумать несуществующий код для КОМПАС-3D.В первой версии мы решили главную проблему: заставили агента опираться на факты. Существование методов доказывал граф типов, сигнатуры сверял компилятор C#, а отдельный процесс запускал код в реальном CAD. После этого соврать агент уже физически не мог.Зато всплыла другая беда: разрыв между человеческим языком и документацией. Граф типов знает все про IPart7.DefaultObject

продолжить чтение

Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне

Иногда самое опасное в исследовании — получить слишком красивый результат.Мы собрали training-free детектор галлюцинаций для RAG, получили хорошие метрики и наткнулись на группу примеров, где все шесть LLM единогласно спорили с эталонной разметкой. Сначала мы решили, что нашли общую слепую зону LLM-as-a-Judge — переносимый, заголовочный результат. Потом открыли первоисточник. И оказалось, что ошибались вовсе не модели.Дальше — история о том, почему несущим здесь оказалась не находка и не детектор, а процедура проверки, которая поймала нас самих.Что работает — и это мы не отзываем

продолжить чтение

Как мы отучали LLM выдумывать цифры в данных. Допрос Claude Desktop с пристрастием

Никто не верил, что модель можно подпустить к таблицам и заставить не галлюцинировать. Цифры из воздуха, выдуманные колонки, суммы, которые не сходятся с источником, думаю на этом обжигались все, кто пробовал. Мы заставили, проблемы все еще есть, но выглядят решаемыми.

продолжить чтение

RAG в энтерпрайзе: почему демо работает, а прод нет

Представьте себе типичное совещание. Кто-то из руководства возвращается с конференции, садится напротив и говорит: «У них там бот по внутренней документации, надо себе такой же. До конца квартала».Через четыре месяца у тебя есть Pinecone, OpenAI API, две недели работы над парсингом PDF и чат-бот, который на демо отвечает на пять подобранных вопросов идеально. А на шестой, который задаст любой нормальный сотрудник, отвечает уверенным бредом.Дальше про то, что именно между этими двумя состояниями происходит. Но без «правильной архитектуры RAG», потому что такой не существует.

продолжить чтение

Triage-and-Voice: как опыт колл-центров даёт рабочий паттерн для LLM-продуктов

Почему саппорт-бот на LLM работает против васLLM одновременно решает две вещи: что сказать и как это сказать. Под давлением пользователя (эмоциональным или манипулятивным) вторая задача почти всегда побеждает. Модель начинает звучать максимально полезно и заботливо, и при этом врёт.Простым промптом это не вылечить. Более дорогая модель тоже не спасает. Проблема сидит глубже, в архитектуре.

продолжить чтение

Почему ваш LLM-бот врёт клиентам — и паттерн, который это чинит

Почему саппорт-бот на LLM работает против васLLM в саппорте одновременно решает две задачи: что сказать и как это сказать. Под давлением пользователя вторая всегда побеждает — модель звучит заботливо и при этом врёт. Промптом это не чинится.Дальше — два громких факапа, их общий корень и архитектурный паттерн Triage → Gate → Voice, который разделяет эти задачи.

продолжить чтение

Список литературы тоже умеет галлюцинировать: как я делаю систему проверки научных источников

продолжить чтение

Объяснение галлюцинаций LLM

Примечание: этот текст ориентирован на разработчиков, работающих с большими языковыми моделями, но его ценность для аналитиков заключается в том, что он предлагает конкретные методы для повышения точности и надежности данных, используемых в аналитике. Важно, что аналитику не нужно быть экспертом в разработке ИИ, чтобы воспользоваться этими подходами. Внедрив эти подходы, аналитики могут минимизировать риски ошибок и сделать свои отчеты и прогнозы более точными, основанными на надежных данных

продолжить чтение