Как мы построили ИИ‑аналитику, которая не галлюцинирует
Я руковожу командой аналитиков. Мы работаем с данными брендов на маркетплейсах. Начну не с технологии, а с проблемы, из которой всё выросло.Каждый день мы разбираем, где у селлера утекают деньги. С данными у нас все было в порядке. Витрины были нормальные, дашборды наглядные, цифры под рукой. Дело было не в данных, а в людях. Дашборд показывает, что произошло, а разобраться, что с этим делать, должен уже аналитик.
Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне
Иногда самое опасное в исследовании — получить слишком красивый результат.Мы собрали training-free детектор галлюцинаций для RAG, получили хорошие метрики и наткнулись на группу примеров, где все шесть LLM единогласно спорили с эталонной разметкой. Сначала мы решили, что нашли общую слепую зону LLM-as-a-Judge — переносимый, заголовочный результат. Потом открыли первоисточник. И оказалось, что ошибались вовсе не модели.Дальше — история о том, почему несущим здесь оказалась не находка и не детектор, а процедура проверки, которая поймала нас самих.Что работает — и это мы не отзываем
Как мы отучали LLM выдумывать цифры в данных. Допрос Claude Desktop с пристрастием
Никто не верил, что модель можно подпустить к таблицам и заставить не галлюцинировать. Цифры из воздуха, выдуманные колонки, суммы, которые не сходятся с источником, думаю на этом обжигались все, кто пробовал. Мы заставили, проблемы все еще есть, но выглядят решаемыми.
Triage-and-Voice: как опыт колл-центров даёт рабочий паттерн для LLM-продуктов
Почему саппорт-бот на LLM работает против васLLM одновременно решает две вещи: что сказать и как это сказать. Под давлением пользователя (эмоциональным или манипулятивным) вторая задача почти всегда побеждает. Модель начинает звучать максимально полезно и заботливо, и при этом врёт.Простым промптом это не вылечить. Более дорогая модель тоже не спасает. Проблема сидит глубже, в архитектуре.
Почему ваш LLM-бот врёт клиентам — и паттерн, который это чинит
Почему саппорт-бот на LLM работает против васLLM в саппорте одновременно решает две задачи: что сказать и как это сказать. Под давлением пользователя вторая всегда побеждает — модель звучит заботливо и при этом врёт. Промптом это не чинится.Дальше — два громких факапа, их общий корень и архитектурный паттерн Triage → Gate → Voice, который разделяет эти задачи.
Объяснение галлюцинаций LLM
Примечание: этот текст ориентирован на разработчиков, работающих с большими языковыми моделями, но его ценность для аналитиков заключается в том, что он предлагает конкретные методы для повышения точности и надежности данных, используемых в аналитике. Важно, что аналитику не нужно быть экспертом в разработке ИИ, чтобы воспользоваться этими подходами. Внедрив эти подходы, аналитики могут минимизировать риски ошибок и сделать свои отчеты и прогнозы более точными, основанными на надежных данных

