галлюцинации LLM.

ИИ спотыкается не об ум, а об контекст: как генератор майндмап превратился в RAG по продукту

продолжить чтение

H-Neurons: 0.1% нейронов, из-за которых LLM врут

А вы когда-нибудь задумывались, почему ваша любимая LLM-ка на 70 лярдов параметров, обученная на всем интернете, может с уверенностью университетского профессора выдать, например, что Наполеон изобрел электричество? Откуда это берется?Долгое время индустрия списывала галлюцинации на плохие данные, кривой RLHF или декодинг. Но группа ученых из Университета Цинхуа

продолжить чтение

Три месяца с Claude: хороший ассистент, плохой программист

Мне выдали подписку на Claude и сказали выжимать максимум из токенов, так что я решил дать ему честный шанс. В этой статье расскажу, что из этого вышло.В наши дни от LLM становится всё сложнее спрятаться. Даже если вы избегаете соцсетей — или хотя бы тщательно подбираете подписки, чтобы не видеть основную массу нейрослопа, — и пропускаете мимо ушей громкие маркетинговые заявления, которые потом в новостях почему‑то преподносят как факты, LLM, скорее всего, всё равно найдут вас на работе.

продолжить чтение

Я убил все RAG‑системы и понял, как делать AGI. Или просто заменил RAG правилом в шесть строк

продолжить чтение

Как мы построили ИИ‑аналитику, которая не галлюцинирует

Я руковожу командой аналитиков. Мы работаем с данными брендов на маркетплейсах. Начну не с технологии, а с проблемы, из которой всё выросло.Каждый день мы разбираем, где у селлера утекают деньги. С данными у нас все было в порядке. Витрины были нормальные, дашборды наглядные, цифры под рукой. Дело было не в данных, а в людях. Дашборд показывает, что произошло, а разобраться, что с этим делать, должен уже аналитик.

продолжить чтение

Запрещаем AI выдумывать методы КОМПАС-3D: 200К пар обучения, модель на 34М и KOMPAS Guard в одном процессе

С чего все началосьKOMPAS Guard - это набор инструментов, который бьет AI-агента по рукам, когда тот пытается выдумать несуществующий код для КОМПАС-3D.В первой версии мы решили главную проблему: заставили агента опираться на факты. Существование методов доказывал граф типов, сигнатуры сверял компилятор C#, а отдельный процесс запускал код в реальном CAD. После этого соврать агент уже физически не мог.Зато всплыла другая беда: разрыв между человеческим языком и документацией. Граф типов знает все про IPart7.DefaultObject

продолжить чтение

Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне

Иногда самое опасное в исследовании — получить слишком красивый результат.Мы собрали training-free детектор галлюцинаций для RAG, получили хорошие метрики и наткнулись на группу примеров, где все шесть LLM единогласно спорили с эталонной разметкой. Сначала мы решили, что нашли общую слепую зону LLM-as-a-Judge — переносимый, заголовочный результат. Потом открыли первоисточник. И оказалось, что ошибались вовсе не модели.Дальше — история о том, почему несущим здесь оказалась не находка и не детектор, а процедура проверки, которая поймала нас самих.Что работает — и это мы не отзываем

продолжить чтение

Как мы отучали LLM выдумывать цифры в данных. Допрос Claude Desktop с пристрастием

Никто не верил, что модель можно подпустить к таблицам и заставить не галлюцинировать. Цифры из воздуха, выдуманные колонки, суммы, которые не сходятся с источником, думаю на этом обжигались все, кто пробовал. Мы заставили, проблемы все еще есть, но выглядят решаемыми.

продолжить чтение

RAG в энтерпрайзе: почему демо работает, а прод нет

Представьте себе типичное совещание. Кто-то из руководства возвращается с конференции, садится напротив и говорит: «У них там бот по внутренней документации, надо себе такой же. До конца квартала».Через четыре месяца у тебя есть Pinecone, OpenAI API, две недели работы над парсингом PDF и чат-бот, который на демо отвечает на пять подобранных вопросов идеально. А на шестой, который задаст любой нормальный сотрудник, отвечает уверенным бредом.Дальше про то, что именно между этими двумя состояниями происходит. Но без «правильной архитектуры RAG», потому что такой не существует.

продолжить чтение

Triage-and-Voice: как опыт колл-центров даёт рабочий паттерн для LLM-продуктов

Почему саппорт-бот на LLM работает против васLLM одновременно решает две вещи: что сказать и как это сказать. Под давлением пользователя (эмоциональным или манипулятивным) вторая задача почти всегда побеждает. Модель начинает звучать максимально полезно и заботливо, и при этом врёт.Простым промптом это не вылечить. Более дорогая модель тоже не спасает. Проблема сидит глубже, в архитектуре.

продолжить чтение

12