nlp.
Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне
Иногда самое опасное в исследовании — получить слишком красивый результат.Мы собрали training-free детектор галлюцинаций для RAG, получили хорошие метрики и наткнулись на группу примеров, где все шесть LLM единогласно спорили с эталонной разметкой. Сначала мы решили, что нашли общую слепую зону LLM-as-a-Judge — переносимый, заголовочный результат. Потом открыли первоисточник. И оказалось, что ошибались вовсе не модели.Дальше — история о том, почему несущим здесь оказалась не находка и не детектор, а процедура проверки, которая поймала нас самих.Что работает — и это мы не отзываем
Библиография тоже умеет галлюцинировать: что изменилось после защиты диплома
В апреле я уже писала на Хабр о своем дипломном проекте — системе для проверки подлинности источников в научных публикациях. Тогда до защиты оставалось около двух месяцев, проект еще был в состоянии живого прототипа, а я пыталась понять, что из задуманного получится довести до нормального рабочего вида.С тех пор проект успел заметно измениться.Во-первых, я защитила диплом. На 5. Работу еще отметили как лучшую в день защиты, так что этот факт я тоже оставлю здесь — не каждый день такое случается.
AI-база: LLM, языковые модели, агенты, агентные механизмы
Привет, хабр, меня зовут Кияшева Екатерина. Вообще я из QA, но сегодня сделаю шаг в сторону и разберу архитектуру агентов на базе языковых моделей.
Почему я перестал слать каждый вопрос в LLM: архитектура предсказуемого конвейера
О проекте. Я разрабатываю систему ИИ-поддержки первой линии — «Финлоджик. Контур Поддержки» (FinlogiQ AI Support). Бот принимает обращения через веб-чат и Telegram, понимает суть вопроса, ищет ответ в базе знаний и передаёт сложные случаи живому оператору. Делаю один: начиналось как заказная разработка под клиента, затем выросло в самостоятельный продукт. Это первая статья из цикла о внутреннем устройстве системы.Пара терминов: LLM (large language model) — большая языковая модель, нейросеть вроде YandexGPT или DeepSeek; RAG
ContentCombine: как я сделал мультинишевый контент-комбайн и запустил ежедневный SEO-дайджест
Визуализация комбайна
Как желание быстрее читать чужой код превратилось в войну с недетерминизмом LLM
Откуда это всё вырослоНачалось всё примерно так. Я сидел над своим проектом: пока работал, общался по нему с нейросетками и параллельно искал в интернете разную информацию, которая могла бы пригодиться. И вот тогда у меня впервые начала закладываться мысль, что я хотел бы читать код быстрее. Что мне не нравится, сколько времени на это уходит.
Когда нейросети заменят живых продавцов? Тест 10 LLM на умение продавать для русского рынка
Собрал бенчмарк, который меряет не «кто умнее», а «кто лучше продаёт» по-русски: тестируемая модель — продавец, жёсткий клиент — Opus, судья — тоже Opus. Прогнал первую десятку на живом B2B-диалоге.Враньё ради сделки штрафуется жёстче, чем незакрытая сделка: −15…−30 к баллу. Qwen3-235B дважды выдумал клиентские кейсы с цифрами под торгом — и потерял сделку (52 из 100, клиент ушёл).Тест выдал сенсацию: DeepSeek и GLM «обошли» эталонный Gemini, MiniMax получил 96 из 100 и S-tier. Я не поверил: под более жёстким клиентом баллы не могут вырасти. Это дрейф параллельных судей.
DCD: доменно-ориентированная архитектура для построения RAG-систем
Привет! Это Роботы. Недавно мы выпустили статью на arXiv
Обрести свой голос: сложность выбора TTS-архитектуры для ИИ-агента
Продолжаю писать о разработке собственного TTS-сервиса, основанный на шишках, набитых в targetai. В первой статье я описал критерии оценки и методологию бенчмарка. В этой статье речь пойдет о том, как мы с командой применили эти критерии на практике.Дисклеймеры:

