rag.
Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6
*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых голосов стоит за этим консенсусом. Оказалось — примерно два.## 1,9 из 6Посадите шесть разных инструктивных LLM судить одну задачу и выносить вердикт голосованием — интуиция подсказывает, что шесть моделей из четырёх лабораторий надёжнее одной: разные компании, архитектуры, страны, ошибки же должны быть независимыми.
ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта
У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает?Судья, который читал только текст диалога, ставил 18/20, а проверка по реальным вызовам инструментов давала 8/20. Текстовые проверки считали правдоподобный ответ верным и не могли отличить его от подтвержденного. Самодельный «процент фантомных эскалаций» оказался измерением того, насколько слова бота согласованы с его же внутренними флагами. Каждая метрика что‑то измеряла, и ничего продуктового
Память агента без вектор-БД: 363 markdown-файла вместо эмбеддингов
У меня восемь агентов с постоянной памятью, и на всех вместе больше 360 файлов, около 1,4 МБ текста. Векторной базы нет ни одной: эмбеддинги я не считаю вообще.И это не “руки не дошли”. Схема работает с мая 2026 года: сначала на одном агенте, с июня централизованно на всех восьми. За это время вопрос про вектор-БД я поднимал трижды, каждый раз с конкретным кандидатом на внедрение, и каждый раз закрывал его отказом. Ниже разберу, как это устроено, какими числами живет и в какой момент перестанет работать.Рефлекс, от которого я отказался
Вики из 48 часов видео: конвейер, который не даёт LLM выдумывать
У меня было 48 часов видеозаписей учебного курса и простая мысль: пересматривать это я не буду никогда. Сырой транскрипт немногим лучше — болото на сотни страниц. Я собрал конвейер, который превратил записи в Obsidian-вики: 47 связанных статей, и каждое утверждение в любой из них — в двух кликах от места в записи, где это было сказано.Зачем, если есть готовоеЗадача личная: вики для собственного использования. Я недавно писал
Нужную книгу больше не обязательно искать: как ИИ меняет сам принцип работы с информацией
Эдуард Ланчев · «Ланчев PRO ИИ»
Правильный код мы отклоняем — и так задумано
Работаю в компании «Сибинтек-Софт», занимаюсь поддержкой корпоративных информационных систем. Имею сертификат DevOps-инженера, в рамках задач отдела внедряю ИИ в рабочие процессы.Как-то мой валидатор забраковал ответ, сославшись на статью, которой не существует.
Строим RAG вручную: как это работает под капотом
Имея некоторый опыт в построении классических ML и CV-проектов, я решил разобраться в NLP (Natural Language Processing) и собрать свою RAG-систему без использования сторонних RAG-фреймворков (LangChain, LlamaIndex и т.п.). Моя цель - понять, как на самом деле работает RAG под капотом: от разбиения текста до генерации ответа. Проблема, которую решает RAG Готовые LLM модели имеют несколько недостатков:модель не имеет доступа к документам, отсутствовавшим в обучающей выборке (внутренние базы знаний, личные файлы);модель не знает о событиях после даты отсечения обучающих данных;

