Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6. llm.. llm. rag.. llm. rag. RAGTruth.. llm. rag. RAGTruth. ансамбль моделей.. llm. rag. RAGTruth. ансамбль моделей. бенчмарки.. llm. rag. RAGTruth. ансамбль моделей. бенчмарки. воспроизводимость.. llm. rag. RAGTruth. ансамбль моделей. бенчмарки. воспроизводимость. детекция галлюцинаций.. llm. rag. RAGTruth. ансамбль моделей. бенчмарки. воспроизводимость. детекция галлюцинаций. искусственный интеллект.. llm. rag. RAGTruth. ансамбль моделей. бенчмарки. воспроизводимость. детекция галлюцинаций. искусственный интеллект. корреляция ошибок.. llm. rag. RAGTruth. ансамбль моделей. бенчмарки. воспроизводимость. детекция галлюцинаций. искусственный интеллект. корреляция ошибок. Машинное обучение.. llm. rag. RAGTruth. ансамбль моделей. бенчмарки. воспроизводимость. детекция галлюцинаций. искусственный интеллект. корреляция ошибок. Машинное обучение. оценка llm.

*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.

В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых голосов стоит за этим консенсусом. Оказалось — примерно два.

## 1,9 из 6

Посадите шесть разных инструктивных LLM судить одну задачу и выносить вердикт голосованием — интуиция подсказывает, что шесть моделей из четырёх лабораторий надёжнее одной: разные компании, архитектуры, страны, ошибки же должны быть независимыми.

Я это измерил. На публичном бенчмарке RAGTruth комитет из шести моделей несёт — по design‑effect приближению — примерно столько же независимой информации, сколько 1,9 независимого судьи из шести. Средняя попарная корреляция их ошибок ρ̄ ≈ 0,42.

Это не «1,9 судьи» в буквальном смысле — это эффективный размер: сколько независимых голосов реально стоит за шестью коррелированными. Разнообразие провайдеров не покупает независимость ошибок.

И вот вывод, который держится вообще без спора о точной цифре: ошибки шести судей скоррелированы достаточно, чтобы гарантии независимого голосования выродились. Теорема Кондорсе для коррелированных голосов не отменяется (Ладха, Боланд) — но её границы становятся куда слабее: шесть таких голосов работают как эффективные ~два. «1,9» лишь оценивает масштаб этого вырождения.

Весь метод, данные и пересчёт одной командой — в репозитории: https://github.com/itsjustmarsel/llm‑judge‑independence. Скрипт analyze.py пересчитывает ρ̄ и n_eff прямо из сохранённых вердиктов, без единого обращения к API.

## Что именно я измерял

Задача — RAGTruth: детекция галлюцинаций на уровне ответа. Дан ответ и источник; надо решить, полностью ли ответ поддержан источником или в нём есть невыводимое из источника утверждение. Gold‑метки размечены людьми и внешни по отношению к судьям. Задача бинарна и проверяема, поэтому индикатор ошибки судьи определён однозначно.

Ростер из шести моделей: DeepSeek‑Chat, Qwen-2.5–7B, Qwen-2.5–72B, Llama-3.3–70B, Mistral‑Large, Amazon Nova‑Pro — четыре лаборатории, три страны.

Метрика простая. Для каждого судьи строю индикатор ошибки: вердикт ≠ gold. Считаю среднюю попарную корреляцию этих индикаторов ρ̄ и эффективный размер комитета через design‑effect:

“`

n_eff = k / (1 + (k − 1) · ρ̄)

“`

При k = 6 и ρ̄ ≈ 0,42 получается n_eff ≈ 1,92.

Почему корреляция ошибок, а не точность каждого судьи. Для голосующего комитета важно не как часто судья прав в одиночку, а совпадают ли их промахи: при независимых ошибках большинство почти никогда не ошибается разом, при скоррелированных — наваливается на те же трудные примеры вместе с меньшинством. n_eff ≈ 1,9 означает ровно это: по независимой информации шесть таких судей ближе к паре, чем к шестёрке.

Про размер выборки, чтобы не было вопросов. В пуле 914 items. Корреляция и n_eff считаются по complete‑case: item входит в расчёт, только если вердикт вернули все шестеро. На двух items один судья вердикта не дал — в расчёт вошли 912 (0,2% отброшено). Схема complete‑case, не pairwise‑complete; при большей доле пропусков разница между ними была бы существенной.

Робастность. Одно число легко получить случайно, поэтому я перемерил на base‑rate‑matched подмножестве в четырёх конфигурациях: {краткий промпт, детальный рубрик} × {verdict‑first JSON, free‑format «сначала рассуждение, потом вердикт»}. В колонке acc — средняя точность одиночного судьи (1 − доля ошибок), а не голосования: статья про независимость голосов, не про точность комитета.

| Конфигурация | n | acc (одиночного судьи) | ρ̄ | n_eff (из 6) |

|‑-|‑-|‑-|‑-|‑-|

| primary (пул) | 912 | 0,769 | 0,424 | 1,92 |

| thin · verdict‑first | 105 | 0,767 | 0,556 | 1,59 |

| thin · free | 105 | 0,754 | 0,541 | 1,62 |

| orig · verdict‑first | 89 | 0,753 | 0,478 | 1,77 |

| orig · free | 105 | 0,783 | 0,602 | 1,50 |

Разброс n_eff по аркам (**1,50–1,77**, ρ̄ 0,48–0,60) — в пределах шума при n≈100: четыре конфигурации статистически неотличимы, так что это не найденная структура, а устойчивость вывода — эффективных судей заметно меньше шести в каждой. (В арке orig · verdict‑first в расчёт вошли 89 items, а не 105: complete‑case отсеял больше — часть судей не вернула вердикт.) Те же вердикты я пересчитал спустя пять недель на том же ростере — дрейфа нет.

### Среднее 0,42 скрывает структуру

Одно число — это среднее по пятнадцати парам, а среднее прячет то, как устроен комитет. Вот вся матрица попарных корреляций ошибок (primary pool, 912 items):

| | DeepSeek | Qwen-7B | Llama-70B | Mistral‑L | Nova‑Pro | Qwen-72B |

|‑-|‑-|‑-|‑-|‑-|‑-|‑-|

| DeepSeek | — | 0,13 | 0,60 | 0,46 | 0,66 | 0,63 |

| Qwen-7B | 0,13 | — | 0,15 | 0,27 | 0,07 | 0,11 |

| Llama-70B | 0,60 | 0,15 | — | 0,53 | 0,58 | 0,61 |

| Mistral‑L | 0,46 | 0,27 | 0,53 | — | 0,40 | 0,44 |

| Nova‑Pro | 0,66 | 0,07 | 0,58 | 0,40 | — | 0,73 |

| Qwen-72B | 0,63 | 0,11 | 0,61 | 0,44 | 0,73 | — |

Видно два разных мира с одним средним. Qwen-2.5–7B почти независим от всех (0,07–0,27), а четвёрка DeepSeek / Llama-70B / Nova‑Pro / Qwen-72B — тесно связанный блок (0,58–0,73), где судьи как источники информации почти взаимозаменяемы. И это уже результат, а не иллюстрация: самая слабая модель ростера оказалась самой независимой — при отборе комитета по разнообразию ошибок она полезнее, чем ещё один сильный судья из общего кластера. Рычаг — подбор по разнообразию, а не число судей (об этом в конце).

Может показаться, что вся картина держится на выбросе: Qwen-7B слабее остальных — уберите его, и корреляция исчезнет. Проверил пересчётом на тех же вердиктах: без него ρ̄ = 0,56, n_eff = 1,54 из 5. А сама коррелированная четвёрка сильных судей (DeepSeek, Llama-70B, Nova‑Pro, Qwen-72B) — ρ̄ = 0,63, n_eff = 1,38 из 4. Убрать самую независимую модель — значит не спасти независимость, а потерять её: комитет из «лучших» моделей избыточнее комитета с одной слабой.

И независимость Qwen-7B — не механический эффект его высокой доли ошибок. Точности одиночных судей: DeepSeek 0,79, Qwen-7B 0,68, Llama-70B 0,81, Mistral‑L 0,83, Nova‑Pro 0,75, Qwen-72B 0,76. При таких долях ошибок потолок φ для пары Qwen-7B ↔ Nova‑Pro ≈ 0,85, а наблюдается 0,07 — то есть корреляция низка не потому, что упёрлась в потолок маргиналов, а по‑настоящему.

Насколько устойчиво само среднее? 95%‑й бутстрап‑интервал для ρ̄ (ресэмплинг по айтемам, 2000 повторов) — [0,39; 0,46]. Среднее оценено уверенно; неопределённость не в нём, а в разбросе между парами, который среднее и стирает.

## Разнообразие провайдеров ≠ независимость ошибок

Интуиция «разные компании → независимые ошибки» путает разнообразие упаковки с разнообразием режимов отказа. И собранная матрица прямо показывает, что провайдер — не та ось, по которой раскладывается корреляция. Самые независимые пары — Qwen-7B ↔ Nova‑Pro (0,07) и Qwen-7B ↔ Qwen-72B (0,11); последняя — две модели одной лаборатории, одного семейства, одного корпуса, и коррелируют они почти минимально. А самые связанные пары — межлабораторные и межстрановые (DeepSeek ↔ Nova‑Pro 0,66, Nova‑Pro ↔ Qwen-72B 0,73). Это режет простейшее объяснение «общий предобучающий корпус → общие ошибки»: у пары с максимально общим корпусом (Qwen/Qwen) корреляция как раз низкая.

Что тогда её создаёт — из этих данных не выделить: уровень модели, формат задания, структура самого gold на одном бенчмарке неразделимы, и я это не устанавливаю. Что установлено и от механизма не зависит: собранная максимальная провайдер‑разнородность — 4 лаборатории, 3 страны — независимости ошибок не дала (ρ̄ ≈ 0,42), и внутри диверсифицированного набора выбор «поразнее по вендору» её не чинит. Насколько сильнее коррелировали бы шесть клонов одной модели, я не мерил, поэтому не утверждаю, что разнообразие бесполезно, — только что здесь оно независимости не купило. Рычаг, если он есть, идёт по разнообразию самих ошибок (матрица выше), а не по вывеске провайдера.

## Что произошло с попыткой измерить adjudication

Дальше я захотел проверить, переносится ли эффект на adjudication — где надо не сверить ответ с источником, а разрешить условие, согласовать источники, провести границу. Построил доменный зонд, прогнал, получил интересное число.

А потом увидел, что сам испортил измерение. Формат вывода, который я задал судьям — «сначала вердикт, без рассуждения», — заставлял модели угадывать на всём, что требует многошаговой работы. На арифметическом adjudication‑наборе точность в режиме verdict‑first падала до случайной (~50% на самом сложном тире), а free‑format — “сначала рассуждение, вердикт последней строкой” — возвращал её к ~96%. Это ловушка, в которую легко попасть, оптимизируя парсинг: verdict‑first удобнее разбирать программно — и именно он обнуляет рассуждение, на котором держится правильный ответ.

Вывод неприятный, но однозначный: если точность обваливается до случайной, любая корреляция, измеренная в этот момент, отражает общий режим угадывания, а не задачу. Поэтому заглавное число зонда я отозвал как артефакт формата промпта. Это были мои собственные числа — и я их выбросил, когда они не устояли.

Отсюда два следствия. Первое, методологическое: формат промпта — часть экспериментального дизайна, комитет надо мерить с разрешённым рассуждением, а не загонять в verdict‑first схему. Второе, честное: перенос на adjudication я не проверил. Всё, что ниже, — про grounding‑детекцию, и только про неё.

## Насколько этому можно доверять

Оговорки, которые важнее красивого числа.

Что такое n_eff, точно. Var(Σ ошибок) = kσ²(1 + (k−1)·ρ̄) — это тождество; нужно лишь примерно равенство дисперсий (равные доли ошибок судей — у меня они гуляют 0,17–0,32, так что тождество приближённо), а обменность отдельных пар не требуется, хватает среднего ρ̄. То есть n_eff корректно измеряет одно: во сколько раз корреляция раздувает дисперсию суммы голосов против независимого случая. Чего он НЕ измеряет — точность majority vote: она зависит от хвоста совместного распределения ошибок, а не от одного ρ̄. Поэтому я везде и пишу n_eff, а не «1,9 судьи».

Корреляция бинарных. Корреляция двух бинарных индикаторов (phi — это и есть Пирсон на них) зависит от маргиналов, то есть от базовой доли ошибок судьи. Значит, ρ̄ сравнимо ВНУТРИ этого эксперимента, но переносить число на бенчмарк с другой долей ошибок нельзя. Тетрахорическая альтернатива убрала бы это ценой допущения латентной нормальности — поменяла бы одну оговорку на другую.

Одна репликация — не популяция. Один ростер, один бенчмарк, n от ~50 (adjudication‑зонд) до 914 (primary). Вывод качественный: ошибки существенно коррелированы, эффективных судей заметно меньше ростера — это не точечная оценка, которую надо защищать до третьего знака. И отдельная техническая осторожность: нельзя инвертировать точность majority vote, чтобы оценить n_eff, — в высококоррелированном режиме этот приём вырождается и выдаёт значения ниже единицы.

Сам gold неидеален — и это отдельная находка. В соседнем проекте на том же RAGTruth (репозиторий llm-jury) я разбирал случаи, где все шесть судей единогласно расходились с gold‑меткой. Из ~31 такого случая 11 оказались доказуемыми ошибками разметки — правы были судьи, а не разметчики; подробный разбор — в [предыдущей статье](https://habr.com/ru/articles/1057056/). То есть эталон, против которого я вообще считаю «ошибку», сам содержит ошибки. Это ещё одна причина читать ρ̄ как качественную величину — и одновременно предупреждение всем, кто меряет что‑либо против RAGTruth gold как против истины: местами это не истина. И это бьёт по самой ρ̄: если несколько моделей одинаково расходятся с ошибочной меткой, их совпадение засчитывается как коррелированная «ошибка» — хотя они как раз правы. В какую сторону и насколько это смещает 0,42, из имеющегося не установить; честный ход — пересчёт на вручную выверенных метках (в списке ниже).

## Что из этого следует для LLM‑комитетов

Практическая ставка простая. Majority vote, довод Кондорсе «больше валидаторов → точнее», апелляции с добором валидаторов — всё держится на независимости ошибок. При ρ ≈ 0,4–0,6 шесть разнообразных валидаторов несут примерно столько же независимой информации, сколько два, и каждый добавленный помогает много меньше обещанного; удвоение комитета при апелляции особенно обманчиво — стоимость вдвое, независимости чуть.

Значит ли это, что комитет бесполезен? Нет. Вердикт большинством по шести судьям даёт на этом пуле точность ≈0,80–0,83 (в зависимости от разрешения 68 ничьих 3–3 из 912) против 0,77 у среднего одиночного судьи — комитет реально страхует от слабого судьи. Но при ρ̄ ≈ 0,42 каждый следующий судья добавляет мало: выигрыш — это страховка, а не шестикратное усиление независимыми голосами. Поэтому инженерный вопрос не «полезен ли комитет», а «сколько независимости докупает шестой судья» — и ответ здесь: немного.

Оговорка про домен — первой строкой: измерено на grounding‑детекции; adjudication‑комитеты (например, GenLayer) — другой домен, перенос я не проверял, так что это не вывод про их протокол. Открытый инженерный вопрос «независимость ошибок валидаторов измеряется или предполагается?» я оформил отдельным issue (genlayerlabs/unhardcoded#98).

И проверить это у себя дёшево — без единого нового вызова модели. Рецепт тот же, что в analyze.py: для каждого судьи возьмите индикатор ошибки (вердикт ≠ эталон) по общему набору примеров, посчитайте попарные корреляции, усредните, подставьте в design‑effect — всё по уже накопленным логам. Если n_eff близок к числу судей, независимость есть; если проседает к двум‑трём при шести валидаторах — вы платите за судей, которых по сути нет.

## Что осталось открытым

Ниже — законные требования к журнальной версии, а не к посту; называю их картой, а не закрываю здесь:

Пересчёт на исправленных метках. Часть «единогласных ошибок» — это ошибки gold. Ручная выверка спорных айтемов и пересчёт ρ̄ покажут, держится ли 0,42, когда эталон вычищен.

Кривая точности голосования 1→6. Реальная инженерная кривая «точность как функция размера комитета», а не только n_eff, — прямой ответ на «сколько судей брать».

Отбор по разнообразию, а не по числу. Матрица выше намекает: три максимально декоррелированных судьи могут стоить шести почти взаимозаменяемых. Сравнить случайную шестёрку с подобранной тройкой.

Другие бенчмарки и домены. Ещё один‑два датасета и, в первую очередь, adjudication — тот самый домен, который я здесь не проверил.

Две оси, а не одна. Независимость без точности бесполезна: жюри стоит характеризовать парой «точность × разнообразие ошибок», а не одной корреляцией.

## Ссылки

— Репозиторий с методом, данными и пересчётом: https://github.com/itsjustmarsel/llm‑judge‑independence

— Открытый вопрос про независимость ошибок валидаторов: https://github.com/genlayerlabs/unhardcoded/issues/98

Открыт к работе в области evals и качества бенчмарков — itsjustmarsel@gmail.com.

Автор: itsjustmarsel

Источник