Найти человека по голосу среди 134 тысяч записей
Имея на руках всего три оставшихся слота для отправки, наша команда вошла в последние часы дататона.Всю предыдущую неделю мы наращивали ансамбль, который встал на отметке 0.6605. Каждая новая модель приносила от силы одну-две тысячных прироста и требовала лишних полутора часов инференса. Восьмая архитектура не имела смысла.Поэтому мы прекратили возиться с моделями и переключились на то, как из уже посчитанных векторов строится индекс соседей. Рассчитывали попасть куда-то в диапазон 0.67–0.69. Получили 0.7042 и десятое место среди 93 участников.
Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6
*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых голосов стоит за этим консенсусом. Оказалось — примерно два.## 1,9 из 6Посадите шесть разных инструктивных LLM судить одну задачу и выносить вердикт голосованием — интуиция подсказывает, что шесть моделей из четырёх лабораторий надёжнее одной: разные компании, архитектуры, страны, ошибки же должны быть независимыми.
«Особое мнение» по каждому SKU: три AI-модели вместо BI-правил
Архитектура SaaS-аналитики прибыли для продавцов Ozon и Wildberries. Консилиум из трёх моделей, реверс-инжиниринг API, параллельные агенты Claude Code. Без приукрашивания — что сработало, а что нет.Бизнес-контекст и ретроспектива первых недель — отдельной статьёй на VC.ru. Тут — техника.
Как построить прогноз, которому верит бизнес: от Excel до нейросетей за полгода
Когда ваш прогноз летит в помойку

