воспроизводимость.

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых голосов стоит за этим консенсусом. Оказалось — примерно два.## 1,9 из 6Посадите шесть разных инструктивных LLM судить одну задачу и выносить вердикт голосованием — интуиция подсказывает, что шесть моделей из четырёх лабораторий надёжнее одной: разные компании, архитектуры, страны, ошибки же должны быть независимыми.

продолжить чтение

Train и eval в ARC-AGI-2 — это разные распределения

Train и eval в ARC-AGI-2 лежат в разных распределенияхЕсли вы замеряете прогресс своего солвера на случайной подвыборке из train, вы замеряете его не на том наборе. Медианная задача train занимает 100 клеток на выходе, у медианной задачи eval их 225. Два и более тестовых входа требуют 6.9 процента задач train и 40.8 процента задач eval. Расхождение держится по всем шести структурным осям, которые я померил, и переживает поправку на множественные сравнения.

продолжить чтение

Я хотел просто спросить нейросети, где искать квартиру. В итоге собрал исследовательский пайплайн с 1197 тестами

Привет, по специальности своей я маркетолог, большую часть карьеры работаю с digital‑продвижением и продуктами в сфере недвижимости. Но в последний год начал активно погружаться в сторону AI: созданием цифровых продуктов с помощью ИИ, автоматизацией процессов и тем, как бренды вообще становятся видимыми в ответах ИИ. И как раз таки так получилось, что на последнем направлении я остановился чуть подробнее.

продолжить чтение

Ваш бэктест нейронки врёт на ±10 процентных пунктов

продолжить чтение

2160 раундов симуляции без кнопки «стоп». Исследование MiroFish, часть 3

Третья, заключительная статья об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В первой части изложены методология и находка Silent Failure; во второй слепота отчёта, управляемая графом. В этой части: как одна фраза запроса превращается в конфигурацию запуска, что систему ограничивает на длинной дистанции, и общая карта находок серии.

продолжить чтение

Жители Валдории живут 147 лет, а страна граничит с Германией и Японией одновременно. Исследование MiroFish. Часть 2

Вторая статья из трёх об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В первой части изложены методология исследования и находка Silent Failure. В этой части: досье вымышленной страны с восемью классами заложенного абсурда, четыре байт-идентичных прогона с разными результатами и пре-регистрированный эксперимент, который локализовал причину.

продолжить чтение

Что будет если загрузить в «симулятор общества» чистый lorem ipsum? Большое исследование MiroFish, часть 1

Первая статья из трёх об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В этой части: стек, методология и находка Silent Failure. Бэкенд зафиксировал отказ за десятки миллисекунд, статусный API отдал задачу как выполненную, а индикатор прогресса не отвечал более часа.

продолжить чтение

«Скопируй промпт дважды и получишь +76%». Я решил проверить

Всем привет. В декабре по всем AI-каналам пролетел лайфхак, который звучал как развод: продублируй свой запрос к нейросети, буквально Ctrl+C, Ctrl+V в одном сообщении, и точность вырастет. В пересказах фигурировали «+76%» и ссылка на Google Research, что придавало всей этой истории солидности. Трюк выглядел как-то настораживающе и при том вроде не сложным для проверки. Короче, я потратил $1.48, прогнал 3360 запросов и теперь знаю ответ. Он оказался интереснее, чем «работает || не работает».Что на самом деле написано в статьеИсточник это препринт Prompt Repetition Improves Non-Reasoning LLMs

продолжить чтение

Внешний бенчмарк причинного recall: проверяем память ИИ-ассистента на YDB Яндекса

Коротко, о чём речь, — для тех, кто пришёл по слову «Яндекс» и предыстории не знает. Когда ИИ-ассистент помогает чинить баг, самое ценное — не сочинить ответ с нуля, а 

продолжить чтение

Мы провели 35 контролируемых экспериментов с «экзотическими алгебрами» в нейросетях

TL;DR. Кватернионные, октонионные, седенионные и Clifford-слои регулярно появляются в статьях с обещаниями parameter efficiency и «особой выразительности». Мы два месяца строили их, бенчмаркали — и честно пытались заставить выиграть. Каждый раз, когда в сравнение добавлялся один правильно подобранный real-valued baseline, преимущество испарялось. Все 35 раз. По дороге мы убили собственный headline-результат, нашли единственное настоящее исключение (и объяснили его), доказали несколько потолков невозможности с точными константами и свели всё к правилу в одну строку, которое любой ревьюер может применить за 30 секунд. Препринт:

продолжить чтение

12