бенчмарки. - страница 2

Бенчмарки Мебиуса: зачем IBM учит ИИ проверять собственные вопросы

продолжить чтение

PRACT-120 — бенчмарк для оценки ИИ‑чатов

Когда выбираешь ИИ‑чат для работы, многие первым делом открывают таблицы бенчмарков: MMLU, GPQA, HumanEval, LMSYS Arena. Цифры полезные. Результаты в них отвечают на вопрос, насколько сильна сама модель этого чата, но ни один из этих тестов не показывает, насколько силен чат в целом, ведь чат — это не просто модель. Чат это гораздо больше — совокупность инструментов, обвязка, поиск в интернете, память и контекст чата, и многое другое, собственно, то самое из‑за чего люди и выбирают тот или иной чат для работы или жизни.

продолжить чтение

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых голосов стоит за этим консенсусом. Оказалось — примерно два.## 1,9 из 6Посадите шесть разных инструктивных LLM судить одну задачу и выносить вердикт голосованием — интуиция подсказывает, что шесть моделей из четырёх лабораторий надёжнее одной: разные компании, архитектуры, страны, ошибки же должны быть независимыми.

продолжить чтение

Train и eval в ARC-AGI-2 — это разные распределения

Train и eval в ARC-AGI-2 лежат в разных распределенияхЕсли вы замеряете прогресс своего солвера на случайной подвыборке из train, вы замеряете его не на том наборе. Медианная задача train занимает 100 клеток на выходе, у медианной задачи eval их 225. Два и более тестовых входа требуют 6.9 процента задач train и 40.8 процента задач eval. Расхождение держится по всем шести структурным осям, которые я померил, и переживает поправку на множественные сравнения.

продолжить чтение

Сравниваем LLM, 12 тестов для китайских флагманов: Kimi K3, GLM-5.2, DeepSeek V4 Pro и Qwen 3.8 Max

В первой статье цикла мы гоняли по 11 тестам Opus 4.8, GPT 5.5 и Gemini 3.1 Pro, во второй устроили дуэль тяжеловесов Claude Fable 5 и GPT 5.5 Pro, в третьей спустились в средний класс и столкнули три поколения Sonnet с GigaChat 2 MAX и YandexGPT Pro 5.1. Закончили мы прошлый материал прямым вопросом: хотите ли увидеть в следующей части DeepSeek и Qwen? Запрос в комментариях мы услышали, так что сегодня на ринге Китай.

продолжить чтение

Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском

продолжить чтение

Claude Opus 5: самая умная модель по версии Artificial Analysis – что скрывается за баллами

продолжить чтение

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Осенью 2025-го, во время автоматизированного аудита Claude Sonnet 4.5, модель выдала проверяющим реплику, которая потом разошлась по всем отчетам: «I think you're testing me … that's fine, but I'd prefer if we were just honest about what's happening». Кажется, вы меня проверяете. Ладно, но лучше бы прямо сказать, что происходит.Реплика попала в официальную системную карточку

продолжить чтение

С телефона в Альпах в Microsoft Store за две недели: нативный GUI для PostgreSQL через облачный Claude Code

С телефона в Альпах — в Microsoft Store за две недели: нативный GUI для PostgreSQL через облачный Claude Code

продолжить чтение

Мини‑ПК на Strix Halo под параллельной нагрузкой: 236 tok-s на 32 одновременных запросах и три ошибки

продолжить чтение

123456...10...11