Пара вводных слов, чтобы было понятно о чем речь
Всем привет!
Я обещал написать эту статью и я наконец-то закончил тесты и готов поделиться с вами результатами.
Я потратил МНОГО времени на то, чтобы прогнать эти бенчмарки. Много времени на сетапы, много времени на ожидание тестов. Все вместе заняло около двух недель работы – модели обрывались, где-то нужно было костылять заплатки чтобы они отвечали, где-то просто ждать по несколько дней на прохождение теста (даже в многопоточном тестировании).
Наконец-то я получил ответы, которые мне интересны – и, надеюсь, будут интересны и вам, и создателям Алисы и Гигачата. Почему они сами не проходят такие бенчмарки я догадываюсь, но на месте руководства этими проектами я бы наоборот, поставил бы прохождение бенчмарков в цикл. Потому что только так можно понять где твоя модель, а где мировые лидеры.
Я хотел сделать бенчмарк и Маракуйи ИИ, но ребята ушли в глубокий рефакторинг и обещают скоро вернуться с совсем новым продуктом – отечественной кодовой средой, аналогом Cursor, Claude Code, Codex, но без VPN, иностранных карт и вообще суверенное решение. Поэтому, к сожалению, в этой статье я поделюсь результатами только трех моделей: Алиса, Гигачат Ультра, Гигачат Макс, а Маракуйю оставлю видимо на потом и на отдельную статью.
Алиса тестировалась через веб-коннектор – именно так, как с ней взаимодействуют пользователи. В 90% случаев она в процессе оправдывалась: “Сейчас повышенная нагрузка, поэтому я включаю модель попроще”. Но тест на то и есть тест: именно так с ней и взаимодействуют пользователи и именно такой результат они и получают. Гигачат – тестировался по АПИ. Бесплатных токенов, которые дают при регистрации, не хватило – поэтому я тестировал с трех аккаунтов: двух своих и с аккаунта жены. Этого хватило.
Важно про Алису: тестировалась Алиса, доступная пользователям. Алиса для бизнеса, которая появилась в Алиса 360, не тестировалась – она вышла недавно и пока что руки не дошли до нее. Вероятно, она покажет немного лучший результат; но судя по моему персональному опыту работы с ней, шансов на это не так чтобы много.
Ну вот и все о чем стоило бы рассказать перед тем, как я поделюсь результатами, а сами результаты – ниже.
Зачем гонять чужие бенчмарки
Русский чат легко проверить на «напиши стихотворение». Мне нужно было другое: держит ли он форму, когда задание длинное, на английском, с правилами и несколькими репликами подряд. Западные лаборатории для этого давно собрали открытые наборы задач. Я прогнал по ним отечественные чаты — одни вопросы, одни правила счёта.
Сначала модель отвечает как обычный чат, каждый пункт — новый диалог. Потом отдельный судья читает готовые ответы. Здесь это Grok 4.6. Если связь оборвалась и вопрос до модели не дошёл, попытку не считаю и повторяю. Если чат вернул пустоту или свою ошибку сервера — это ноль, а не «у нас сломался браузер».
Кто в сравнении
Алиса — чат на alice.yandex.ru с подпиской Яндекс Плюс. Человек в стране открывает сайт, поэтому я тестировал сайт.
GigaChat Max и GigaChat Ultra — два тарифа Сбера. Их нельзя склеить в одну строку: Ultra сильнее на длинном тексте и на задачах с инструментами, Max дешевле и слабее на тех же вопросах.
Arena-Hard — кто пишет лучше на трудном задании
Два ученика, одна сложная контрольная: код, кейс, длинная инструкция. Учитель не ставит «пять из пяти», а говорит, чей лист лучше. Так устроен Arena-Hard: 750 тяжёлых заданий, ответы сравниваются парами — победа, поражение или ничья. Победа уходит тому, кто довёл расчёт и закрыл пункты.
У каждой пары два столбика. Левый — доля побед модели слева в названии, правый — справа. Ничья входит в 750, на графике её нет. 83% у Max против Алисы значит: из 750 пар учитель отдал лист Max в 620 случаях, Алисе — в 106, ничья — 24.
На сложных письменных задачах Ultra чаще даёт полный и технически верный ответ, Max — заметно чаще Алисы. Алиса выигрывает там, где соперник отказывается или ломает условие. Порядок: Ultra, затем Max, затем Алиса.
WildBench — длинный рабочий чат
Обычный рабочий день с ассистентом: длинные треды, чеклисты, «доделай», «перепиши мягче», «учти прошлый абзац». WildBench — 1024 таких разговора. Судья ставит оценку от 1 до 10 за весь ответ. Пятёрка — «нормально, без блеска». Ниже пяти — слабее обычного. WB-Score — та же шкала, сдвинутая так, чтобы пятёрка стала нулём: (средняя − 5) × 2. Минус на ней не значит «ноль ответов», а «средняя ниже пяти».
Алиса в среднем чуть ниже «нормально», Max чуть выше, Ultra увереннее держит длинный чат. Разрыв небольшой, порядок тот же: Ultra, Max, Алиса.
MultiChallenge — память и послушание в диалоге
Диалог из нескольких реплик. В середине пользователь меняет правило, просит учесть сказанное раньше, правит текст. Модель отвечает на последнюю реплику. Судья говорит только «да» или «нет»: попал ли финальный ответ в критерий.
Четыре оси. Память — не забыть факт из начала разговора. Инструкция — не соскочить с правила, которое задали по ходу. Редактирование — править текст, а не писать заново мимо задания. Согласованность — не противоречить своему же предыдущему ответу.
46% у Ultra — примерно каждый второй финальный ответ попал в критерий. 15% у Алисы — примерно каждый седьмой. Для бытового чата это жёсткий экзамен: критерии узкие, история длинная.
Ultra вдвое чаще Max закрывает условие в конце длинного диалога. Алиса чаще теряет правило по пути. На «перепиши версию» все трое слабее, чем на память факта.
τ³ — агент в колл-центре
Модель сажают на место оператора. У неё правила компании и кнопки в учебной CRM: найти клиента, поменять билет, провести возврат. С другой стороны говорит симулятор клиента — в этом тесте везде Ultra. Зачёт только если задача закрыта по правилам с первого раза. Можно красиво извиниться и провалить возврат — балл не зачтётся. Три мира: авиабилеты, розница, телеком.
Число 0,66 у Ultra — доля успешных разговоров из 278. Алиса в среднем 0,076, Max 0,119. Ultra уходит вперёд за счёт телекома и розницы.
Ultra умеет закрывать тикет по правилам, особенно в телекоме. Max чаще срывает процедуру. Алиса на авиа далеко даже от Max, на рознице почти не закрывает сценарий, на телекоме внезапно немного обогнала Max.
Скорость ответа
Отдельная ось: сколько секунд чат думал, пока писал ответ. Это не качество. Алиса на Arena отвечает быстрее. Ultra на MultiChallenge отвечает быстрее Max.
Arena / WildBench / MultiChallenge, секунды: Алиса 9,6 / 10,4 / 19,2; Max 15,6 / 20,8 / 10,9; Ultra 17,9 / 21,6 / 10,7.
ПРАКТ-120 — работа с файлами и вебом
Это – самый интересный тест из всех. Он определяет как модель ведет себя в агентских задачах, которые реапьно нужны людям, то есть то, с чем фактически приходят люди к ИИ. Об этом тесте я писал в этой статье.
Кратно, что такое ПРАКТ-120: это 120 рабочих задач «как у человека в офисе с ChatGPT». Модели дают бриф и, где нужно, дают файлы в обработку. На выходе ждут текст с источниками, например в формате Word, или исправленную таблицу Excel, или ответ по пачке документов, и так далее. Эксперт ставит 0–100: правильность, полнота, следование инструкции, источники, пригодность в деле.
-
Поиск, 30 задач. Открытый веб, входных файлов нет. «Собери факты, укажи источники».
-
Документы, 30 задач. Ответ должен сидеть в выданной пачке. Выдуманная цитата режет балл.
-
Word, 25 задач. Нужен настоящий файл .docx, не текст в чате.
-
Excel, 25 задач. Нужен настоящий .xlsx с расчётом, не картинка таблицы.
-
Сквозные, 10 задач. Найти, посчитать, оформить документом.
Как выадются оценки: нет обязательного файла на выходе — ноль. Критическая выдумка, которая меняет решение, — не выше 49. Среднее по всем 120 задачам включает нули. Word, Excel и сквозные у всех троих — ноль: настоящего документа они не отдали.
Внезапно, Алиса, вебовская, почти на уровне Гигачата Ультра. Ультра лучше работает с документами, Алиса вытащила себя буквально за волосы за счет поисковика. Это и неудивительно, с Яндекс поиском в кармане.
Что из всего этого следует
На письменных и диалоговых тестах картина одна. Ultra сильнее Max, Max сильнее Алисы. Разрыв большой на Arena и MultiChallenge, спокойнее на WildBench: там все трое живут около школьной «четвёрки-пятёрки».
τ³ добавляет другое измерение: умение закрывать заявку по правилам в учебной CRM. Ultra здесь уходит далеко вперёд (0,66). Max и Алиса обе около 0,08–0,12 и практически бессильные.
Для офиса с файлами ПРАКТ важнее «напиши эссе»: Word и Excel у всех троих ноль, Ultra выигрывает за счёт работы с выданными документами, Алиса — за счёт поиска в вебе. Работать с файлами нормально из этих моделей никто не умеет (забегая вперед – Алиса для бизнеса наконец-то научилась работать более чем с одним файлом и даже появился какой-то RAG внутри; работает пока что криво-косо, автономии практически нет и каждые 5 минут надо тыкать палочкой чтобы продолжала – но это предмет следующих тестов).
Что еще из важного: письменные ответы оценивал Grok 4.6 Extra High. Другой судья может сдвинуть проценты. Порядок силы на этих трёх чатах совпал на Arena, WildBench и MultiChallenge. Это уже повод относиться к Ultra как к сильному отечественному чату на длинном тексте, к Max — как к середняку той же семьи, к Алисе — как к быстрому потребительскому чату, которому на жёстком ТЗ чаще не хватает полноты, и которая, спустя столько лет, все еще больше развлекушка, чем что-то полезное в реальных задачах.
Для тех, кто хочет изучить результаты (и может быть со мной посмотрить, найти неточности или косяки, или просто вникнуть в результаты) – архив с результатами тут.
Мое следующее приключение
Прямо сейчас я занимаюсь очередным мазохизмом: я пытаюсь прогнать Гигачат и Алису 360 через два самых сложных бенчмарка, которые наверное существуют в природе: OS World и Terminal Bench 4.
Предварительно скажу так: оценка 0 у всех. Грешил на настройки моей инфраструктуры, но судя по всему нет – модели просто не справляются. Возможно, эти тесты в принципе не скормить им снаружи, будучи обычным пользователем и не частью команды Алисы/Сбера, или без специального доступа к какому-нибудь АПИ. В общем если это читают разработчики Гигачата/Алисы и у вас есть желание независимого бенчмарка на том, на что смотрит весь мир – напишите мне в диалоги, проведем бенчмарки вместе.
Всем спасибо, надеюсь статья была интересная и может быть кому-то даже полезная.
Автор: Hau515


