- BrainTools - https://www.braintools.ru -
Всем привет. На связи Сергей Игнатенко, основатель ИИ‑платформы VibePilot.
Мы тут сделали свой бенчмарк моделей ИИ, которые работают внутри наших ИИ‑агентов.
Дело в том, что наши ИИ‑агенты работают на суверенных моделях Яндекса (Alice AI LLM, YandexGPT 5 Pro) уже с апреля этого года. Традиционно считается, что это слабые модели, которые не приспособлены для агентных сценариев [1]. Благодаря проработанной архитектуре мы добились того, что слабые модели делают сложные задачи. Чтобы это доказать и показать, и была сделана страница.
Другого способа сравнить китайские и отечественные LLM в прикладной работе просто не существует. Независимые бенчмарки публикуют сравнение на традиционных задачах: алгоритмы, математика [2], программирование, ответы на вопросы. Мне эти сравнения неинтересны. Мне интересно другое: если поставить модели задачу «смета на ремонт квартиры 60 м² с разбивкой по разделам», получу ли я на выходе нормальный.xlsx, за сколько секунд и за сколько рублей. Это и есть ежедневные задачи VibePilot: генерация Word, Excel, презентаций и сайтов.
Ключевое отличие от академических тестов: у нас модель никогда не отвечает «в вакууме». Она работает как полноценный агент с инструментами внутри конвейера, и конвейер для всех моделей один и тот же.
Для документов и таблиц конвейер состоит из трёх шагов: проверка вложений, генерация содержимого, проверка структуры. Для сайтов из четырёх: изучение задачи, выбор стека, сборка страницы, проверка вёрстки. Каждый шаг ограничен по инструментам, по числу итераций и по цели. Модель не решает, что делать дальше; она решает только, что написать на этом шаге.
Отсюда три метрики, которые мы считаем:
Сбой. Задача не дошла до готового файла. Не «ответ так себе по мнению другой нейросети», а именно отсутствие результата после всех ретраев конвейера.
Время. От старта до готового файла, включая все запросы к модели и все проверки.
Стоимость. Реальный расход токенов по тарифу провайдера, в рублях за задачу.
Задачи настоящие, из повседневной работы пользователей: сметы, акты, договоры, коммерческие предложения, многостраничные таблицы Excel с формулами, презентации, лендинги с формой заявки. Ни одной синтетической.
1 198 задач, 22 сбоя, 1,8%. Шесть моделей в рейтинге.
|
Модель |
Провайдер |
Задач |
Сбоев |
Среднее время |
Токены (ср.) |
Стоимость |
|---|---|---|---|---|---|---|
|
DeepSeek V4 |
DeepSeek (прямой API) |
18 |
0,0% |
2 мин 27 сек |
1,9K |
1,32 ₽ |
|
DeepSeek V3.2 |
DeepSeek (прямой API) |
44 |
0,0% |
3 мин 15 сек |
1,4K |
0,13 ₽ |
|
YandexGPT 5 Pro |
Yandex Cloud |
322 |
1,2% |
2 мин 52 сек |
3,6K |
4,43 ₽ |
|
Qwen3-235B |
Yandex Cloud |
210 |
1,9% |
4 мин 25 сек |
3,4K |
2,22 ₽ |
|
DeepSeek V4 |
Yandex Cloud |
273 |
2,2% |
4 мин 09 сек |
3,5K |
2,47 ₽ |
|
Alice AI LLM |
Yandex Cloud |
331 |
2,4% |
2 мин 39 сек |
3,0K |
2,60 ₽ |
Сразу про то, что бросается в глаза.
Нули у DeepSeek напрямую ничего не значат. 18 и 44 задачи против 200–330 у моделей в Yandex Cloud. При n = 18 один сбой уже даёт 5,5%. Мы показываем размер выборки в каждой строке именно для того, чтобы никто не делал выводов по этим двум строкам. Прямой API DeepSeek у нас в конце цепочки фолбэков, поэтому и задач туда попадает мало.
Одна и та же модель через разных провайдеров даёт разные цифры. DeepSeek V4 через Yandex Cloud: 273 задачи, 2,2% сбоев, 4 мин 09 сек. Через прямой API: 18 задач, 0%, 2 мин 27 сек. Разница во времени почти в два раза. Тут и разные версии развёртывания, и разные лимиты, и разная нагрузка на инференс. Вывод из этого не «облако портит модель», а «сравнивать надо не модели, а конкретные модели у конкретных провайдеров». Что мы и делаем.
Разброс по стоимости почти в 35 раз. От 0,13 ₽ у DeepSeek V3.2 напрямую до 4,43 ₽ у YandexGPT 5 Pro. Это средние по всем типам задач; на конкретной задаче расклад может быть совсем другим, что хорошо видно в забегах ниже.
Лидерборд показывает статистику. Забег показывает конкретику: одна задача, две модели, параллельно, через один и тот же конвейер. Я прогнал четыре задачи, которые честно взяты из того, что люди делают в платформе каждый день.
Задача: смета на ремонт квартиры 60 м², разделы (демонтаж, электрика, сантехника, штукатурка и стяжка, чистовая отделка), в каждой строке наименование, единица измерения, количество, цена, сумма, итоги по разделам и общий итог.
|
|
Alice AI LLM |
Qwen3-235B |
|---|---|---|
|
Время |
19 сек |
1 мин 27 сек |
|
Запросов к модели |
2 |
5 |
|
Токенов |
385 |
1 182 |
[скрин: забег «Смета на ремонт квартиры 60 м²»]
Разрыв в четыре с половиной раза по времени и в три раза по токенам. При этом структура у Алисы даже аккуратнее: она сделала заголовки разделов отдельными строками (ДЕМОНТАЖ, ЭЛЕКТРИКА) и под каждым итог «Итого по демонтажу». Qwen обошёлся строками «Итого: Демонтаж» без выделенных заголовков разделов, то есть визуально смета читается хуже.
Обратите внимание [3] на пять запросов к модели у Qwen против двух у Алисы. Это конвейер отрабатывал уточнения: модели не хватило одного прохода, чтобы выдать структуру, которую примет валидатор. На стоимость это влияет напрямую.
Задача: три листа по месяцам плюс сводный, шесть категорий расходов, на сводном суммы через SUMIF со ссылкой на месячные листы, доля каждой категории в процентах и график.
|
|
DeepSeek V4 (Yandex Cloud) |
YandexGPT 5 Pro |
|---|---|---|
|
Время |
46 сек |
20 сек |
|
Таблиц (листов) |
4 |
4 |
|
Токенов |
461 |
810 |
Оба справились с многолистовой структурой: Июль, Август, Сентябрь, Сводный. YandexGPT быстрее вдвое.
Но вот интересное. На месячном листе DeepSeek сделал три колонки: категория, сумма, доля в процентах с формулой вида =B2/$B$7. YandexGPT на том же листе сделал две: статья и сумма. Формально задание про доли относилось к сводному листу, так что придраться не к чему, но разница в подходе видна: одна модель распространила требование на все листы, другая выполнила его буквально там, где оно написано.
Это, кстати, общая черта суверенных моделей, которую я вижу постоянно: если не перечислить пункты явно, документ будет сделан по минимуму. И Алиса, и YandexGPT Pro охотно упрощают. Хорошая новость в том, что лечится это одной строчкой в промпте, а не сменой модели.
Задача: доходы и расходы по категориям, остаток на конец месяца, процент от дохода, условное форматирование при превышении лимита.
|
|
Alice AI LLM |
GigaChat 2 Max (SberCloud) |
|---|---|---|
|
Время |
41 сек |
28 сек |
|
Запросов к модели |
5 |
4 |
|
Ошибочных запросов |
0 |
3 |
|
Токенов |
828 |
182 |
Формально победил GigaChat: 28 секунд против 41. По нашей метрике победитель определяется по времени до готового файла, и это ровно тот случай, когда метрика вводит в заблуждение.
Что на самом деле в файлах. Алиса сделала колонку «Лимит» (о которой в задании было только косвенно, через условное форматирование), остаток на конец месяца формулой =B1-SUM(B2:B6) и добавила круговой график распределения расходов по категориям, хотя графика в задании не было вообще. GigaChat сделал плоскую таблицу доход/расход/процент/остаток с итоговой строкой, без графика и без лимитов.
И три ошибочных запроса из четырёх у GigaChat. Задача до результата дошла, конвейер вытянул, но с третьей попытки. У Алисы ноль ошибочных при пяти запросах.
Так что «GigaChat выиграл» здесь означает только «GigaChat быстрее выдал более простой файл».
Задача: КП от студии дизайна интерьера, семь разделов перечислены явно (о компании, этапы работы, что входит в услугу, сроки, стоимость по этапам, условия оплаты, контакты), тон деловой, но не сухой.
|
|
GigaChat 2 Max (SberCloud) |
Alice AI LLM |
|---|---|---|
|
Время |
3 мин 48 сек |
45 сек |
|
Запросов к модели |
8 |
5 |
|
Ошибочных запросов |
1 |
0 |
|
Страниц |
1 |
2 |
Пятикратный разрыв по времени, и на этот раз он совпал с разрывом по содержанию.
GigaChat уложился в одну страницу. Раздел «О компании» целиком: одно предложение про то, что студия занимается дизайном интерьеров более десяти лет. Этапы работы: два пункта, консультация и подготовка эскиза. В таблицу стоимости попала одна строка. Плюс один ошибочный запрос по дороге и восемь обращений к модели.
Алиса за 45 секунд выдала две страницы: таблицу стоимости по этапам с цифрами и сроками (дизайн‑проект, комплектация, авторский надзор, итого 343 750 ₽ и 4 месяца), условия оплаты разбивкой 30/40/30, контакты отдельной таблицей.
Разделы в задании были перечислены явно в обоих случаях. То есть дело не в промпте: GigaChat 2 Max на документах с разделами пока заметно уступает. Есть куда расти.
Теперь можно честно объяснить заголовок.
По доле сбоев Alice AI LLM на последнем месте среди шести: 2,4%, 8 сбоев на 331 задачу. Но посмотрите на соседние столбцы: среднее время 2 мин 39 сек, лучшее среди моделей в Yandex Cloud, и 2,60 ₽ за задачу при самой большой выборке. А в забегах она выигрывает большинство задач по документам Word и уверенно держится в Excel.
Акт выполненных работ: Алиса 18 секунд, DeepSeek V4 через Yandex Cloud 42 секунды. Договор аренды квартиры: 22 секунды. Смета на 60 м²: 19 секунд против полутора минут у Qwen. Коммерческое предложение: 45 секунд против почти четырёх минут у GigaChat.
Для документа, где нужно быстро выдать структурно правильный текст по шаблону, Алиса на голову быстрее и дешевле всех. А 2,4% сбоев конвейер закрывает ретраем на другую модель в цепочке, и пользователь этого обычно не видит.
Где Алиса не выигрывает: лендинги. Там четыре этапа, генерация HTML и CSS, проверка вёрстки, и вот тут лидер уже YandexGPT 5 Pro. Сайт стоматологии с формой заявки: YandexGPT 5 Pro за 1 мин 25 сек и 9 запросов к модели, Qwen3-235B за 4 мин 51 сек и 14 запросов. Причём Qwen сделал более красивую страницу, с hero‑блоком и нормальной типографикой, а YandexGPT выдал честный список ссылок и фото.
[скрин: забег «Сайт стоматологии», Qwen3-235B vs YandexGPT-5-Pro]
Так что «Алиса выигрывает» это не «Алиса лучшая модель». Это «внутри жёсткого конвейера самая быстрая и дешёвая российская модель побеждает на самом массовом типе задач». Год назад я бы в это не поверил.
Главный практический вывод из этих четырёх забегов даже не про модели.
И Алиса, и YandexGPT Pro, и GigaChat склонны к упрощению: если в задании не перечислить разделы и пункты, документ будет сделан по минимуму. Смета выйдет плоским списком без разделов, КП уместится в полстраницы, в Excel не будет ни процентов, ни условного форматирования.
Но стоит перечислить пункты явно, и разрыв между моделями по содержанию сжимается почти до нуля; остаётся разрыв по скорости и цене. В забеге со сметой разделы были перечислены, и обе модели их сделали, вопрос был только в 19 секундах против 87. В забеге с личными финансами формулировка была общей, и тут модели разошлись сильно: Алиса дорисовала лимиты и график, GigaChat ограничился минимумом.
Для практики это означает простую вещь: в связке «конвейер плюс суверенная модель» качество результата определяется в первую очередь тем, насколько подробно поставлена задача. Выбор модели решает, сколько вы заплатите и сколько будете ждать.
В индустрии для ИИ‑агентов со свободным циклом называют 12–37% брака. У нас 1,8% на тех же самых или более слабых моделях. Сразу оговорюсь: это не контролируемое сравнение, там другие задачи, другие условия и свой способ считать сбой. Числа стоят рядом как порядок величины.
Но сам порядок величины объясняется просто. В свободном агентном цикле модель на каждом шаге решает, что делать дальше: какой инструмент вызвать, закончена ли задача, что проверить. Каждое такое решение это точка, где слабая модель может ошибиться, и ошибки [4] накапливаются: на пяти шагах с надёжностью 90% каждый до конца доходит 59% задач.
В нашем конвейере модель этих решений не принимает. Структура документа, порядок шагов, что считать готовым, как валидировать результат: всё зашито в конвейер. Модели остаётся только когнитивная часть: понять задачу и написать содержимое. Ограничиваем свободу действий, сохраняем свободу мышления [5].
Забег с личными финансами это хорошо иллюстрирует. У GigaChat три ошибочных запроса из четырёх, и задача всё равно дошла до готового файла за 28 секунд. В свободном агенте три ошибки подряд означали бы упавшую задачу или бесконечный цикл. Здесь они означали ретрай внутри одного шага, о котором пользователь узнал бы только из лога.
Выбираете тип задачи (документ Word, таблица Excel, лендинг, презентация), описываете задачу, при необходимости прикрепляете файлы, выбираете две модели из списка. Сейчас в списке модели из Yandex Cloud, SberCloud Evolution (GigaChat 2 Max, GLM 4.7) и прямые API DeepSeek.
Обе генерации стартуют одновременно и идут через один конвейер. На странице забега видно каждый этап с временем, число запросов к модели, число ошибочных запросов, лог запросов(не полный) и в конце два готовых файла рядом, которые можно открыть.
Идущие забеги можно смотреть вживую без регистрации. Для запуска своего нужен вход. Забег можно скрыть из общей таблицы, если задача с чувствительными данными.
Чтобы меня не разобрали в комментариях, разберу сам.
Победитель забега определяется по времени, а не по качеству. Забег с личными финансами это ровно тот случай: GigaChat выиграл 28 секунд против 41, а файл у Алисы содержательно богаче. Об этом надо помнить каждый раз, глядя на кубок в таблице забегов.
Нет автоматической оценки качества результата. В лидерборде считается «дошло до файла или нет» и время. Файл может быть формально корректным и при этом пустым по содержанию, как одностраничное КП у GigaChat. Автооценка качества документа это отдельная нетривиальная задача, пока её нет.
Выборки неравномерные. Распределение задач по моделям определяется цепочкой фолбэков и выбором пользователей, а не рандомизацией. Поэтому у Alice 331 задача, а у DeepSeek напрямую 18.
Задачи разной сложности. На странице есть фильтр Light/Hard, но внутри одной группы задачи всё равно разные. Договор на две страницы и смета на 40 строк с формулами это разные задачи, и мы их усредняем.
Один забег это один прогон. Все четыре примера выше сделаны по одному разу. LLM недетерминированы, повторный прогон той же задачи даст другие цифры и, возможно, другого победителя. Относитесь к ним как к иллюстрациям, а не как к измерению.
Сравнение с индустриальными 12–37% некорректно по построению. Уже сказал выше, повторю, чтобы не было иллюзий.
Что дальше: хотим добавить автоматическую оценку качества через независимую модель‑судью, выровнять выборки принудительными прогонами одного набора задач по всем моделям и добавить фильтр по типу задачи в лидерборд.
Главная причина: заказчикам, которым по регламенту нельзя работать с зарубежными API (госсектор, банки, закрытый контур), до сих пор нечего было предъявить, кроме слайдов вендора. Теперь есть цифры, которые можно проверить, запустив свой забег на своей задаче.
Вторая причина: мне самому было интересно, где лежит граница. Оказалось, что для массовых офисных задач она лежит гораздо ниже, чем принято считать, если правильно спроектировать конвейер вокруг модели. Смета с разделами за 19 секунд на модели, которую принято называть слабой, это не то, чего я ожидал в апреле, когда мы на неё переходили.
Если найдёте задачу, на которой российские модели ломаются, запустите забег и скиньте ссылку в комментарии. Мне это правда интересно.
Автор: ignatenkosergey
Источник [6]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/35321
URLs in this post:
[1] не приспособлены для агентных сценариев: https://habr.com/ru/articles/1070724/
[2] математика: http://www.braintools.ru/article/7620
[3] внимание: http://www.braintools.ru/article/7595
[4] ошибки: http://www.braintools.ru/article/4192
[5] мышления: http://www.braintools.ru/thinking
[6] Источник: https://habr.com/ru/articles/1080744/?utm_campaign=1080744&utm_source=habrahabr&utm_medium=rss
Нажмите здесь для печати.