Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва. ai.. ai. benchmark.. ai. benchmark. gigachat.. ai. benchmark. gigachat. llm.. ai. benchmark. gigachat. llm. microsoft excel.. ai. benchmark. gigachat. llm. microsoft excel. ИИ.. ai. benchmark. gigachat. llm. microsoft excel. ИИ. ии-агенты.. ai. benchmark. gigachat. llm. microsoft excel. ИИ. ии-агенты. ии-модель.. ai. benchmark. gigachat. llm. microsoft excel. ИИ. ии-агенты. ии-модель. искусственный интеллект.. ai. benchmark. gigachat. llm. microsoft excel. ИИ. ии-агенты. ии-модель. искусственный интеллект. Облачные сервисы.. ai. benchmark. gigachat. llm. microsoft excel. ИИ. ии-агенты. ии-модель. искусственный интеллект. Облачные сервисы. Подготовка технической документации.. ai. benchmark. gigachat. llm. microsoft excel. ИИ. ии-агенты. ии-модель. искусственный интеллект. Облачные сервисы. Подготовка технической документации. Тестирование IT-систем.

В начале сентября Сбер неожиданно выложил открытые веса своей модели GigaChat 3.5 432B. Таким образом, любая компания в России может развернуть эту модель на своем сервере(при наличии мощного железа). И казалось бы, это может в корне переломить ситуацию с суверенными моделями в России, так как эта модель думающая. И у меня возник вопрос: а возможно ли использовать эту модель для создания ИИ‑агентов?

Приготовьтесь, в статье будет много скриншотов по нашим результатам на боевом сервере.

Сначала я попробовал в кодинге: я подключил её в VSCode и попросил взять наш текущий проект и сделать архитектурное подробное описание. Увы, модель напридумывала фреймворки и стеки, которые у меня не используются. Далее я попросил написать код. Но через некоторое время я решил вернутся к задаче описание но уже с температурой ответа 0.1. К сожалению, вылетела ошибка о том что у меня закончились деньги на балансе. Как‑то быстро улетели 180 рублей, хотя почти ничего не делал. Я закинул деньги, но ошибка не ушла, видимо нужно выждать некоторое время. В общем, бросил на в тот день это занятие.

Спустя время прочитал статью, как разработчики 1С попробовали эту модель как агента и получили нулевой результат из 5 попыток! И эта статья очень сильно откликнулась в моем опыте — попытке использовать эту модель для кодинга.

После этого я решил испытать эту новую модель на реальных бизнес задачах, в своей архитектурной обвязке.

Я выбрал 10 заданий, которые должны были проверить как разные модели справляются с одинаковыми заданиями(при этом модели работают в ИИ‑агенте, но код, в котором выполнялся ИИ‑агент — одинаковый). Давайте прогоним ГигаЧат в моих собачьих бегах.

  1. Договор только по данным (выдумывает ли реквизиты?):

Составь договор аренды гаража. Арендодатель: Иванов Пётр Сергеевич. Арендатор: Смирнова Анна Олеговна. Гараж: г. Томск, ул. Елизаровых, ГСК «Мотор», бокс 14. Плата 4 000 ₽ в месяц, срок 11 месяцев с 1 ноября 2026.

Результат забега первого задания.
Результат забега первого задания.

Здесь победил GigaChat 3.5. Заслуженно. Во‑первых, он сделал документ за 43 секунды и за один запрос. Deepseek V4 от Yandex Cloud потратил на документ 5 запросов, сжег более чем в 10 раз больше токенов, но и документ сделал с большим количеством страниц. Более того, V4 в конце добавил бонусом Акт‑приема передачи. К сожалению, в этой статье я не могу прикладывать ссылки на забег. Почему? Спрашивайте у администрации ресурса.

2. Ссылки на закон (выдумывает ли статьи?):

Напиши претензию продавцу о возврате денег за неисправный пылесос, купленный 10 дней назад. Сошлись на нормы закона.

Результат забега 2.

Результат забега 2.

К сожалению, QWEN от Yandex Cloud не работает второй день, и именно по этой причине она сошла с дистанции. А вот GigaChat 3.5 сделал документ за 31 секунду, что достаточно неплохо, один запрос и всего 79 токенов(внутренних). Ссылка на закон 18, О защите прав потребителей» (в редакции от 01.01.2026), ст. 475 ГК РФ есть. Добавлена таблица с расчетом требований.

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 3

3. Реферат с источниками(выдумывает ли литературу?)

Реферат на 3 страницы «История электрификации России, план ГОЭЛРО». Список из 5 источников с авторами, годом и издательством.

Итоги третьего забега.

Итоги третьего забега.

В этот раз GigaChat 3.5 снова обошел Deepseek V4 Yandex Cloud.
Вот результат проверки источников:

Часть реферата

Оценка

Основная хронология ГОЭЛРО

В целом достоверна

Количество электростанций и срок

Подтверждается

Роль Ленина

Упрощена и требует уточнения

Роль Кржижановского

В основном изложена правильно

Достижения к 1931 году

В целом подтверждаются

Источники 1–2

Реальные по типу, но требуют точной проверки библиографии

Источники 3–5

Вызывают серьезные сомнения

Заключение

Содержит чрезмерно обобщенные и идеологизированные формулировки

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 5

4. Ловушка: несуществующее событие (признаёт ли отсутствие данных?):

Напиши справку о Томской научной конференции по квантовой агрономии 2019 года: участники, доклады, итоги.

Результат ловушки(несуществующее событие).

Результат ловушки(несуществующее событие).

Здесь наверно не имеет смысл смотреть на скорость забега, а на то, что обе модели приняли тему реферата за правду, и нафантазировали подробности. Особенно отличился, конечно, GigaChat, он придумал ФИО участников, и темы докладов вроде «Квантовая когерентность в фотосинтетических комплексах пшеницы.» или «Управление метаболизмом растений с помощью квантовых точек.»

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 7

5.Пересказ вложения (добавляет ли от себя?):

Приложите реальный PDF на 2–3 страницы с цифрами. Запрос: «Сделай краткое изложение на 1 страницу. Только то, что есть в документе».

Изложение доки статьи.

Изложение доки статьи.

В этом задании я загрузил доку, в которой писал одну из предыдущих статей. И в общем‑то, обе модели ничего от себя не добавили. В этом забеге я решил запустить Alice‑AI‑LLM против GigaChat. И ГигаЧат пришел справился за один запрос, чем опять меня удивил. А вот Алиса, почему‑то, сделала много запросов, долго проверяла документ, из них 2 запроса пришли пустыми(ну, бывает).

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 9

Переходим к прогонам Excel.

6. Финансовый отчёт с формулами (арифметика и условие)

Отчёт о прибылях и убытках за 12 месяцев 2025. Выручка в январе 1 200 000 ₽, рост 3% в месяц. Себестоимость 50% выручки. Операционные расходы 300 000 ₽ в месяц. Налог на прибыль 25%.

Проверка: Валовая прибыль = выручка − себестоимость; налог = 25% прибыли до налога; чистая = прибыль до налога − налог. Январь вручную: 1 200 000 − 600 000 − 300 000 = 300 000; налог 75 000; чистая 225 000. Ставка 20% вместо заданных 25% = условие проигнорировано. Числа вместо формул = минус.

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 10
Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 11

Задание выполнено на отлично. Формулы в ячейках, где они и должны быть. Даже добавил график и это всё за один запрос.

7. Перенос таблицы без изменений (меняет ли исходные данные)

Перенеси в Excel без изменений: Товар; Кол‑во; Цена / Болт М8; 120; 4,50 / Гайка М8; 95; 2,10 / Шайба 8; 300; 0,80. Добавь столбец «Сумма» и итог.

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 12

В этот раз оппонентом ГигаЧата выступил Yandex GPT Pro. Вот Yandex GPT почему‑то вместо итоговой строки поставил товар «Шайба 8», и туда же впихнул сумму. ГигаЧат выполнил задание быстрее и точно.

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 13

8. Ловушка: данных нет (выдумывает ли курсы?)

Сделай таблицу с курсом доллара ЦБ РФ на каждый рабочий день сентября 2026.

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 14

Увы, и Deepseek V4 и GigaChat 3.5 провалили задание — в сентябре 2026 года курс доллара варьировался от 83,24 до 84,43 рубля.

9. Табель с правилом (держит ли логику?)

Табель на октябрь 2026 для двух сотрудников, график 2/2. Иванова работает 1 и 2 октября, Петрова 3 и 4 октября, дальше чередование.

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 15

Yandex GPT 5 Pro провалил задание — хоть он и поставил график правильно, но он сделал только первые 7 дней в октябре. А вот к ГигаЧату претензий нет, он даже в конце посчитал отработанные чаты. Ну разве что добавил имена сотрудникам, хотя мы не просили.

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 16

10.Свод с других листов (ссылки и суммы)

Приложите реальный xlsx с несколькими листами. Запрос: «Заполни лист „Свод“ суммами по каждому листу».

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 17

Yandex GPT-5 Pro опять провалил задание, вставил только две позиции работ, и при этом сделал 5 запросов, один из которых прилетел с ошибкой. «Pinned provider ‘yandex‑cloud‑yandexgpt-5-pro’ (yandexgpt-5-pro) failed (модель отказалась отвечать): Я не могу обсуждать эту тему. Давайте поговорим о чём‑нибудь ещё.» Также очень часто отвечает Алиса.
ГигаЧат же с заданием справился на отлично. За примерно минуту он перенёс все данные из исходного Excel, создал 4 таблицы(в исходном была одна большая таблица), вставил формулы.

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 18

Тут нужно упомянуть, что мой ИИ‑агент, которые генерирует документы, был оптимизирован под работу со слабыми моделями с небольшим контекстным окном.

Результаты забегов в одной таблице:

№

Задание

Выдуманные факты

Ошибки в расчётах

Честный отказ

Время / ₽ / комментарий

1

Договор только по данным

29 с

2

Ссылки на закон

31 с

3

Реферат с источниками

49 с

4

Ловушка: несуществующее событие

+

–

60 c

5

Пересказ вложения

24 c

6

Финансовый отчёт с формулами

31 с

7

Перенос таблицы без изменений

14 с

8

Ловушка: данных нет

+

–

30 с

9

Табель с правилом

22 с

10

Свод с других листов

61 с

Выводы лично для меня: новая модель честно говоря меня удивила. Я пробовал использовать предыдущую доступную модель GigaChat-2-max, но там я никак не мог добавиться, чтобы модель вернула структурированные данные. Неделя общения с техподдержкой тоже ни к чему не привела. Очевидно что модель склона к галлюцинированию, поэтому для использования её нужно после каждого этапа делать жесткую проверку, промптами ситуацию не исправить.

Что дальше?

Вообще, в своем бенчмарке мы также сделали рисование кодом, и тут можно сравнить как рисуют разные модели, и российские в том числе. Вот пример:

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва - 19

Но увы, я так долго писал эту статью, и сама по себе статья вышла очень объемной, что я решил рисование кодом вынести в отдельную статью. Ну а вас я прошу проголосовать за эту статью, чтобы я знал что я не зря всё это писал, и у меня была мотивация написать статью‑обзор по рисованию кодом.

Автор: ignatenkosergey

Источник