- BrainTools - https://www.braintools.ru -
Gemini 4 Argon вышел с таблицей, где он лидирует в 12 тестах из 18. Ровно такую таблицу Google показывала в феврале — для Gemini 3.1 Pro. Тот потом проиграл Claude в реальной работе больше чем на 300 очков.
У релизов Gemini сложился сценарий, и Argon пока идёт по нему шаг в шаг. Дело при этом не только в Google: победа в бенчмарках сегодня значит всё меньше.
У каждого релиза Gemini последний год один сюжет.

Акт первый: Google публикует таблицу, где новая модель первая почти во всём. Акт второй: разработчики садятся с ней работать, и на форуме появляются треды вроде «Почему опытные пользователи тихо уходят от Gemini к Claude и ChatGPT». Акт третий: Google обещает, что следующая версия всё исправит.
Gemini 3 Pro осенью 2025-го собирал [1]первые места в рейтингах. При этом, когда не знал ответа, выдумывал его в 88% случаев.
Gemini 3.1 Pro в феврале лидировал в 12 тестах из 18. А в задачах из реальных профессий отстал от Claude больше чем на 300 очков.
Gemini 3.5 Pro до первого акта не дожил: его сначала отложили, а потом и вовсе отменили. По оценке [2]аналитиков, на обучение [3] успели сжечь до $400 млн. За это время из Google ушли Джефф Дин, Джон Джампер и Ноам Шазир.
И, наконец, 30 сентября выходит Gemini 4 Argon. Лидер в 12 тестах из 18. Даже шаблон анонса менять не пришлось.
Таблица Argon честная: где её можно сверить с независимыми замерами, цифры совпадают [4]. Врать Google не пришлось. Хватило умения выбирать.

Выбрать строки: проигрыши в таблице есть: в программировании Argon уступает Claude Opus 5.5 и GPT-6 Astra по 9–11 пунктов. В тексте анонса о них ни слова. А программирование — ровно то, из-за чего отменили Gemini 3.5 Pro.
Выбрать соперников: Claude Sonnet 5.5 вышел за два дня до анонса и в таблицу не попал. В программировании он Argon обходит.
Выбрать рейтинг: в независимом индексе Artificial Analysis новый король делит третье место за Claude Opus 5.5 и Sonnet 5.5. Зато в Vals Index он первый — с отрывом в пределах погрешности.
Выбрать единицу цены: за токен Argon в 2,5 раза дешевле GPT-6 Astra. Только токенов на задачу он тратит в 2,3 раза больше, и по полной цене задача у него выходит дороже [5]. Дешевле Argon только на промо, срока которого не назвали.
Выбрать рекорд: миллион токенов в одном ответе Google называет лучшим лимитом в индустрии. Зачем он в обычной работе, Google не объяснили.
Обычно разочарование приходит через пару недель после релиза, от разработчиков. В этот раз оно пришло в день релиза, от сотрудников Google. По данным Bloomberg [6], модель слабо кодит и слабо делает фронтенд, а двое собеседников считают, что её натаскали на тесты. Google это отрицает.
Публичные замеры показывают то же. Когда приложения Argon проверяет робот, модель вторая из 106. Когда сайты сравнивают живые люди в WebDev Arena, она восьмая [7]. Робот проверяет, нажимаются ли кнопки. Человек же выбирает, каким сайтом хочет пользоваться.
С офисными задачами та же история: проверочный чек-лист Argon закрывает лучше всех, а за оформление получает заметно меньше.
Выносить приговор при этом рано. В DeepSWE Argon первый, в Text Arena тоже, а доля выдуманных ответов упала с 88% до 15%. Это настоящий прогресс.
Натаскивание по публичным данным не доказать. Сильную модель Google сделала. Лучшей её сделала таблица.
Беда шире Google, и причин три.
Тест стал целью. Когда первое место в тесте попадает в пресс-релиз, лаборатории начинают учить модель сдавать именно этот тест. Gemini 3 Pro и 3.1 Pro — результат в чистом виде: таблицы выиграны, работа проиграна.
Тестов слишком много. Из десятков тестов любая сильная модель соберёт таблицу побед. Поэтому Argon одновременно первый в Vals, третий у Artificial Analysis и восьмой в WebDev Arena. Какое место попадёт в анонс, решает маркетинг.
Лидеры упёрлись в потолок. На олимпиадных задачах по программированию у Argon и GPT-6 Astra по 100%. Тесты выгорают так быстро, что Vals с мая пять раз меняли состав своего индекса.

Победа в бенчмарках доказывает, что модель хорошо сдаёт бенчмарки. Чем лучше лаборатории учатся их сдавать, тем меньше эта победа говорит обо всём остальном.
Попробовать Argon пока нельзя: доступ есть только у специалистов по кибербезопасности из программы Fairwind. Когда модель получат остальные, не сообщили.
Всё, что известно об Argon — тесты, которые выбрала Google, независимые замеры и слова анонимных сотрудников. Нет ни одного разработчика, который неделю писал с ним код.
Сценарий сломается, если через месяц после открытия доступа разработчики будут выбирать Argon. Тогда жалобы сотрудников придётся отнести к ранней версии, и Google впервые за год выиграет что-то кроме таблицы.
До тех пор к любому релизу стоит задавать три вопроса:
Где модель проигрывает в той же таблице и есть ли эти строки в тексте анонса?
Каких свежих конкурентов в таблице нет?
Сколько стоит решённая задача?
Первый акт Argon отыграл без единой ошибки [8]. Остальные увидим, когда сможем его потыкать.
Разборы AI-релизов и рынка — в Telegram-канале @emedoedov [9].
Автор: medoedov
Источник [10]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/36433
URLs in this post:
[1] собирал : https://discuss.ai.google.dev/t/google-gemini-benchmarks-versus-reality/178064
[2] оценке : https://www.androidheadlines.com/2026/10/google-gemini-4-argon-launch-benchmark-performance-debate.html
[3] обучение: http://www.braintools.ru/article/5125
[4] совпадают: https://www.vals.ai/models/google_gemini-4-argon
[5] выходит дороже: https://artificialanalysis.ai/articles/gemini-4-argon-google-top-three-labs
[6] данным Bloomberg: https://thenextweb.com/news/gemini-4-argon-artificial-analysis-gpt-6-astra-hallucination
[7] восьмая: https://felloai.com/gemini-4-argon/
[8] ошибки: http://www.braintools.ru/article/4192
[9] @emedoedov: https://t.me/emedoedov
[10] Источник: https://habr.com/ru/articles/1089782/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1089782
Нажмите здесь для печати.