- BrainTools - https://www.braintools.ru -
Google представили Gemini 4 Argon [1], новую флагманскую модель для программирования, профессиональных задач и кибербезопасности. В опубликованной компанией таблице она показывает лучший результат в 13 из 19 строк, а ещё в одной делит первое место с GPT-6 Astra.
На DeepSWE v1.1, который оценивает выполнение длительных задач по разработке, Argon набрала 77,9%. Для сравнения: у GPT-6 Astra результат составляет 74,1%, у Claude Opus 5.5 составляет 74,2%, у Fable 5.1 составляет 67,4%. Модель также опережает конкурентов в тестах автоматизации бизнес-процессов, финансовых и юридических задач, работы с длинным контекстом и понимания видео.

Однако пользователи ранее уже критиковали Gemini за бенчмаксинг [2] и жаловались на разрыв между результатами тестов и качеством в работе [3]. У Argon тоже есть повод присмотреться к цифрам: на Terminal-Bench 4.0 она набрала 57,4% против 66,4% у Opus 5.5, а на FrontierSWE v2 получила 55% против 65,5% у Astra. Эти результаты сами по себе не доказывают подгонку под бенчмарки, но очень подозрительно, что именно в свежих бенчмарках Argon не оказался сильнее всех.
К сожалению, проверить, насколько заявленные возможности соответствуют реальной работе, пока сможет лишь ограниченный круг пользователей. Общего доступа нет.
Следующими доступ получат платные пользователи API и подписчики Google AI Ultra, но дату компания пока не назвала.
Стартовая цена API составит $2 за миллион входных и $10 за миллион выходных токенов. После вводного периода тариф увеличится до $4/$20. Кэшированные входные токены будут стоить на 95% дешевле обычных.
Если новость понравилась, приглашаю в канал AI for Devs [4]. Каждый день публикую похожие материалы: новые модели, агенты, практические кейсы и новости из мира AI.
Автор: python_leader
Источник [5]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/36310
URLs in this post:
[1] представили Gemini 4 Argon: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
[2] критиковали Gemini за бенчмаксинг: https://www.reddit.com/r/GeminiAI/comments/1wamtkr/google_and_meta_are_benchmaxxing_hard_gemini_38/
[3] жаловались на разрыв между результатами тестов и качеством в работе: https://discuss.ai.google.dev/t/geminis-performance-gap-between-hype-and-reality/178037
[4] AI for Devs: https://t.me/+9f-xYDtKDME4Njcy
[5] Источник: https://habr.com/ru/news/1088844/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1088844
Нажмите здесь для печати.