- BrainTools - https://www.braintools.ru -

Grok 4.6: как за месяц допрыгнуть до тройки лидеров (и купить себе Cursor в придачу)

Grok 4.6: как за месяц допрыгнуть до тройки лидеров (и купить себе Cursor в придачу) - 1

12 августа xAI (хотя уже SpaceXAI) выкатила Grok 4.6. Прошло чуть больше месяца с релиза 4.5, а модель уже официально «на фронтире» – по версии Artificial Analysis.

По совокупному индексу интеллекта [1] модель почти сравнялась с GPT‑5.6 Sol и отстаёт от Claude Fable 5 всего на один балл. Grok 4.6 набирает на пять баллов больше, чем Grok 4.5, по индексу интеллекта всего через месяц после выхода предыдущей версии, и на 23 балла больше чем Grok 4.3.

Сегодня разберём, что именно изменилось в Grok 4.6, почему одни бенчмарки выросли на 10+ пунктов, а другие остались на месте, кто реально выиграл этот раунд, и – да – заденем скандальную репутацию xAI.

Что произошло

Официальный анонс [2] описывает Grok 4.6 довольно скромно: модель развивает Grok 4.5 с прицелом на «долгоиграющих» агентов и более амбициозную интерактивную и визуальную работу. Она умеет держаться за сложную многошаговую задачу – исследовать тему, анализировать данные, работать по всей кодовой базе или превращать идею в готовое приложение.

Звучит как обычный питч, скажете вы, и будете правы!

Но за этими формулировками – конкретика: модель достигает уровня фронтира сразу по нескольким агентным бенчмаркам и кодингу, показывая результат вровень с GPT-5.6 Sol [3] на композитном AA Intelligence Index – индексе, который считается по девяти разным замерам разом.

Кое-кто из команды xAI (rayhotate) заявил, что для команды это была лишь промежуточная веха в RSI-усилиях (recursive self-improvement – рекурсивное самоулучшение, если по-простому: модель, которая помогает делать следующую модель). Модель тренировали и тестировали на реальных инженерных задачах, ускоряющих разработку самой модели. И эти оптимизации уже пошли в продакшн.

Где модель прибавила

Artificial Analysis [4] в своём разборе указывает, что Grok 4.6 набрал 61 балл по Intelligence Index – это ровно уровень GPT-5.6 Sol, чуть позади Claude Opus 5 (63) и Claude Fable 5 (62), и чуть впереди китайской Kimi K3.

Grok 4.6: как за месяц допрыгнуть до тройки лидеров (и купить себе Cursor в придачу) - 2

При этом прирост относительно Grok 4.5 составил целых 5 баллов всего за месяц – а относительно ещё более старой Grok 4.3 разрыв достиг 23 баллов.

AA также отмечает, что стоимость выполнения задачи у Grok 4.6 составляет $0,84 (ровно как у Kimi K3, но с более высоким интеллектом), и это ставит модель на так называемую границу Парето по соотношению «интеллект/цена».

Grok 4.6 cost vs intelligence chart

Тут стоит на секунду остановиться и объяснить: граница Парето в этом контексте – это воображаемая линия на графике, за которую пока не может «зайти» ни одна другая модель: либо она умнее, но дороже, либо дешевле, но глупее.

По агентным задачам модель тоже показывает себя достойно: GDPval-AA v2 Elo на уровне 1753 – уступает только Claude Opus 5, но пересекается по доверительным интервалам с Claude Fable 5.

Grok 4.6: как за месяц допрыгнуть до тройки лидеров (и купить себе Cursor в придачу) - 4

На банковском бенчмарке τ³-Banking результат 50,7% – второй по счёту, сразу за Qwen3.8 Max (51,3%). А на Terminal-Bench v2.1 – 88,4%, наравне с лидерами.

Отдельно любопытен пункт про turn-эффективность – модель умеет решать задачи за меньшее число ходов. В среднем Grok 4.6 закрывает задачу примерно за 53 хода и ~0,5 млрд входных токенов, а Claude Opus 5 (max) тратит на аналогичную работу около 103 ходов и ~2 млрд входных токенов. Разница почти в четыре раза.

Таблица: что изменилось между 4.5 и 4.6

Можно свести основные отличия в одну таблицу:

Параметр

Grok 4.5

Grok 4.6

Дата релиза

8 июля 2026

12 августа 2026

Контекст

500000 токенов

500000 токенов

Уровни рассуждений

low/medium/high

low/medium/high/xhigh

Цена (вход/выход)

2/6 за 1M токенов

2/6 за 1M токенов

AA Intelligence Index

56

61

DeepSWE 1.1

~53–54%

65,9%

CursorBench 3,2

66,7%

69,9%

Terminal-Bench (v2.1)

83,3%

88,4%

AA-Briefcase (Elo)

1313

1577

Размер модели

Илон Маск сообщил, что Grok 4.6 – это модель на 1.5 триллиона параметров, с существенно улучшенными SFT (supervised fine-tuning, т. е. контролируемое дообучение) и RL (reinforcement learning, обучение [5] с подкреплением [6]). Буквально через несколько недель должна выйти Grok 4.7 – модель уже на 2.1 трлн, которая, по словам Маска, будет лучше 4.6 буквально во всём, кроме скорости – чуть медленнее, зато токен-эффективнее.

Занятно, что в анонсе Grok 4.6 сравнивали именно с GPT-5.6 Sol и Claude Fable 5, а это модели, предположительно, размером 5 триллионов параметров и выше. Но почему-то не сравнивали с Opus или Sonnet, хотя те ближе по классу цены. Получается асимметрия: xAI выбрала в конкуренты моделей покрупнее и подороже – видимо, чтобы подчеркнуть эффективность «на грамм параметров».

Нам нужно поговорить о происхождении данных

К вопросу дистилляции.

В обсуждениях постоянно всплывает мысль: не является ли Grok просто «настроенной» версией китайской Kimi K3 или ещё какого-нибудь открытого веса. Сам Маск, что характерно, фактически признавал [7], что «в целом все AI-компании занимаются дистилляцией» – фраза настолько нейтральная, что интерпретировать можно как угодно.

Но есть и более убедительная версия происхождения супермощности модели: покупка Cursor. Тот самый популярный AI-редактор кода теперь принадлежит SpaceXAI, и, вероятно, именно доступ к гигантскому массиву реальных юзерских данных программирования (а не какая-то магическая дистилляция) и объясняет резкий скачок качества в кодинге.

Кстати, о Cursor: в агентном CAD-проектировании среди всех моделей Grok 4.6 показывает лучшее соотношение цены к интеллекту:

Тесты в 3D-моделировании

В одном из тестов моделям (Grok 4.6 High vs Opus 5 High vs Fable 5 High vs GPT 5.6 Sol High) дали задание построить (на основе библиотеки Three.js) 3D-модель вертолёта Airbus H145:

Что ж, ближе всего получилось у Fable 5 и как раз Grok 4.6. Детали теста неизвестны, но, похоже, модели рисовали «по памяти».

Ещё один заезд – на этот раз Gemini 3.7 Flash High/Claude Opus 5 High/Grok 4.6 High/Qwen 3.8 27B с часовым механизмом-вертолётом (детализированная 3D clockwork-модель):

Gemini 3.7 Flash сделала это быстрее всех – за минуту (оправдывая своё имя). Qwen3.8 27B неожиданно показал результат, сопоставимый с гигантами.

Бенчмарки от xAI и Arena

В оригинальном анонсе имеются бенчмарки, где Grok 4.6 сравнивается по девяти категориям агентной и кодинговой работы.

В разделе про безопасность xAI говорит о расширенных safety-механизмах, откалиброванных под возросшие возможности модели, включая «самый широкий на сегодня набор тестов перед деплоем» – по капабилити и по калибровке защитных механизмов.

Сразу же по горячим следам выяснилось [8], что системный промпт модели, добавляемый ко всем запросам через API, оказался довольно… лаконичным. Пользователь опубликовал утечку промпта, где модели предписывается «не помогать пользователям, явно занимающимся преступной деятельностью», «не писать эксплойты», а также содержится строка о недопустимости определенного контента.

Насколько такой короткий текстовый промпт вообще может служить полноценной защитой? Можно сравнить с попыткой «уговорить» инструмент вместо инженерного решения проблемы. Сорее похоже на алхимию, чем на инженерию.

Arena сообщила, что в Code Arena: WebDev релиз сразу занял #7 место с 1618 очками, тогда как Grok 4.5 держался на #13 с 1553 очками – то есть модель одним скачком поднялась на шесть строчек и почти сравнялась с GPT-5.6 Sol xHigh (1622) и Claude Fable 5 (1627). Разрыв между тройкой составляет всего 4-9 очков.

Доступность

С точки зрения [9] доступности всё стандартно:

  • Grok 4.6 доступна в Cursor,

  • в собственном агентном инструменте компании – Grok Build,

  • а также через GPTunneL [10].

На первую неделю после релиза xAI включила двойной лимит использования внутри Grok Build и Cursor. Многие признались, что именно этот бонус подтолкнул их протестировать модель.

Кодинг-агенты

  • Один из авторов, тестировавший модель на React- и Java-проектах, отметил [11], что модель стала заметно лучше понимать крупные кодовые базы, лучше следует инструкциям и меньше вносит лишних правок «от себя». При этом он всё равно предпочитает держать отдельную подписку на GPT Sol – по его словам, тот стабильнее на по-настоящему сложных задачах. Впрочем, это не всегда оптимально – модель Sol на максимальном режиме рассуждений имеет «маниакальное желание перепроверять всё», из-за чего застревает в циклах «внести правку → перепроверить с саб-агентами → найти проблему → исправить → перепроверить снова». Это знакомо, наверное, каждому, кто работал с коллегой-перфекционистом.

  • Другой автор, тоже сравнивавший модель с GPT Sol [12], назвал Grok 4.6 «абсолютной находкой прямо сейчас» – по интеллекту и цене.

Reddit discussion screenshot on Grok 4.6 pricing debate

Reddit discussion screenshot on Grok 4.6 pricing debate
  • И снова – мнения по соотношению цены/качества значительно разделились. Выяснилось, что по бенчмарку DeepSWE Grok-4.6 на максимальных рассуждениях набирает 67 баллов и стоит $5,50 за задачу, хотя GPT-5.6 Luna Max набирает те же 67 баллов, но всего за $0,61; при этом DeepSeek V4 Pro показывает чуть более скромные 63 балла, но обходится всего в 6-10 центов – и это, по мнению исследователя, уже настоящая «выгодная сделка».

12 августа Grok 4.6 стала доступна в GitHub Copilot. И вот здесь вопросы возникли совсем не про качество кода. Часть сообщества принципиально отказалась использовать модель, ссылаясь на прошлые скандалы вокруг платформы X, включая широко обсуждавшуюся историю с генерацией неприемлемого контента. Что касается технической стороны – отмечают, что консольный интерфейс Grok Build оказался неожиданно хорош.

Бенчмарк здравоохранения и юридической аналитики

Через неделю после релиза Маск выдвинул мнение [13], что Grok 4.6 заняла первое место на MedAgentBench – бенчмарке для оценки агентных задач в медицине с реальными сценариями:

«Grok 4.6 только что заняла #1 место на MedAgentBench – одном из самых интересных бенчмарков для реальных агентных задач в здравоохранении, и у Grok теперь два поколения моделей в топ-3: #1 Grok 4.6 (~95,9%), #2 GPT-5.6 Sol (~94,7%), #3 Grok 4.5 (~93,4%)».

Grok 4.6: как за месяц допрыгнуть до тройки лидеров (и купить себе Cursor в придачу) - 8

Похожая история – с юридической аналитикой. Аккаунт XFreeze привёл цифры [14] по агентной работе с регуляторными и административными юридическими исследованиями в США:

Grok 4.6: как за месяц допрыгнуть до тройки лидеров (и купить себе Cursor в придачу) - 9
  • Grok 4.6 набирает 62,12% при цене $1,52 за тест,

  • тогда как GPT-5.6 Sol показывает результат чуть хуже – 60,61%, но при этом стоит почти в 13 раз дороже – $19.69 за тест.

  • Claude Opus 5 действительно оказывается точнее – 65,15%, – но здесь ценник в четыре раза выше Grok.

И снова про цену

Отдельно стоит остановиться на прямом сравнении с GPT-5.6 Sol, которое Маск повторял [15] несколько раз за последние недели.

Grok 4.6 vs GPT-5.6 Sol pricing chart

Grok 4.6 vs GPT-5.6 Sol pricing chart

По его словам, обе модели набирают одинаковые 61 балл на Artificial Analysis, но при этом:

Провайдер

Вход ($/1M токенов)

Выход ($/1M токенов)

GPT-5.6 Sol

$5

$30

Grok 4.6

$2

$6

То есть по входным токенам Grok дешевле в 2,5 раза, а по выходным – в целых 5 раз.

Что дальше

Что интересно, вся эта картина – уже устаревшая новость на момент, когда вы это читаете.

Маск ещё в конце июля заявил, что Grok 4.5 и Opus 5 [16] «одни на границе Парето», и сразу же пообещал: Grok 4.6 через две недели, Grok 4.7 – через четыре. И позже подтвердил, что Grok 4.7 «значительно лучше 4.6» и должна быть готова через 3–4 недели после релиза 4.6:

«Начальное обучение завершено, и сейчас мы добавляем огромный массив корпоративных данных SpaceX в дополнительное обучение. Это будет нечто особенное».

Что примечательно – упоминание именно корпоративных данных SpaceX. Это вызвало понятное любопытство: какие именно данные ракетной компании могут пригодиться языковой модели? Скорее всего, речь об инженерных данных (расчётах, симуляциях, оптимизации сложных технических систем), что логично [17] укладывается в упомянутый фокус на R&D enablement (усиление возможностей для собственных инженерных исследований и разработок).

И снова всплывает уже знакомая ирония: мы вновь получили очередной инкрементальный шаг с обещанием, что настоящий скачок – уже совсем скоро, буквально за углом. Линия горизонта каждый раз отодвигается ровно на «три-четыре недели».

Подытоживая

Grok 4.6 действительно закрывает разрыв, который ещё год назад казался пропастью. xAI больше не выглядит «третьим лишним» рядом с OpenAI и Anthropic – команда ворвалась в тройку лидеров, во многом благодаря купленному Cursor и его данным, а также агрессивной ценовой политике, которая делает модель практически незаменимой там, где важен баланс между качеством и стоимостью.

Следующие несколько недель (до анонса Grok 4.7 на 2.1 трлн параметров) покажут, была ли «пятибалльная» прибавка случайным всплеском или же началом устойчивой траектории роста.

Автор: Master_AI

Источник [18]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/34720

URLs in this post:

[1] интеллекта: http://www.braintools.ru/article/7605

[2] Официальный анонс: https://x.ai/news/grok-4-6

[3] GPT-5.6 Sol: https://gptunnel.ru/model/gpt-5.6-sol?utm_source=habr_blog&utm_medium=seo&utm_campaign=habr_grok_4.6_release

[4] Artificial Analysis: https://artificialanalysis.ai/models/grok-4-6

[5] обучение: http://www.braintools.ru/article/5125

[6] подкреплением: http://www.braintools.ru/article/5528

[7] фактически признавал: https://www.reddit.com/r/singularity/comments/1vmhtfu/grok_46_is_an_equivalent_to_sol_56_according_to/

[8] выяснилось: https://news.ycombinator.com/item?id=49274027

[9] зрения: http://www.braintools.ru/article/6238

[10] GPTunneL: https://gptunnel.ru/model/grok-4.6?utm_source=habr_blog&utm_medium=seo&utm_campaign=habr_grok_4.6_release

[11] отметил: https://www.reddit.com/r/cursor/comments/1vngdm9/grok_46_is_better_than_45_but_i_would_still_take/

[12] сравнивавший модель с GPT Sol: https://www.reddit.com/r/cursor/comments/1vo552l/grok_46_is_an_absolute_steal_right_now/

[13] выдвинул мнение: https://x.com/elonmusk/status/2090078247392555471

[14] привёл цифры: https://x.com/XFreeze/status/2089602705459474732

[15] повторял: https://x.com/elonmusk/status/2089754307453141424

[16] Opus 5: https://gptunnel.ru/model/claude-opus-5?utm_source=habr_blog&utm_medium=seo&utm_campaign=habr_grok_4.6_release

[17] логично: http://www.braintools.ru/article/7640

[18] Источник: https://habr.com/ru/companies/gptunnel/articles/1073058/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1073058

www.BrainTools.ru

Rambler's Top100