12 августа SpaceXAI выпустила Grok 4.6. Модель получила 500 тысяч токенов контекста, четыре режима рассуждения и явный уклон в длинную агентную работу. В первых тестах она держится рядом с сильнейшими конкурентами, а в CursorBench выходит вперед при средней стоимости 2,81 доллара за задание.
Цифра выглядит приятно. Почти так же приятно, как счет из ресторана, пока никто не вспомнил про вино. У Grok 4.6 таким вином стал длинный контекст: после 200 тысяч токенов тариф удваивается. Поэтому разберемся, где модель действительно прибавила, сколько стоит длинный прогон и кому есть смысл пробовать ее прямо сейчас.

Что именно выпустили
Grok 4.6 продолжает линию Grok 4.5 и рассчитан на задачи, в которых агент долго живет внутри одного проекта. Он читает кодовую базу, ищет информацию, вызывает инструменты, исправляет ошибки и продолжает работу после нескольких неудачных попыток. Разработчик отдельно выделяет программирование, аналитическую работу, веб-разработку, проектирование интерфейсов и САПР.
Модель принимает текст и изображения, возвращает текст и работает с контекстом до 500 тысяч токенов. Доступны четыре уровня рассуждения: низкий, средний, высокий и сверхвысокий. Высокий включен по умолчанию. Через API можно подключать функции, веб-поиск, поиск по X и выполнение кода. Дата отсечения знаний приходится на 1 февраля 2026 года. Свежие события без поисковых инструментов модель не узнает.
На старте Grok 4.6 появился в Grok Build, Cursor и API SpaceXAI, а также у OpenRouter, Vercel и Cloudflare. Первую неделю Cursor и Grok Build дают двойной включенный объем использования.
SpaceXAI сообщает о более длинном дополнительном обучении по сравнению с Grok 4.5. В данных были инженерные задачи, технические рассуждения и траектории агентов в разных средах. Затем модель дообучали с подкреплением на программировании, работе со знаниями, оптимизации ядер, веб-разработке и проектировании. Компания также отмечает, что на длинных прогонах модель чаще проверяет собственную работу. Пока это наблюдение разработчика, а не результат независимого исследования.
В тестах виден большой шаг относительно Grok 4.5
Самое уверенное утверждение по итогам первого дня звучит скромно: Grok 4.6 заметно сильнее предыдущей версии. Сводный индекс Artificial Analysis в таблице xAI вырос с 56 до 61. На DeepSWE результат поднялся с 54% до 65,9%, на Terminal-Bench с 15,7% до 26%, на APEX-Agents с 47,1% до 57,5%.
С конкурентами картина неровная. В сводном индексе Grok 4.6 делит 61 балл с GPT-5.6 Sol и на один балл отстает от Fable 5. В GDPVal-AA модель набрала 1753 пункта и заняла первое место в таблице xAI. В тесте юридической работы Harvey LAB она тоже лидирует с 15,8%.
В DeepSWE у Grok 65,9% против 73% у GPT-5.6 Sol и 70% у Fable 5. В Terminal-Bench разрыв еще заметнее: 26% против 34,6% и 34,1%. Fable 5 также выше в FrontierCode, APEX-Agents и APEX-SWE.
Получился сильный универсальный агент со своими удобными территориями. По стартовым цифрам Grok 4.6 особенно интересен для работы со знаниями, широких задач в кодовой базе и длительных процессов. Терминальные сценарии и часть сложных программных тестов пока остаются слабее лидеров.
Самая интересная таблица находится у Cursor
CursorBench 3.2 собирает неоднозначные многофайловые задачи из реальных сессий Cursor. Агенту приходится понимать кодовую базу, следовать инструкциям и пользоваться инструментами. В режиме Extra High Grok 4.6 получил 70,8%, потратил в среднем 41 136 токенов, сделал 46 шагов и обошелся в 2,81 доллара на задание.
Для сравнения, Fable 5 Max набрал 70,5% при стоимости 17,32 доллара и 72 шагах. Opus 5 Max получил 70% при 8,23 доллара и 78 шагах. GPT-5.6 Sol Max показал 67,2% при 5,69 доллара и 48 шагах.
Разница между 70,8% и 70,5% слишком мала для торжественного барабана. Сам Cursor предупреждает, что близкие результаты могут оказаться статистически незначимыми. Стоимость и число шагов дают больше пищи для практики: Grok прошел тест короче и дешевле нескольких моделей с почти тем же результатом.
У теста есть важное ограничение. Cursor участвовал в запуске модели, а в ее обучении использовались траектории из разных агентных сред. Результат CursorBench описывает связку модели с системным промптом, инструментами, управлением контекстом, повторными попытками и проверками. Именно такую связку покупает пользователь агентного редактора, хотя переносить ее результат в другую среду автоматически нельзя.
Цена токена начинает обманывать глаз
На коротких запросах базовая цена Grok 4.6 совпадает с Grok 4.5: 2 доллара за миллион входных токенов и 6 долларов за миллион выходных. Кэшированный вход стоит 50 центов. Быстрая версия модели обходится вдвое дороже.
После 200 тысяч токенов в промпте ставки удваиваются:
-
входные токены: 4 доллара за миллион;
-
кэшированный вход: 1 доллар за миллион;
-
выходные токены: 12 долларов за миллион.
Возьмем упрощенный пример без кэша и платных инструментов. Запрос со 150 тысячами входных и 20 тысячами выходных токенов стоит около 42 центов. Длинный прогон с 300 тысячами входных и 40 тысячами выходных обойдется примерно в 1,68 доллара. При базовом тарифе тот же объем стоил бы 84 цента.
Агент редко ограничивается одним запросом. Он возвращается к файлам, тащит историю решений, запускает тесты, получает ошибку и идет на новый круг. Контекст растет, а вместе с ним растет счет. Удачная модель может компенсировать дорогие токены меньшим числом кругов. Нервная модель способна сжечь дешевый тариф серией бодрых прогулок по неверной ветке.
Поэтому для агентных систем полезно считать четыре показателя: долю завершенных задач, среднюю стоимость прогона, число вмешательств человека и время до принятого результата. Цена миллиона токенов остается частью расчета. Сам итог обычно определяется тем, сколько раз агент перечитал проект и сколько работы пришлось переделать после него.
Как проверить Grok 4.6 на своей работе
Один вечер с любимым промптом почти ничего не покажет. Для нормальной проверки достаточно взять десять типичных задач, которые уже решались другой моделью. Подойдут исправление бага, рефакторинг нескольких файлов, подготовка отчета с поиском, сборка небольшого интерфейса и разбор незнакомого репозитория.
Для каждого прогона стоит записать:
-
выполнена ли задача полностью;
-
сколько времени прошло до готового результата;
-
сколько токенов и денег потрачено;
-
сколько раз человек возвращал агента на маршрут;
-
прошли ли тесты и ручная проверка;
-
какой объем контекста накопился к концу.
Среднего режима рассуждения хватит для первой серии. Затем самые сложные задачи можно повторить на высоком и сверхвысоком уровнях. Такой порядок покажет, где дополнительное рассуждение действительно окупается. Заодно станет видно, как часто процесс пересекает порог 200 тысяч токенов.
Для длинных циклов документация SpaceXAI рекомендует кэширование промпта и сжатие контекста. Это не декоративные настройки. Стабильная системная инструкция, повторно используемые файлы и своевременное сжатие истории напрямую влияют на счет и задержку.
Кому уже стоит пробовать
Grok 4.6 выглядит разумным кандидатом для команд, которые уже используют Cursor или собирают собственных агентов через API. Особенно хорошо совпадают задачи с большим репозиторием, несколькими инструментами и длинной цепочкой проверок. Пользователям Grok 4.5 переход тоже имеет смысл протестировать: прирост относительно предыдущей версии виден почти во всех опубликованных тестах.
В простых чатах длинная траектория встречается редко. Выбор модели там чаще упирается в качество конкретных текстов, скорость и привычный интерфейс, поэтому спешка не требуется. Осторожность нужна и терминальным агентам. На Terminal-Bench новая версия прибавила много, но пока заметно уступает GPT-5.6 Sol и Fable 5.
Первые сутки дают достаточно данных для хорошего пилота и слишком мало для коронации. Grok 4.6 уже выглядит одним из самых экономичных сильных агентов внутри Cursor. Следующий вопрос придется решать на собственных задачах: сколько стоит принятый результат после всех шагов, откатов и человеческих проверок. Именно там заканчивается таблица и начинается работа.
Автор: danil_makaroff


