DeepSeek V4 Pro и Grok 4.6: как изменился баланс цены, скорости и качества. deepseek.. deepseek. grok.. deepseek. grok. Системы сборки.

Два релиза за два часа

Сегодня выдался какой-то безумный день. Сначала вышла финальная версия DeepSeek V4 Pro, а меньше чем через два часа появился Grok 4.6. Обе модели близки по масштабу: у одной около 1,6T параметров, у второй около 1,5T. И обе за одну ночь подобрались к уровню пользовательского опыта Claude Fable 5.

DeepSeek V4 Pro и Grok 4.6: как изменился баланс цены, скорости и качества - 1
DeepSeek V4 Pro и Grok 4.6: как изменился баланс цены, скорости и качества - 2

После этих релизов на рынке LLM, по-моему, появилась новая и довольно жёсткая планка выживания. Ещё три-четыре месяца назад Claude лидировал с таким отрывом, что разница казалась почти безнадёжной. Теперь модели сменяют друг друга на первом месте каждые несколько недель, а очередной раунд может выбить из игры немало компаний.

Как я перераспределил задачи между моделями

На этом фоне я снова пересобрал свой повседневный набор AI-инструментов.

  • Основным инструментом для Vibe Coding станет Grok Build + Grok 4.6.

  • ChatGPT и Codex останутся для крупных задач, где ошибка обойдётся слишком дорого. Туда же идут офисная работа, идеи, контент, управление браузером и компьютером.

  • DeepSeek V4 Pro получит большую часть автоматизации, асинхронные задачи без жёстких требований к скорости и часть Agent-процессов в моих продуктах.

Что появится через месяц и придётся ли опять всё перестраивать, чёрт его знает. Но сейчас эта комбинация удобнее всего из того, чем я пользовался.

Причина такого разделения проста. У больших моделей есть почти неразрешимый треугольник: производительность, цена и скорость. Раньше совместить все три пункта почти никому не удавалось.

Почему скорость важнее, чем кажется

Про производительность и цену говорят постоянно. Скорость почему-то часто забывают, хотя она зависит и от самой модели, и от инфраструктуры компании, и от доступных вычислительных мощностей. Когда Agent-процессы работают почти десять часов в день без остановки, скорость перестаёт быть приятным бонусом.

Я уже почти не выдерживаю обычный режим GPT-5.6 Sol в Codex. Задача на 10–15 минут стала обычным делом, полчаса тоже никого не удивляют, а некоторые процессы спокойно работают час. Хуже всего, когда обратная связь приходит раз в 15–30 минут: день распадается на куски, начать другую работу не успеваешь, а ждать скучно.

В итоге открываешь X и бесконечно листаешь ленту. За последнее время я стал проводить там заметно больше времени.

DeepSeek V4 Pro и Grok 4.6: как изменился баланс цены, скорости и качества - 3

Поэтому в Codex мне всё чаще приходится включать Fast mode. Он сжигает лимиты с пугающей скоростью: даже подписки за $200 при активной работе может не хватить на два дня.

Умные модели вроде Claude Fable 5 и GPT-5.6 Sol обычно дорогие и медленные. Дешёвые часто работают быстро, но уступают в возможностях. DeepSeek V4 Flash хватает для повседневных задач, однако мне, человеку с довольно скромными инженерными навыками, сильная модель нужна ещё и для того, чтобы вытягивать задачи выше моего собственного уровня.

Хорошая производительность вместе с высокой скоростью обычно означает какой-нибудь Fast mode. Дёшево там уже не будет. Именно этот треугольник и задавал прежнюю границу рынка.

Сегодня ночью DeepSeek V4 Pro и Grok 4.6 пробили в ней брешь, причём с двух разных сторон.

DeepSeek V4 Pro: benchmark и реальные задачи

По текущему тарифу DeepSeek опустил стоимость Agent-возможностей уровня Fable до $0,87 за миллион выходных токенов. Компания уже предупреждала о будущем повышении цен, поэтому финальный тариф пока неизвестен. По моей грубой оценке, он вряд ли превысит $2.

Grok 4.6 предлагает возможности, близкие к Fable 5, за $2 за миллион входных и $6 за миллион выходных токенов. В реальной разработке он оказался ещё и пугающе быстрым.

Я добавил DeepSeek V4 Pro и Grok 4.6 на известный график с «порогом выживания» LLM. Итогового балла DeepSeek V4 Pro пока нет, поэтому я грубо оценил его по доступным benchmark: примерно 56–58 баллов.

DeepSeek V4 Pro и Grok 4.6: как изменился баланс цены, скорости и качества - 4

Ценовые и качественные диапазоны почти полностью перекрыты. Моделям из середины становится тесно.

Из всех результатов DeepSeek V4 Pro я смотрю прежде всего на два теста. Первый — Terminal Bench 2.1. Модель сама заходит в терминал, устанавливает окружение, запускает команды, разбирается с ошибками и должна довести задачу до рабочего результата.

Предварительная версия DeepSeek V4 Pro набрала 72,1 балла. Финальная версия получила 87,9, а Fable 5 — 88,0. Разница составила всего 0,1 балла.

Второй тест — DeepSWE. Я особенно внимательно слежу за ним, потому что он ближе к реальной разработке: модели нужно разобраться в существующем проекте, прочитать код и решить сложную инженерную задачу.

DeepSeek V4 Pro и Grok 4.6: как изменился баланс цены, скорости и качества - 5

Результат DeepSeek вырос с 12,8 до 62,7 балла, почти на 50 пунктов за один релиз. У Fable 5 — 70 баллов, поэтому разрыв всё ещё есть. Но DeepSeek перешёл из состояния «почти не умеет работать с такими задачами» в состояние «уже способен делать полезную работу».

В тестах на понимание репозиториев, кибербезопасность, автоматизацию и tool calling картина похожая. Дайте DeepSeek V4 Pro инструменты и реальное окружение, и он быстро подбирается к Fable 5. В некоторых тестах даже обходит его.

Цена DeepSeek и его слабые места

Без инструментов результаты уже не такие впечатляющие. Когда тест проверяет собственные знания и рассуждения модели, разница с Fable 5 доходит до десятка с лишним баллов. В самых тяжёлых задачах по software engineering и full-stack разработке DeepSeek тоже отстаёт.

Поэтому я называю его почти Fable-уровнем именно в Coding и Agent-задачах. С инструментами модель уже вошла в первый эшелон, но на чистых знаниях, сложной инженерии и очень длинных задачах стабильности пока не хватает. По крайней мере, такое впечатление осталось после моих тестов.

Есть ещё один болезненный недостаток: мультимодальности по-прежнему нет. С такой ценой и стоимостью cache hits этот минус уже не выглядит смертельным.

API Fable 5 стоит $10 за миллион входных и $50 за миллион выходных токенов. У DeepSeek V4 Pro сейчас $0,43 за миллион входных и $0,87 за миллион выходных токенов. Вход при cache hit стоит всего $0,0036.

Обычный ввод дешевле примерно в 23 раза, вывод — в 57 раз. Разница в стоимости cache hit приближается к 276 разам.

DeepSeek V4 Pro и Grok 4.6: как изменился баланс цены, скорости и качества - 6

При таком тарифе придираться уже смешно. Всё зависит от будущего повышения цены, но при умеренном росте DeepSeek V4 Pro вместе с подходящим Agent-инструментом останется очень сильной комбинацией.

Я подключил DeepSeek V4 Pro напрямую к Claude Code и прогнал несколько задач по разработке и работе с инструментами. Особенно заметен прогресс в coding и tool calling: финальная версия и preview ощущаются как две разные модели. Preview я раньше ругал много и с удовольствием, а сейчас разницу с флагманами иногда почти не замечаешь, если не давать модели огромную инженерную задачу.

Слабое место проявилось довольно быстро. В реальной разработке DeepSeek V4 Pro работает медленно. Разница особенно заметна рядом с Grok 4.6: Grok успевает закончить три задачи, пока DeepSeek возится с первой.

Если ответ в реальном времени не нужен, проблема почти исчезает. Для асинхронной автоматизации DeepSeek V4 Pro сейчас близок к идеальному варианту. Раньше я по привычке отправлял всю такую работу в Codex, а теперь почти всё перевёл на DeepSeek V4 Pro.

Grok 4.6: почти полный треугольник

Grok 4.6 стал моим новым любимчиком. Это первая модель, которая почти заполнила весь треугольник: общая производительность близка к Claude Fable 5, а скорость сумасшедшая. DeepSeek остаётся дешевле, но рядом с флагманами OpenAI и Anthropic цены Grok ниже в несколько раз.

Стартовый тариф API Grok 4.6 составляет $2 за миллион входных и $6 за миллион выходных токенов. Ввод дешевле Fable 5 в пять раз, вывод — примерно в 8,3 раза.

В Cursor доступно немало моделей Claude, но сейчас интереснее лимиты SuperGrok Heavy. Я работал четыре часа и потратил всего 2% недельного лимита. С 1 до 2% счётчик поднялся примерно в 5:30.

Первые три с половиной часа я непрерывно разрабатывал и параллельно запускал через Heavy несколько Agent для глубокого исследования. Всё это съело 1% недельной квоты. Да, в первую неделю дают двойной объём, но даже с этой оговоркой цифры выглядят дико.

DeepSeek V4 Pro и Grok 4.6: как изменился баланс цены, скорости и качества - 7

Если считать по такому расходу, цена получается почти неприлично низкой. Лимиты Cursor я сюда даже не включал.

Общая производительность тоже высокая. По сравнению с Kimi K3 я пока заметил только более слабое чувство дизайна во frontend-задачах. В остальном разница небольшая.

DeepSeek V4 Pro и Grok 4.6: как изменился баланс цены, скорости и качества - 8
DeepSeek V4 Pro и Grok 4.6: как изменился баланс цены, скорости и качества - 9

В задачах из реального мира, например при создании финансовых моделей, презентаций или разборе юридических дел, Grok иногда выходит вперёд. Слабое место прежнее: разработка и Agent-задачи. Здесь до Fable 5 ему ещё есть куда расти.

Скорость, которая меняет workflow

Я непрерывно работал с Grok 4.6 около четырёх часов и почти не встречал задач дольше 20 минут. Некоторые заканчивались за три минуты, без заметного падения качества. С Codex такой скорости я почти не видел.

Раньше задача крутилась 10 минут, полчаса, иногда час. Постепенно к ожиданию привыкаешь, но приятнее оно от этого не становится. Большая часть рабочего времени уходит в пустоту.

С Grok 4.6 у меня впервые за долгое время вернулось ощущение диалога с Agent: дал задачу, получил ответ, уточнил, двинулся дальше. Скорость часто превращает интеллект модели в реальную производительность. На бумаге это выглядит второстепенным параметром, в работе — совсем нет.

Поэтому повседневную разработку я переношу на Grok Build + Grok 4.6. Работать с ним чертовски приятно.

Elon Musk уже сделал очередное громкое обещание:

DeepSeek V4 Pro и Grok 4.6: как изменился баланс цены, скорости и качества - 10

Grok 4.7 должен превзойти все остальные модели. В этот раз я ему верю.

Где теперь проходит граница выживания

DeepSeek V4 Pro и Grok 4.6 лишают модели права оставаться дорогими, медленными или слабыми без веской причины. Раньше почти каждый разработчик мог найти своей модели место: сильнейшие стоили дороже и работали медленнее, более слабые привлекали низкой ценой, а быстрые забирали простые задачи.

У каждой модели оставался понятный компромисс, а пользователям приходилось с ним мириться. Сегодня минимальные требования изменились.

DeepSeek V4 Pro показал, что Agent-возможности почти Fable-уровня могут стоить $0,87 за миллион выходных токенов. Цена ещё вырастет, но, по моей оценке, может остаться около $2.

Grok 4.6 показал другую комбинацию: производительность рядом с Fable 5, заметно более низкая цена и очень высокая скорость реальной разработки. Моделям, застрявшим между ними, придётся тяжело.

Особенно после Grok 4.6. Он стал новым ориентиром и сторожем у входа в высшую лигу. Если модель проигрывает обоим по производительности, скорости и цене, зачем пользователю вообще её выбирать?

DeepSeek V4 Pro и Grok 4.6 передвинули границу выживания для всего рынка далеко вперёд.

Автор: liuyi0414

Источник