Два релиза за два часа
Сегодня выдался какой-то безумный день. Сначала вышла финальная версия DeepSeek V4 Pro, а меньше чем через два часа появился Grok 4.6. Обе модели близки по масштабу: у одной около 1,6T параметров, у второй около 1,5T. И обе за одну ночь подобрались к уровню пользовательского опыта Claude Fable 5.


После этих релизов на рынке LLM, по-моему, появилась новая и довольно жёсткая планка выживания. Ещё три-четыре месяца назад Claude лидировал с таким отрывом, что разница казалась почти безнадёжной. Теперь модели сменяют друг друга на первом месте каждые несколько недель, а очередной раунд может выбить из игры немало компаний.
Как я перераспределил задачи между моделями
На этом фоне я снова пересобрал свой повседневный набор AI-инструментов.
-
Основным инструментом для Vibe Coding станет Grok Build + Grok 4.6.
-
ChatGPT и Codex останутся для крупных задач, где ошибка обойдётся слишком дорого. Туда же идут офисная работа, идеи, контент, управление браузером и компьютером.
-
DeepSeek V4 Pro получит большую часть автоматизации, асинхронные задачи без жёстких требований к скорости и часть Agent-процессов в моих продуктах.
Что появится через месяц и придётся ли опять всё перестраивать, чёрт его знает. Но сейчас эта комбинация удобнее всего из того, чем я пользовался.
Причина такого разделения проста. У больших моделей есть почти неразрешимый треугольник: производительность, цена и скорость. Раньше совместить все три пункта почти никому не удавалось.
Почему скорость важнее, чем кажется
Про производительность и цену говорят постоянно. Скорость почему-то часто забывают, хотя она зависит и от самой модели, и от инфраструктуры компании, и от доступных вычислительных мощностей. Когда Agent-процессы работают почти десять часов в день без остановки, скорость перестаёт быть приятным бонусом.
Я уже почти не выдерживаю обычный режим GPT-5.6 Sol в Codex. Задача на 10–15 минут стала обычным делом, полчаса тоже никого не удивляют, а некоторые процессы спокойно работают час. Хуже всего, когда обратная связь приходит раз в 15–30 минут: день распадается на куски, начать другую работу не успеваешь, а ждать скучно.
В итоге открываешь X и бесконечно листаешь ленту. За последнее время я стал проводить там заметно больше времени.

Поэтому в Codex мне всё чаще приходится включать Fast mode. Он сжигает лимиты с пугающей скоростью: даже подписки за $200 при активной работе может не хватить на два дня.
Умные модели вроде Claude Fable 5 и GPT-5.6 Sol обычно дорогие и медленные. Дешёвые часто работают быстро, но уступают в возможностях. DeepSeek V4 Flash хватает для повседневных задач, однако мне, человеку с довольно скромными инженерными навыками, сильная модель нужна ещё и для того, чтобы вытягивать задачи выше моего собственного уровня.
Хорошая производительность вместе с высокой скоростью обычно означает какой-нибудь Fast mode. Дёшево там уже не будет. Именно этот треугольник и задавал прежнюю границу рынка.
Сегодня ночью DeepSeek V4 Pro и Grok 4.6 пробили в ней брешь, причём с двух разных сторон.
DeepSeek V4 Pro: benchmark и реальные задачи
По текущему тарифу DeepSeek опустил стоимость Agent-возможностей уровня Fable до $0,87 за миллион выходных токенов. Компания уже предупреждала о будущем повышении цен, поэтому финальный тариф пока неизвестен. По моей грубой оценке, он вряд ли превысит $2.
Grok 4.6 предлагает возможности, близкие к Fable 5, за $2 за миллион входных и $6 за миллион выходных токенов. В реальной разработке он оказался ещё и пугающе быстрым.
Я добавил DeepSeek V4 Pro и Grok 4.6 на известный график с «порогом выживания» LLM. Итогового балла DeepSeek V4 Pro пока нет, поэтому я грубо оценил его по доступным benchmark: примерно 56–58 баллов.

Ценовые и качественные диапазоны почти полностью перекрыты. Моделям из середины становится тесно.
Из всех результатов DeepSeek V4 Pro я смотрю прежде всего на два теста. Первый — Terminal Bench 2.1. Модель сама заходит в терминал, устанавливает окружение, запускает команды, разбирается с ошибками и должна довести задачу до рабочего результата.
Предварительная версия DeepSeek V4 Pro набрала 72,1 балла. Финальная версия получила 87,9, а Fable 5 — 88,0. Разница составила всего 0,1 балла.
Второй тест — DeepSWE. Я особенно внимательно слежу за ним, потому что он ближе к реальной разработке: модели нужно разобраться в существующем проекте, прочитать код и решить сложную инженерную задачу.

Результат DeepSeek вырос с 12,8 до 62,7 балла, почти на 50 пунктов за один релиз. У Fable 5 — 70 баллов, поэтому разрыв всё ещё есть. Но DeepSeek перешёл из состояния «почти не умеет работать с такими задачами» в состояние «уже способен делать полезную работу».
В тестах на понимание репозиториев, кибербезопасность, автоматизацию и tool calling картина похожая. Дайте DeepSeek V4 Pro инструменты и реальное окружение, и он быстро подбирается к Fable 5. В некоторых тестах даже обходит его.
Цена DeepSeek и его слабые места
Без инструментов результаты уже не такие впечатляющие. Когда тест проверяет собственные знания и рассуждения модели, разница с Fable 5 доходит до десятка с лишним баллов. В самых тяжёлых задачах по software engineering и full-stack разработке DeepSeek тоже отстаёт.
Поэтому я называю его почти Fable-уровнем именно в Coding и Agent-задачах. С инструментами модель уже вошла в первый эшелон, но на чистых знаниях, сложной инженерии и очень длинных задачах стабильности пока не хватает. По крайней мере, такое впечатление осталось после моих тестов.
Есть ещё один болезненный недостаток: мультимодальности по-прежнему нет. С такой ценой и стоимостью cache hits этот минус уже не выглядит смертельным.
API Fable 5 стоит $10 за миллион входных и $50 за миллион выходных токенов. У DeepSeek V4 Pro сейчас $0,43 за миллион входных и $0,87 за миллион выходных токенов. Вход при cache hit стоит всего $0,0036.
Обычный ввод дешевле примерно в 23 раза, вывод — в 57 раз. Разница в стоимости cache hit приближается к 276 разам.

При таком тарифе придираться уже смешно. Всё зависит от будущего повышения цены, но при умеренном росте DeepSeek V4 Pro вместе с подходящим Agent-инструментом останется очень сильной комбинацией.
Я подключил DeepSeek V4 Pro напрямую к Claude Code и прогнал несколько задач по разработке и работе с инструментами. Особенно заметен прогресс в coding и tool calling: финальная версия и preview ощущаются как две разные модели. Preview я раньше ругал много и с удовольствием, а сейчас разницу с флагманами иногда почти не замечаешь, если не давать модели огромную инженерную задачу.
Слабое место проявилось довольно быстро. В реальной разработке DeepSeek V4 Pro работает медленно. Разница особенно заметна рядом с Grok 4.6: Grok успевает закончить три задачи, пока DeepSeek возится с первой.
Если ответ в реальном времени не нужен, проблема почти исчезает. Для асинхронной автоматизации DeepSeek V4 Pro сейчас близок к идеальному варианту. Раньше я по привычке отправлял всю такую работу в Codex, а теперь почти всё перевёл на DeepSeek V4 Pro.
Grok 4.6: почти полный треугольник
Grok 4.6 стал моим новым любимчиком. Это первая модель, которая почти заполнила весь треугольник: общая производительность близка к Claude Fable 5, а скорость сумасшедшая. DeepSeek остаётся дешевле, но рядом с флагманами OpenAI и Anthropic цены Grok ниже в несколько раз.
Стартовый тариф API Grok 4.6 составляет $2 за миллион входных и $6 за миллион выходных токенов. Ввод дешевле Fable 5 в пять раз, вывод — примерно в 8,3 раза.
В Cursor доступно немало моделей Claude, но сейчас интереснее лимиты SuperGrok Heavy. Я работал четыре часа и потратил всего 2% недельного лимита. С 1 до 2% счётчик поднялся примерно в 5:30.
Первые три с половиной часа я непрерывно разрабатывал и параллельно запускал через Heavy несколько Agent для глубокого исследования. Всё это съело 1% недельной квоты. Да, в первую неделю дают двойной объём, но даже с этой оговоркой цифры выглядят дико.

Если считать по такому расходу, цена получается почти неприлично низкой. Лимиты Cursor я сюда даже не включал.
Общая производительность тоже высокая. По сравнению с Kimi K3 я пока заметил только более слабое чувство дизайна во frontend-задачах. В остальном разница небольшая.


В задачах из реального мира, например при создании финансовых моделей, презентаций или разборе юридических дел, Grok иногда выходит вперёд. Слабое место прежнее: разработка и Agent-задачи. Здесь до Fable 5 ему ещё есть куда расти.
Скорость, которая меняет workflow
Я непрерывно работал с Grok 4.6 около четырёх часов и почти не встречал задач дольше 20 минут. Некоторые заканчивались за три минуты, без заметного падения качества. С Codex такой скорости я почти не видел.
Раньше задача крутилась 10 минут, полчаса, иногда час. Постепенно к ожиданию привыкаешь, но приятнее оно от этого не становится. Большая часть рабочего времени уходит в пустоту.
С Grok 4.6 у меня впервые за долгое время вернулось ощущение диалога с Agent: дал задачу, получил ответ, уточнил, двинулся дальше. Скорость часто превращает интеллект модели в реальную производительность. На бумаге это выглядит второстепенным параметром, в работе — совсем нет.
Поэтому повседневную разработку я переношу на Grok Build + Grok 4.6. Работать с ним чертовски приятно.
Elon Musk уже сделал очередное громкое обещание:

Grok 4.7 должен превзойти все остальные модели. В этот раз я ему верю.
Где теперь проходит граница выживания
DeepSeek V4 Pro и Grok 4.6 лишают модели права оставаться дорогими, медленными или слабыми без веской причины. Раньше почти каждый разработчик мог найти своей модели место: сильнейшие стоили дороже и работали медленнее, более слабые привлекали низкой ценой, а быстрые забирали простые задачи.
У каждой модели оставался понятный компромисс, а пользователям приходилось с ним мириться. Сегодня минимальные требования изменились.
DeepSeek V4 Pro показал, что Agent-возможности почти Fable-уровня могут стоить $0,87 за миллион выходных токенов. Цена ещё вырастет, но, по моей оценке, может остаться около $2.
Grok 4.6 показал другую комбинацию: производительность рядом с Fable 5, заметно более низкая цена и очень высокая скорость реальной разработки. Моделям, застрявшим между ними, придётся тяжело.
Особенно после Grok 4.6. Он стал новым ориентиром и сторожем у входа в высшую лигу. Если модель проигрывает обоим по производительности, скорости и цене, зачем пользователю вообще её выбирать?
DeepSeek V4 Pro и Grok 4.6 передвинули границу выживания для всего рынка далеко вперёд.
Автор: liuyi0414


