Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой. Claude.. Claude. DeepSWE.. Claude. DeepSWE. gemini 3.1 pro.. Claude. DeepSWE. gemini 3.1 pro. Gemini 3.5 Flash Cyber.. Claude. DeepSWE. gemini 3.1 pro. Gemini 3.5 Flash Cyber. Gemini 3.6 Flash.. Claude. DeepSWE. gemini 3.1 pro. Gemini 3.5 Flash Cyber. Gemini 3.6 Flash. google.. Claude. DeepSWE. gemini 3.1 pro. Gemini 3.5 Flash Cyber. Gemini 3.6 Flash. google. ParseBench.. Claude. DeepSWE. gemini 3.1 pro. Gemini 3.5 Flash Cyber. Gemini 3.6 Flash. google. ParseBench. бенчмарки LLM.. Claude. DeepSWE. gemini 3.1 pro. Gemini 3.5 Flash Cyber. Gemini 3.6 Flash. google. ParseBench. бенчмарки LLM. ии-агенты.
Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой - 1

21 июля я обновлял ленту в ожидании Gemini 3.5 Pro. Флагман анонсировали ещё в мае на I/O, обещали «в следующем месяце» – и вот уже почти два месяца это следующий месяц переезжает вправо третий раз подряд. А вместо флагмана Google выкатила… три модели тира Flash. Ни одна из них не Pro.

Знакомое чувство, да? Как будто ждал новый сезон, а прислали спин-офф про второстепенного персонажа. И вдруг – спин-офф оказался неожиданно толковым!

Разберёмся, что именно вышло, почему цифра 17% важнее любого бенчмарка в этом релизе, где новая модель откровенно проседает (спойлер: она хуже читает графики, чем её предшественница, да-да, именно так), и что вообще происходит с Gemini 3.5 Pro и обучением Gemini 4.

Что вообще случилось 21 июля

Google одним заходом выпустила сразу три модели:

  • Gemini 3.6 Flash – основная рабочая лошадка, замена Gemini 3.5 Flash;

  • Gemini 3.5 Flash-Lite – самая быстрая и дешёвая модель серии 3.5;

  • Gemini 3.5 Flash Cyber – узкоспециализированная для поиска уязвимостей, доступная только правительствам и доверенным партнёрам.

И тут же, почти между делом, в конце анонса – что компания уже тестирует Gemini 3.5 Pro с партнёрами и параллельно запустила «самый амбициозный претрейн» за свою историю для Gemini 4. То есть Google одновременно закрывает вопрос «а что там с моделями среднего тира» и намекает: следующий большой прыжок будет нескоро.

Что ж, обещанного флагмана нет, зато то, что реально выкатили, для 90% практических задач полезнее, чем ещё одна строчка в лидерборде.

Модель

Роль

Цена (вход / выход, $ за 1M токенов)

Доступ

Gemini 3.6 Flash

Основная модель для агентов, кода, мультимодальных задач

$1,50 / $7,50

Все пользователи, API, Gemini App

Gemini 3.5 Flash-Lite

Максимальная скорость и дешевизна для потоковых задач

$0,30 / $2,50

Все пользователи, API, Google Поиск

Gemini 3.5 Flash Cyber

Поиск и патчинг уязвимостей внутри CodeMender

Не раскрыта

Только госорганы и доверенные партнёры

Цифра, которая на самом деле важна: 17%

Забудьте на секунду про бенчмарки. Главное число этого релиза скромное: Gemini 3.6 Flash тратит на 17% меньше выходных токенов, чем 3.5 Flash, при решении тех же задач (по данным Artificial Analysis).

Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой - 2

А в отдельных сценариях, вроде теста DeepSWE на автономное исправление кода, экономия доходит до 65% – там модель обходится 97 тысячами токенов вместо 276 тысяч у предшественницы.

Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой - 3

Почему это важнее сырого интеллекта? Да потому, что общий индекс интеллекта у 3.6 Flash и 3.5 Flash – одинаковые 50 баллов. Модель не стала умнее. Ни на йоту! Она стала экономнее и реже ходит кругами – и это, как ни странно, более редкое достижение.

Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой - 4

Для человека, который просто печатает один запрос в чат, разница почти незаметна. А вот для агента, который внутри одной задачи открывает файл, гуглит, снова открывает файл, зовёт инструмент, думает, пишет ответ – каждый лишний шаг это токены, а каждые токены это деньги. И тут экономия начинает работать как сложный процент.

Есть удобный способ понять, почему это важнее ценника на обёртке. Стоимость выполненной задачи – не одна переменная, а произведение трёх:

цена за токен × токенов на задачу × попыток до успеха

Google снизила первую переменную примерно на 17% (цена на выход упала с $9 до $7,5 за миллион). Но собственные данные компании говорят, что вторая переменная упала как минимум настолько же. Перемножьте – и для типового рабочего сценария получаем примерно 31% дешевле за выполненную задачу, а для агентного кодинга (там, где токены раньше улетали в бесконечные циклы «правка → тест → провал → снова правка») – реальные оценки доходят до 65–71% экономии. Google, кстати, не уменьшила при этом длину и качество ответов – оценка на DeepSWE выросла с 37% до 49% параллельно с падением расхода токенов, а это редкое сочетание: обычно экономия и качество тянут в разные стороны.

Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой - 5

Третья переменная – «попыток до успеха» – вообще нигде не публикуется вендорами, хотя именно она чаще всего определяет реальный счёт. Модель, которая стабильно решает с первого раза по более высокой цене за токен, обычно выходит дешевле «дешёвой» модели, которой нужно три попытки. Проверить это можно только на своих задачах.

Где 3.6 Flash реально выигрывает – и где нет

Полез в бенчмарки – и вот…

Бенчмарк

Что измеряет

Gemini 3.5 Flash

Gemini 3.6 Flash

DeepSWE

Автономное исправление кода

37%

49%

MLE-Bench

ML-исследования

49,7%

63,9%

OSWorld-Verified

Управление компьютером

78,4%

83,0%

GDPval-AA v2

Реальные офисные задачи

1349

1421

GDM-MRCR v2 (1M токенов)

Поиск в длинном контексте

~27%

54,0%

Прирост по управлению компьютером и длинному контексту – не косметика, а самый серьёзный скачок во всём релизе. Модель реально находит нужный кусок информации в документе на миллион токенов вдвое надёжнее прежней версии. Учитывая, что окно контекста в 1 048 576 токенов давно продаётся как фича, а по факту у некоторых моделей «теряется» середина длинного документа, – это тот самый случай, когда цифра важнее ценника.

А вот на прямых боях с конкурентами Gemini 3.6 Flash уже не безоговорочный лидер. На SWE-Bench Pro у неё 58,7% против 64,7% у Grok 4.5 и 63,2% у Claude Sonnet 5. На DeepSWE – 49% против 67% у GPT-5.6 Luna. На знаниевых задачах GDPval-AA её 1421 Elo заметно уступает 1607 у Sonnet 5. Никто не подметает стол целиком: Google уверенно держит лидерство в компьютерном управлении, работе с графиками и длинным контекстом – и заметно отстаёт в чистом кодинге и научных задачах от топовых моделей конкурентов.

Вывод: это рабочая лошадка, а не чемпион. Если ваша задача – сложная, нетривиальная разработка с нуля, фронтир-модели (Claude 5, ChatGPT 5.6, Gemini 3.1 Pro) всё ещё впереди. Если задача прогнать много рутинных, инструментально-насыщенных операций дёшево – 3.6 Flash сейчас одна из лучших сделок на рынке по соотношению цена/результат.

Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой - 6

Модель стала хуже видеть

А вот это уже интереснее любого официального анонса – и почему-то почти никто про это не написал громко!

Джерри Лю, CEO компании LlamaIndex, прогнал Gemini 3.6 Flash через собственный бенчмарк ParseBench – тест на распознавание документов, таблиц и графиков, а не на код и рассуждения. И нашёл обратную сторону медали: на графиках новая модель проседает на 14 баллов относительно предшественницы – с 45,0% до 31,0% по метрике прохождения правил чтения графиков. Таблицы тоже слегка просели, с 91,1 до 89,5. Общий средний балл по документам упал с 69,9 до 66,8.

Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой - 7

Почему это произошло, объясняется довольно прозаично, но метко: пока модель дообучали под код, рассуждения и агентные задачи, зрение для документов «застряло» – грубо говоря, веса модели конкурируют друг с другом за ограниченный ресурс и прирост в одном месте иногда покупается ценой просадки в другом. Не какая-то мистика, просто у этой модели ограниченная «ёмкость», и post-training распределяет её не поровну.

Для практики это значит следующее: если ваш пайплайн вытаскивает данные из счетов, распознаёт диаграммы в финансовых отчётах или работает с таблицами – апгрейд до последней версии по имени gemini-flash-latest может тихо сломать именно ту часть системы, которую вы меньше всего проверяете. Разработчики, которые работают с документами, знают этот страх: всё вроде обновилось, тесты прошли, а через неделю саппорт заваливают жалобами на «неправильно распознанные суммы».

Практический совет прост – закрепляйте версию модели явно (gemini-3.6-flash, а не «последнюю»), гоняйте одни и те же промпты через старую и новую версии на реальных документах, считайте точные совпадения по полям. Если работаете со счетами и суммами, оборачивайте вывод модели в схему (Pydantic или аналог) и добавляйте детерминированную проверку – например, что сумма позиций сходится с итогом. Пусть модель читает, а код – перепроверяет.

Как выстроить архитектуру вокруг новой линейки

Google фактически официально благословила паттерн, который и так уже используют многие команды в продакшене: разделение на «планировщика» и «рабочих».

Идея простая. Тяжеловесная модель придумывает план и разруливает финальный ответ. Дешёвые и быстрые модели выполняют промежуточные шаги – ищут, суммаризируют, кликают по интерфейсам, вытаскивают данные.

  • Планировщик: Gemini 3.6 Flash

  • Агенты извлечения данных: Gemini 3.5 Flash-Lite

  • Агенты суммаризации: Gemini 3.5 Flash-Lite

  • Агенты работы с интерфейсом: Gemini 3.5 Flash-Lite

  • Формирование финального ответа: Gemini 3.6 Flash

Это держит расходы низкими, но сохраняет качество там, где оно реально нужно, – в финальном решении.

Flash-Lite: тихий MVP этого релиза

Если 3.6 Flash – это заголовок анонса, то по-настоящему интересная модель здесь, возможно, Flash-Lite. Она не такая эффектная в презентации, но по соотношению цена/качество самая радикальная штука во всём релизе.

Скорость – 350 выходных токенов в секунду, самая быстрая модель линейки 3.5. Цена – $0,30 за миллион входных и $2,50 за миллион выходных токенов, то есть в разы дешевле старшей сестры. И при этом качество выросло не косметически:

Бенчмарк

Gemini 3.1 Flash-Lite

Gemini 3.5 Flash-Lite

Terminal-Bench 2.1

31%

54%

GDM-MRCR v2 (длинный контекст)

60,1%

72,2%

GDPval-AA v2

642

1140

По отдельным метрикам, вроде SWE-Bench Pro (54,2% против 49,6%) и OSWorld-Verified (74,0% против 65,1%), Flash-Lite даже обгоняет более старую и более крупную Gemini 3 Flash. Самая дешёвая модель линейки обходит по некоторым тестам вчерашний мидл-тир – вот это уже действительно смешно в хорошем смысле.

Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой - 8

Для сравнения с конкурентами: Claude Haiku 4.5 стоит $1 за вход и $5 за выход (заметно дороже) и по большинству опубликованных метрик уступает Flash-Lite. GPT-5.4 mini местами выигрывает отдельные бенчмарки вроде Terminal-Bench, но Flash-Lite стоит примерно треть его цены. Для задач вроде массовой классификации обращений, перевода или разбора каталогов товаров цена за вызов почти всегда важнее пары лишних процентов на бенче.

Flash Cyber: модель, которую не дадут потрогать

А вот эта история, пожалуй, самая любопытная из трёх!

Gemini 3.5 Flash Cyber построена поверх 3.5 Flash и дообучена специально на поиск, проверку и патчинг уязвимостей в коде. Работает она внутри агента безопасности CodeMender – там сразу несколько экземпляров модели параллельно анализируют разные участки кода, затем сводят находки в единый отчёт. Идея похожая на код-ревью в команде: несколько человек смотрят на один PR с разных углов, потом сверяют выводы.

По официальным данным Google, на V8 (движок JavaScript в Chrome) модель нашла 55 уникальных реальных проблем против 47 у обычной 3.5 Flash и 36 у Claude Opus 4.6, причём 10 из этих проблем не нашла ни одна другая модель. Команда Google по исследованию уязвимостей в облаке отчиталась, что с помощью Flash Cyber нашла уязвимость типа memory corruption в продакшен-сервисе и собрала рабочую цепочку эксплойта (с обходом ASLR и W^X) всего за два часа.

На бенчмарке CyberGym картина честнее, чем кажется на первый взгляд:

Система

Результат CyberGym

GPT-5.5-Cyber в агенте OpenAI

85,6%

Claude Mythos 5 в агенте Anthropic

83,8%

GPT-5.6 Sol в агенте OpenAI

83,6%

Gemini 3.5 Flash Cyber в CodeMender (до 5 вызовов)

83,2%

Claude Mythos Preview в агенте Anthropic

83,1%

Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой - 9

Читаем честно: Flash Cyber не возглавляет эту таблицу. Она четвёртая из пяти, отстаёт от специализированной модели OpenAI на 2,4 балла и от Mythos 5 – на 0,6. Заявление Google звучит как «конкурентоспособный результат на уровне фронтира», и это правда – но это заявление про цену, а не про безоговорочное первенство.

Из-за очевидной двойственности применения (то, что находит уязвимости для защиты, точно так же годится и для атаки) Google открывает доступ крайне осторожно – сначала только госорганизациям и доверенным партнёрам. Обычным разработчикам эту модель остаётся разве что оценивать по опубликованным метрикам. Google фактически повторяет подход Anthropic к моделям Mythos.

Почему именно сейчас – и что с Gemini 3.5 Pro прямо сегодня

Запуск случился прямо перед квартальным отчётом Alphabet – и незадолго до этого акции Google просели почти на 4% на новостях о задержке флагмана. Три конкретных релиза среднего тира вместо пустых рук на звонке с инвесторами – решение, которое сложно назвать случайным совпадением по датам.

Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой - 10

По сообщениям СМИ, задержка Gemini 3.5 Pro связана с внутренними бенчмарками по кодингу. Модель не дотянула до планки компании и отправилась на переобучение.

И тут важная деталь: похожая история происходит не только у Google. Флагманские модели у нескольких лабораторий одновременно упираются в одну и ту же стену – качественного, ещё не использованного текста для претрейна становится физически меньше, а обучение на синтетических данных склонно к деградации по цепочке, когда сеть учится повторять привычки «учителя» вместо того, чтобы находить что-то новое. Отрасль постепенно смещается от простого «больше данных, больше параметров» к тест-тайм-compute – трате вычислений уже во время ответа модели, а не только во время обучения. И для такого подхода нужна как раз дешёвая, быстрая модель для генерации множества вариантов ответа с последующей проверкой – то есть ровно то, чем является Flash.

На сегодняшний день, 25 июля 2026 года, Gemini 3.5 Pro всё ещё не вышла публично. Компания подтверждает, что тестирует модель с партнёрами, и обещает «выпустить, как только будет готова», без конкретной даты. Прогнозные рынки склоняются к концу июля – началу августа. Параллельно DeepMind подтвердила старт «самого амбициозного претрейна» – для Gemini 4.

Что делать прямо сейчас

Если вы уже сидите на Gemini 3.5 Flash – переход почти не требует раздумий. Модель дешевле, быстрее и лучше почти по всем опубликованным метрикам, кроме одной оговорки про распознавание графиков и таблиц (см. выше). На уровне API миграция минимальна: сменить строку модели на gemini-3.6-flash, заменить параметр thinking_budget на thinking_level, убрать из запроса больше не поддерживаемые temperature, top_p и top_k.

Если вы выбираете между семействами моделей… Для глубокой разработки – фронтир-модели вроде GPT-5.6, Grok 4.5 или Claude 5 пока держат преимущество. Для работы с документами, экраном и большими объёмами данных 3.6 Flash – один из лучших вариантов по соотношению цена/результат.

Если же нагрузка потоковая – присмотритесь к Flash-Lite, разница в цене там буквально в разы.

Google не дала нам того флагмана, которого ждали в мае. Зато дала три модели, которые для большинства реальных рабочих сценариев решают задачу лучше, чем ещё одна строчка в таблице интеллектов.

Автор: Master_AI

Источник