- BrainTools - https://www.braintools.ru -

15 сентября Google представила [1] две нативные speech-to-speech модели, Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Первая заточена под масштаб и цену, вторая — под многошаговые задачи с рассуждением прямо в диалоге.
Интереснее баллов то, что голосовые агенты наконец получили признаки продакшен-продукта. Асинхронные вызовы функций, предсказуемая цена, интеграции с тем, на чем такие системы реально собирают.
Хочу напомнить, как это делалось раньше. Голосовой бот — конвейер из трех сервисов. Распознавание речи, языковая модель и синтез. Задержки складываются, а вместе с текстом может потеряться все остальное — интонация, скорость речи, эмоция [2], шум на фоне. Модель получает расшифровку и не знает, что собеседник злится. Проблемным было и перебивание. Пока распознавание не закрыло фразу, система вообще не понимает, что ее прервали. Нативная speech-to-speech модель работает с аудио напрямую и снимает оба ограничения разом.
Extended Thinking занял первое место в Speech to Speech Quality Index [3] от Artificial Analysis с результатом 82,6. На агентных задачах τ-Voice у него 68,6%, на банковском срезе τ-Voice-banking от Sierra — 35,1%, на Big Bench Audio — 97,7%.
Бенчмарки звучат абстрактно, поэтому переведу. Разговаривать и рассуждать вслух модель научилась отлично. А вот довести клиента до конца банковской процедуры, где надо проверить данные, удержать состояние и не ошибиться в сумме, у нее получается в трети случаев.
Обычная Live встала второй в Speech Agent Arena, и здесь акцент сделан на стоимости. Аудио на входе стоит 0,005 $ за минуту, на выходе — 0,018 $. В пересчете на токены получается примерно 3 $ за миллион входных и $12 за миллион выходных.
Асинхронный вызов функций — самое практичное изменение. Инструмент выполняется в фоне, пока аудиопоток продолжается, и агент больше не замолкает, уходя в API. Extended Thinking вдобавок проговаривает прогресс вслух, пока думает. В голосовом интерфейсе это заменяет анимированный значок загрузки, который обычно крутится на экране, пока программа выполняет какую-то задачу.
Из остального — обработка визуального контекста почти в реальном времени и 97 языков с переключением посреди разговора. Отдельно Google поработала над точностью распознавания буквенно-цифровых последовательностей, номеров заказов, кодов, счетов. Аудио на выходе помечается водяным знаком SynthID.
Модели доступны через Gemini API и Google AI Studio, в Gemini Enterprise пока приватное превью. Для пользователей обычная Live уехала в Search Live, Extended Thinking — в Gemini Live и Workspace на тарифах AI Pro и Ultra. Из интеграций заявлены LiveKit, Pipecat, LangChain, Vercel, Agora. Из партнерских кейсов — Salesforce, ServiceNow, Genspark и Lumeris.
В релизе не подсвечена одна оговорка. Self-hosting не предусмотрен, обе модели работают только как хостируемый сервис.
Цену полезно перевести в понятные единицы. Час разговора, где модель говорит примерно половину времени, обходится в доллар с небольшим, без учета вызовов инструментов. Час работы живого оператора почти в любой юрисдикции стоит на порядок дороже.
При таких цифрах экономика сценария упирается уже в интеграции с CRM и телефонией, а главное — в цену ошибки [4]. Поэтому 35,1% на банковском бенчмарке для того, кто планирует внедрить, важнее, чем первое место в общем рейтинге.
Ограничение тоже понятное. Голос — персональные данные в самой неудобной форме. Голосовой отпечаток, фоновые звуки, случайные фразы третьих лиц рядом. Отсутствие self-hosted варианта закрывает весь класс сценариев, где аудио не имеет права покидать периметр, а в медицине, финансах и госсекторе таких сценариев довольно много.
Кто-нибудь уже собирал голосового агента на нативной speech-to-speech модели? Пишите в комментарии.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Автор: techno_mot
Источник [6]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/35595
URLs in this post:
[1] представила: https://www.marktechpost.com/2026/09/15/google-releases-gemini-3-8-live-and-3-8-live-extended-thinking-for-production-grade-voice-agents/
[2] эмоция: http://www.braintools.ru/article/9540
[3] в Speech to Speech Quality Index: https://x.com/ArtificialAnlys/status/2099977679307243773
[4] ошибки: http://www.braintools.ru/article/4192
[5] Запустить ИИ‑роутер →: https://promo.selectel.ru/ai-router/?utm_source=habr.com&utm_medium=referral&utm_campaign=airouter_news_gemini3-8live_160926_banner_ord
[6] Источник: https://habr.com/ru/companies/selectel/news/1082998/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1082998
Нажмите здесь для печати.