- BrainTools - https://www.braintools.ru -

Google дала AI-агентам лицо. Gemini 3.8 Live создаёт говорящих аватаров в реальном времени

Google представила Gemini 3.8 Live with Live Avatar [1]. Модель принимает голос, изображение, видео и текст, а отвечает через анимированного персонажа с синхронизацией губ, мимикой и голосом.

Это не отдельный генератор говорящих голов, приклеенный к чат-боту. Аватар встроен непосредственно в разговорную модель и может видеть собеседника, слушать его, отвечать и обращаться к внешним сервисам во время беседы.

Что умеет Live Avatar

Gemini генерирует видео с аватаром в разрешении до 24 кадров в секунду. Движения губ синхронизируются с речью, а выражение лица меняется вместе с интонацией ответа.

Модель поддерживает переключение между 97 языками прямо во время разговора. Синхронизация губ и мимика при этом должны адаптироваться к новой речи без перезапуска сессии.

Google дала AI-агентам лицо. Gemini 3.8 Live создаёт говорящих аватаров в реальном времени - 1

В Gemini 3.8 Live по умолчанию работают ещё две фичи.

  • Affective dialogue помогает модели учитывать темп речи, паузы, интонацию и эмоциональные сигналы собеседника. Проще говоря, агент должен отличать спокойный вопрос от раздражённой жалобы и соответствующим образом менять манеру ответа.

  • Proactive audio фильтрует фоновый шум и посторонние разговоры. Модель старается отвечать только тогда, когда обращаются именно к ней. Полезно для офиса, магазина или гостиницы, где вокруг внезапно существует жизнь.

Агент может работать во время разговора

Одна из самых интересных возможностей связана с асинхронным вызовом инструментов.

Function calling позволяет модели обращаться к внешним функциям и сервисам. Например, проверить бронь, найти заказ в CRM или запросить данные из внутренней системы.

Google дала AI-агентам лицо. Gemini 3.8 Live создаёт говорящих аватаров в реальном времени - 2

Раньше голосовому агенту часто приходилось прерывать разговор и ждать ответа сервера. Gemini 3.8 Live может продолжать диалог, пока нужная операция выполняется в фоне.

Google дала AI-агентам лицо. Gemini 3.8 Live создаёт говорящих аватаров в реальном времени - 3

В демонстрации Google виртуальный сотрудник регистрирует гостя в отеле. Аватар разговаривает с человеком и параллельно обращается к системе бронирования. Пользователю больше не приходится медитировать под надписью «Ваш запрос обрабатывается».

Что находится под капотом

Согласно документации Google Cloud [2], взаимодействие происходит через двустороннее соединение WebSocket. Оно позволяет постоянно передавать данные между приложением и моделью без создания нового запроса для каждой реплики.

Модель принимает аудио в формате PCM с частотой 16 кГц, текст и видеокадры в формате JPEG. Входящее видео анализируется с частотой до одного кадра в секунду. На выходе агент генерирует звук с частотой 24 кГц, текст и MP4-видео с аватаром при 24 кадрах в секунду.

Контекстное окно составляет до 128 тысяч токенов. При использовании Live Avatar модель может выдавать до 24 тысяч токенов. Контекстное окно определяет, сколько информации система способна учитывать внутри одной сессии.

Идентификатор модели в API выглядит так.

gemini-3.8-live

Google предлагает готовых персонажей и набор голосов. Компаниям также разрешат создавать собственных аватаров по одному референсному изображению. Модель сохраняет внешность персонажа и превращает статичную картинку в говорящего цифрового сотрудника.

Но пользовательские аватары [3] пока доступны только отдельным клиентам после согласования с Google Cloud. Использовать изображения несовершеннолетних и знаменитостей запрещено. Компания также требует получить необходимые права на лицо и голос.

Где доступна модель

Live Avatar запущен в Gemini Enterprise. Сам Gemini 3.8 Live имеет статус General Availability в корпоративной платформе Google, то есть это уже не экспериментальный preview.

Сценарии использования довольно очевидны. Виртуальные консультанты, сотрудники поддержки, преподаватели, игровые персонажи, цифровые экскурсоводы и администраторы получают визуальное присутствие без отдельного движка анимации.

Стоимость Live Avatar в анонсе Google не раскрывается.

Как Google предлагает отличать аватара от человека

Аудио и видео, созданные моделью, получают невидимую маркировку SynthID. Это технология Google DeepMind, которая встраивает машинно распознаваемый водяной знак непосредственно в сгенерированный контент.

Такой знак не мешает просмотру, но позволяет проверить происхождение записи. По крайней мере, если платформа действительно выполняет такую проверку.

Google дала AI-агентам лицо. Gemini 3.8 Live создаёт говорящих аватаров в реальном времени - 4

Для говорящих аватаров это особенно важно. Чем естественнее цифровой персонаж выглядит и реагирует, тем проще использовать его не только для поддержки клиентов, но и для вполне традиционного обмана.

Ограничения никуда не исчезли

В карточке модели [4] Google указывает, что Live Avatar рассчитан лишь на несколько минут непрерывного взаимодействия, а не на многочасовые сессии.

Также возможны задержки, тайм-ауты и галлюцинации. Дата отсечения знаний модели приходится на январь 2025 года. Для получения актуальной информации агенту потребуется внешний источник данных.

Поэтому Live Avatar пока нельзя считать цифровым сотрудником, которого можно утром посадить за стойку регистрации и забрать вечером. Это интерфейс для коротких разговорных сценариев, внутри которых агент выполняет ограниченный набор действий.

Что в итоге

Google объединила разговорную модель, генерацию видео, распознавание визуального контекста и вызов инструментов в одном API. Разработчику больше не обязательно отдельно связывать языковую модель, синтез речи и движок лицевой анимации.

Это может заметно упростить создание визуальных AI-агентов. Особенно для поддержки, обучения [5] и сервисов, где человеческое лицо повышает вовлечённость.

Правда, лицо не делает модель умнее или надёжнее. Теперь AI сможет ошибаться, глядя пользователю прямо в глаза. Прогресс всё же должен ощущаться.

Анонсы обновлений, практические разборы и новости продукта в нашем Telegram‑канале [6].

Google дала AI-агентам лицо. Gemini 3.8 Live создаёт говорящих аватаров в реальном времени - 5

Попробуйте Kodacode на своём проекте: скачать для IDE, CLI и Desktop [7].

Автор: befayer

Источник [8]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/36057

URLs in this post:

[1] представила Gemini 3.8 Live with Live Avatar: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/

[2] документации Google Cloud: https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/guides/gemini-3-8-live

[3] пользовательские аватары: https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/live-api/configure-live-avatars

[4] карточке модели: https://deepmind.google/models/model-cards/gemini-3-8-audio/

[5] обучения: http://www.braintools.ru/article/5125

[6] Telegram‑канале: https://t.me/+HokSHRtr2T4wMGZi

[7] скачать для IDE, CLI и Desktop: https://download.kodacode.ru/?utm_source=habr&utm_medium=referral&utm_campaign=article_footer&utm_content=banner_caption

[8] Источник: https://habr.com/ru/companies/koda/articles/1086738/?utm_campaign=1086738&utm_source=habrahabr&utm_medium=rss

www.BrainTools.ru

Rambler's Top100