Gemini Live.

Как устроены voice-2-voice модели

Вы говорите в телефон: «Объясни квантовую запутанность за минуту». Через долю секунды из динамика отвечает живой голос — не робот из навигатора, а почти собеседник: с паузами, интонацией, даже с лёгким «хм» перед сложным местом. Это voice-2-voice (V2V): модель принимает аудио и отвечает аудио. В этой статье мы разберём, как устроен этот фокус — от волны в микрофоне до звука в динамике.Откуда взялась статьяМне довелось поработать в Newo.ai — компании, которую основал Давид Ян

продолжить чтение

В Великобритании подросток решил раздеться перед Gemini Live в режиме камеры, после этого ИИ удалил все аккаунты семьи

В Великобритании 14-летний подросток решил раздеться перед голосовым помощником Gemini Live с доступом к камере планшета. В результате искусственный интеллект удалил все аккаунты семьи и документы родителей несовершеннолетнего.

продолжить чтение

Nvidia выпустила открытую модель PersonaPlex — голосовой ИИ, который одновременно слушает и говорит

Традиционные голосовые помощники последовательно запускают распознавание речи, языковые модели и синтез речи. Это позволяет настраивать голос и роль, но приводит к роботизированным разговорам с неестественными паузами. Более новые системы, такие как Moshi от французской лаборатории искусственного интеллекта Kyutai, делают разговоры более естественными, но привязывают пользователей к одному фиксированному голосу и роли.

продолжить чтение

Google внедряет новые функции в Gemini Live: ИИ сможет «видеть» экран и камеру смартфона

Компания Google начала внедрять в Gemini Live новые функции ИИ, которые позволяют ей «видеть» ваш экран или камеру вашего смартфона и отвечать на вопросы в режиме реального времени, подтвердил представитель Google Алекс Джозеф в электронном письме The Verge. Эти функции появились почти через год после того, как Google впервые продемонстрировала работу «Project Astra», на которой они основаны.

продолжить чтение