Как мы сэкономили память и в 10 раз ускорили определение языка без потери качества
При обработке больших аудио сначала важно определить, на каком языке говорит человек, и только затем направить запись в подходящую систему распознавания речи. Это становится особенно важно при обработке больших объёмов аудио, где модель должна анализировать тысячи и миллионы записей. Нам удалось создать быструю модель определения языка (LID-классификатор), сохранив качество распознавания. Благодаря ей обработка аудиоданных (ASR) требует значительно меньше вычислительных ресурсов и может эффективнее масштабироваться на существующей инфраструктуре.
«ГигаЧат» научился распознавать эмоции, различать спикеров и находить нужные моменты в длинных аудио
Google представила умные очки с доступом к ИИ
На конференции Google I/O компания объявила о партнёрстве с Warby Parker и Gentle Monster для производства новой линейки очков с поддержкой искусственного интеллекта. Они позиционируются как «аудиоочки», которые воспринимают голосовые команды и позволяют выполнять действия через экосистему приложений и сервисов, включая Gemini.
В России запустили бесплатный сервис для проверки дипфейков
Компания «Архитех ИИ» представила KodikScan
Нейросеть для аудио: Топ-4 нейросетей для генерации аудио
Аудиомодели за последние пару лет заметно разошлись в разные стороны.Под одним и тем же термином «генерация аудио» сейчас скрываются как минимум два разных класса задач:
Как я написал Qt-приложение, почти не написав код
Всё началось с эксперимента. На основной работе руководство довольно настойчиво рекомендовало использовать ИИ в разработке. В какой-то момент мне стало интересно, насколько далеко можно зайти в этом направлении. Можно ли написать реальное десктопное приложение так, чтобы основную часть кода писал ИИ?Не в смысле «иногда подсказать синтаксис» или «помочь найти ошибку». А именно в буквальном смысле — чтобы код писал ИИ, а человек формулировал задачи и проверял результат.
Gen-A стала первой отечественной платформой в России для нейросетевого улучшения видео, фото и аудио
Microsoft выпустила VibeVoice — открытую TTS-модель для генерации диалогов и подкастов продолжительностью до 90 минут
Исследователи Microsoft Research представили VibeVoice — модель для генерации диалогов из текста. Главная особенность TTS-системы в том, что она может создавать диалоги продолжительностью до 90 минут с четырьмя действующими лицами.

