text to speech.

Неочевидные проблемы в Text‑to‑Speech, о которых редко говорят

Когда приходишь в Text‑to‑Speech из классического ML (или даже из CV/NLP), кажется, что всё знакомо: датасет, модель, loss, валидация, поехали. А потом довольно быстро ловишь себя на мысли, что что‑то тут не так.В TTS есть набор проблем, которые:не очевидны на старте;почти не обсуждаются;и при этом регулярно бьют по разработке.Причём это не какие‑то редкие кейсы. Это вещи, которые встречаются постоянно.Попробую описать несколько таких моментов, о которые обжегся сам во время работы над аудио ассистентом в одном из российских бигтехов.

продолжить чтение

Виртуальный рассказчик 2.0: эволюция нейросетевого рассказчика в Яндекс Книгах

Примерно год назад мы запустили

продолжить чтение

Пишем персонального AI-ассистента на Python

Современные голосовые помощники это мощные приложения, сочетающие обработку речи, машинное обучение и интеграцию с внешними API. В этой статье мы разберём, как создать базовый проект персонального ассистента на Python, используя библиотеки whisper, webrtcvad, gTTS и другие. Наш ассистент будет:Слушать микрофонОпределять начало и конец речи с помощью VAD (Voice Activity Detection)Преобразовывать речь в текст через модель WhisperОтправлять запросы на локальный LLM для генерации ответаЧитать ответ вслух с помощью gTTSНачинать/останавливать запись по клавише пробел

продолжить чтение

ИИ-Дед Мороз: создаём новогодние видео-открытки с YandexART и YandexGPT

— Так‑с‑так‑с, открытки с Дедом Морозом: сделаю одну!— А ты уже сгенерировал открытку с Дедом Морозом?(источник)

продолжить чтение