Как мы голос для ИИ-ассистента выбирали или критерии оценки TTS-движков
targetai специализируется на создании ИИ-ассистентов для клиентского сервиса. И голосовые агенты для нас — один из ключевых сценариев: телефония, входящие и исходящие звонки, сервисные диалоги. На определённом этапе мы с командой пришли к пониманию, что зависимость от вендорских TTS-сервисов — это риск: по стоимости, по контролю над качеством, по гибкости под конкретных клиентов. И тогда перед нами встал вопрос о собственном сервисе синтеза речи.Первый шаг, который оказался совсем не тривиальным — договориться между собой о том, что вообще считать «хорошим голосом» для ИИ-агента
Наш синтез для экранных читалок (SAPI5) для 20 языков России стал лучше
Ультанул башем в 2012 годуМы не так давно опубликовали SAPI5-обёртку для нашего синтеза
Найм не спас, Telegram подвёл, ИИ устроил бардак: как мы просели, вернули деньги клиентам, но в итоге собрали веб-сервис
Привет, Хабр. Меня зовут Антон, я технический директор
Теперь silero-tts v5 на русском языке умеет задавать вопросы
Созрел вопросМы недавно писали про обновление нашего публичного синтеза, silero-tts. В прошлый раз мы существенно увеличили скорость, качество и добавили поддержку омографов.
Как я вайбкодил озвучку текста для AutoCraft
Немного предысторииС этим расширением всё началось довольно просто: я хотел упростить себе озвучку книг и больших текстов внутри своего проекта, а не прыгать каждый раз между разными сервисами и программами.План был обычный: вставил текст, выбрал движок, получил озвучку.Но потом, как это часто бывает, всё поехало чуть дальше:LLM подкинула несколько идейкто-то попросил добавить дополнительные возможностиа мне самому пришлось разбираться с символами, которые вообще не должны озвучиватьсяВ итоге из обычной функции озвучки выросло отдельное расширение для веб-панели AutoCraft.
Qwen3-TTS: синтезируем голос на любом устройстве
Привет, Хабр!Несколько дней назад Alibaba выпустила в открытый доступ линейку своих моделей для генерации аудио. На рынке не так часто случаются такие выпуски, поэтому я решил проверить ее возможности и написать свой отзывО моделях
Клонирование голоса по 3-секундному образцу локально: обзор Qwen3-TTS, примеры на русском и портативная версия
Всем привет! Команда Qwen от Alibaba выложила в открытый доступ Qwen3-TTS — нейросетевую модель для синтеза речи с клонированием голоса. Сегодня хочу рассказать об этой технологии подробнее и поделиться портативной версией.

