tts.

tts.

ASR для языка, которого Whisper почти не знает: LoRA за полтора часа — и почему полдела сделал декодер

В первой статье серии я рассказывал про речевые технологии для крымскотатарского в целом и обещал отдельно разобрать распознавание. Разбираю.Итоговая таблица, чтобы сразу было видно, о каких величинах речь. Один и тот же отложенный тест, один и тот же скоринг, 893 клипа / 1.86 ч, два диктора, которых модель не слышала:WERCERCER foldedбазовая модель (whisper-large-v3, ранее дотюненная под crh)0.34630.11880.1070+ LoRA (1 ч 30 м на ноутбучной видеокарте)

продолжить чтение

Как озвучить текст с помощью ИИ в 2026 году

Короткий ответ на вопрос из заголовка: открываете сервис синтеза речи, вставляете текст, выбираете модель и голос, скачиваете файл. В 2026 году это занимает минуту. В синтезе речи BotHub весь процесс это одно поле, два выпадающих списка и кнопка.Чтобы попробовать синтез речи, зарегистрируйтесь по реферальной ссылке: на счёт зачисляется 300 000 CAPS, и первые прогоны выходят бесплатными.Проблема в том, что первый файл почти всегда идёт в мусор.

продолжить чтение

Мы опубликовали стабильный, быстрый, качественный и доступный синтез ещё для 29 языков России

Многообразие языков нашей страныВ прошлый раз

продолжить чтение

audiogear: как разметить миллионы аудиозаписей для TTS

Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт. Привет, Хабр!Я автор блога От обезьяны к LLM. Делюсь с вами пайплайном по подготовке аудиозаписей для обучения моделей синтеза речи (TTS). Для обучения TTS систем нужно много данных. И не просто «аудио + текст», а аудио, про которое известно всё

продолжить чтение

Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте

Dub Studio - локальная утилита для перевода коротких роликов. Та самая утка тоже тут.

продолжить чтение

Как мы разрабатывали TTS для Ил-2 Штурмовик

Все же помнят легенду?Так получилось, что нам посчастливилось принять участие в разработке синтеза для новой версии игры игры Ил-2 Штурмовик — Ил-2: Корея. Это был длинный путь, но в итоге у нас получилось:

продолжить чтение

Что перестаёт работать в тестировании, когда приходит LLM

Слева — привычный зелёный тест. Справа — то, что с ним делает LLM

продолжить чтение

Неочевидные проблемы в Text‑to‑Speech, о которых редко говорят

Когда приходишь в Text‑to‑Speech из классического ML (или даже из CV/NLP), кажется, что всё знакомо: датасет, модель, loss, валидация, поехали. А потом довольно быстро ловишь себя на мысли, что что‑то тут не так.В TTS есть набор проблем, которые:не очевидны на старте;почти не обсуждаются;и при этом регулярно бьют по разработке.Причём это не какие‑то редкие кейсы. Это вещи, которые встречаются постоянно.Попробую описать несколько таких моментов, о которые обжегся сам во время работы над аудио ассистентом в одном из российских бигтехов.

продолжить чтение

Как я завёл нормальный голос в детское приложение, не разорившись и не заставив никого лезть в настройки

Я в одиночку делаю Kalyaki — приложение, где дети учат английский через рисование: рисуют слова (cat, sun, house), оно распознаёт рисунок прямо на устройстве через ONNX-модель и отвечает голосом. Хотя «в одиночку» — это уже не совсем честно: с Claude Code, конечно, но заранее — нет, это не очередная статья как я стал 10х-инженером благодаря ИИ.Сначала был робо-воисВ MVP голос был сделан максимально дёшево — системный TTS (expo-speech поверх голосов iOS/Android). Ноль инфраструктуры, работает офлайн. Для проверки гипотезы — самое то, и я ни разу не жалею, что начал так.

продолжить чтение

Обрести свой голос: сложность выбора TTS-архитектуры для ИИ-агента

Продолжаю писать о разработке собственного TTS-сервиса, основанный на шишках, набитых в targetai. В первой статье я описал критерии оценки и методологию бенчмарка. В этой статье речь пойдет о том, как мы с командой применили эти критерии на практике.Дисклеймеры:

продолжить чтение