tts.
ASR для языка, которого Whisper почти не знает: LoRA за полтора часа — и почему полдела сделал декодер
В первой статье серии я рассказывал про речевые технологии для крымскотатарского в целом и обещал отдельно разобрать распознавание. Разбираю.Итоговая таблица, чтобы сразу было видно, о каких величинах речь. Один и тот же отложенный тест, один и тот же скоринг, 893 клипа / 1.86 ч, два диктора, которых модель не слышала:WERCERCER foldedбазовая модель (whisper-large-v3, ранее дотюненная под crh)0.34630.11880.1070+ LoRA (1 ч 30 м на ноутбучной видеокарте)
Как озвучить текст с помощью ИИ в 2026 году
Короткий ответ на вопрос из заголовка: открываете сервис синтеза речи, вставляете текст, выбираете модель и голос, скачиваете файл. В 2026 году это занимает минуту. В синтезе речи BotHub весь процесс это одно поле, два выпадающих списка и кнопка.Чтобы попробовать синтез речи, зарегистрируйтесь по реферальной ссылке: на счёт зачисляется 300 000 CAPS, и первые прогоны выходят бесплатными.Проблема в том, что первый файл почти всегда идёт в мусор.
Мы опубликовали стабильный, быстрый, качественный и доступный синтез ещё для 29 языков России
Многообразие языков нашей страныВ прошлый раз
audiogear: как разметить миллионы аудиозаписей для TTS
Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт. Привет, Хабр!Я автор блога От обезьяны к LLM. Делюсь с вами пайплайном по подготовке аудиозаписей для обучения моделей синтеза речи (TTS). Для обучения TTS систем нужно много данных. И не просто «аудио + текст», а аудио, про которое известно всё
Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте
Dub Studio - локальная утилита для перевода коротких роликов. Та самая утка тоже тут.
Как мы разрабатывали TTS для Ил-2 Штурмовик
Все же помнят легенду?Так получилось, что нам посчастливилось принять участие в разработке синтеза для новой версии игры игры Ил-2 Штурмовик — Ил-2: Корея. Это был длинный путь, но в итоге у нас получилось:
Что перестаёт работать в тестировании, когда приходит LLM
Слева — привычный зелёный тест. Справа — то, что с ним делает LLM
Неочевидные проблемы в Text‑to‑Speech, о которых редко говорят
Когда приходишь в Text‑to‑Speech из классического ML (или даже из CV/NLP), кажется, что всё знакомо: датасет, модель, loss, валидация, поехали. А потом довольно быстро ловишь себя на мысли, что что‑то тут не так.В TTS есть набор проблем, которые:не очевидны на старте;почти не обсуждаются;и при этом регулярно бьют по разработке.Причём это не какие‑то редкие кейсы. Это вещи, которые встречаются постоянно.Попробую описать несколько таких моментов, о которые обжегся сам во время работы над аудио ассистентом в одном из российских бигтехов.
Как я завёл нормальный голос в детское приложение, не разорившись и не заставив никого лезть в настройки
Я в одиночку делаю Kalyaki — приложение, где дети учат английский через рисование: рисуют слова (cat, sun, house), оно распознаёт рисунок прямо на устройстве через ONNX-модель и отвечает голосом. Хотя «в одиночку» — это уже не совсем честно: с Claude Code, конечно, но заранее — нет, это не очередная статья как я стал 10х-инженером благодаря ИИ.Сначала был робо-воисВ MVP голос был сделан максимально дёшево — системный TTS (expo-speech поверх голосов iOS/Android). Ноль инфраструктуры, работает офлайн. Для проверки гипотезы — самое то, и я ни разу не жалею, что начал так.
Обрести свой голос: сложность выбора TTS-архитектуры для ИИ-агента
Продолжаю писать о разработке собственного TTS-сервиса, основанный на шишках, набитых в targetai. В первой статье я описал критерии оценки и методологию бенчмарка. В этой статье речь пойдет о том, как мы с командой применили эти критерии на практике.Дисклеймеры:

