синтез речи.

Как нейросеть переводит видео. Часть 2: русский длиннее не текстом, а звуком

Я делаю speeek.io, сервис дубляжа видео, один. В первой части был вход конвейера: как звук становится текстом с таймкодами и что Whisper с этим текстом вытворяет. Эта про середину: перевод и укладку перевода в тайминг оригинала.Середина — самое больное место всего проекта. Распознавание я более-менее победил, синтез покупаю готовый. А вот что делать с русской фразой, которая не лезет в секунды английской, я до сих пор не уверен. В конце будет эксперимент, после которого стало немного понятнее.

продолжить чтение

Большой релиз библиотеки ударений в silero‑stress для русского языка

Омографы не пройдут (а не то, что вы подумали)Мы писали на Хабре про нашу быструю и качественную библиотеку для простановки ударений и разрешения омографов на русском языке. Потом к ней

продолжить чтение

Голос в трубке был мой. Разговаривал не я

Матери позвонили. Мои интонация и голос, говорит сбивчиво: попал в неприятности, нужны деньги, сейчас перезвонит человек и объяснит куда.Она положила трубку и набрала меня. Я ответил. На этом всё и кончилось.Меня в этой истории зацепило не то, что кто-то собрал модель моего голоса - публичных записей хватает у любого, кто хоть раз выступал или записывал видео. Зацепило, что защитой оказалась не осведомлённость и не бдительность. Защитой оказалось то, что она набрала номер сама.Почему голос перестал доказывать, кто говорит

продолжить чтение

Как озвучить текст с помощью ИИ в 2026 году

Короткий ответ на вопрос из заголовка: открываете сервис синтеза речи, вставляете текст, выбираете модель и голос, скачиваете файл. В 2026 году это занимает минуту. В синтезе речи BotHub весь процесс это одно поле, два выпадающих списка и кнопка.Чтобы попробовать синтез речи, зарегистрируйтесь по реферальной ссылке: на счёт зачисляется 300 000 CAPS, и первые прогоны выходят бесплатными.Проблема в том, что первый файл почти всегда идёт в мусор.

продолжить чтение

Разговорили гуманоида: как за месяц мы построили русскоязычный голосовой стек для китайского робота

К нам в лабораторию приехал человекоподобный робот ростом 173 сантиметра и весом 75 килограммов — и он не понимал по-русски ни слова. Штатный голосовой стек работал на китайском, лежал на закрытой плате внутри корпуса, куда нет доступа, и заменить в нём язык было нельзя. Пришлось строить собственный: своё распознавание речи, свой синтез голоса, свою логику диалога.

продолжить чтение

SayFable — офлайн-библиотека с NLP-разметкой, синтезом на 68 языков и чатом по книге

Личная библиотека для книг, статей, подкастов и видео: транскрипция, синтез, перевод и смысловой поиск считаются на самом телефоне.Привет, Хабр! В прошлых статьях я рассказывал про локальный переводчик с синтезом голоса на кабардинском и про то, как собрать полный NLP-стек для «финального босса лингвистики» из старых словарей

продолжить чтение

Мы опубликовали стабильный, быстрый, качественный и доступный синтез ещё для 29 языков России

Многообразие языков нашей страныВ прошлый раз

продолжить чтение

Как устроены voice-2-voice модели

Вы говорите в телефон: «Объясни квантовую запутанность за минуту». Через долю секунды из динамика отвечает живой голос — не робот из навигатора, а почти собеседник: с паузами, интонацией, даже с лёгким «хм» перед сложным местом. Это voice-2-voice (V2V): модель принимает аудио и отвечает аудио. В этой статье мы разберём, как устроен этот фокус — от волны в микрофоне до звука в динамике.Откуда взялась статьяМне довелось поработать в Newo.ai — компании, которую основал Давид Ян

продолжить чтение

Неочевидные проблемы в Text‑to‑Speech, о которых редко говорят

Когда приходишь в Text‑to‑Speech из классического ML (или даже из CV/NLP), кажется, что всё знакомо: датасет, модель, loss, валидация, поехали. А потом довольно быстро ловишь себя на мысли, что что‑то тут не так.В TTS есть набор проблем, которые:не очевидны на старте;почти не обсуждаются;и при этом регулярно бьют по разработке.Причём это не какие‑то редкие кейсы. Это вещи, которые встречаются постоянно.Попробую описать несколько таких моментов, о которые обжегся сам во время работы над аудио ассистентом в одном из российских бигтехов.

продолжить чтение

Обрести свой голос: сложность выбора TTS-архитектуры для ИИ-агента

Продолжаю писать о разработке собственного TTS-сервиса, основанный на шишках, набитых в targetai. В первой статье я описал критерии оценки и методологию бенчмарка. В этой статье речь пойдет о том, как мы с командой применили эти критерии на практике.Дисклеймеры:

продолжить чтение