Как нейросеть переводит видео. Часть 2: русский длиннее не текстом, а звуком
Я делаю speeek.io, сервис дубляжа видео, один. В первой части был вход конвейера: как звук становится текстом с таймкодами и что Whisper с этим текстом вытворяет. Эта про середину: перевод и укладку перевода в тайминг оригинала.Середина — самое больное место всего проекта. Распознавание я более-менее победил, синтез покупаю готовый. А вот что делать с русской фразой, которая не лезет в секунды английской, я до сих пор не уверен. В конце будет эксперимент, после которого стало немного понятнее.
Большой релиз библиотеки ударений в silero‑stress для русского языка
Омографы не пройдут (а не то, что вы подумали)Мы писали на Хабре про нашу быструю и качественную библиотеку для простановки ударений и разрешения омографов на русском языке. Потом к ней
Голос в трубке был мой. Разговаривал не я
Матери позвонили. Мои интонация и голос, говорит сбивчиво: попал в неприятности, нужны деньги, сейчас перезвонит человек и объяснит куда.Она положила трубку и набрала меня. Я ответил. На этом всё и кончилось.Меня в этой истории зацепило не то, что кто-то собрал модель моего голоса - публичных записей хватает у любого, кто хоть раз выступал или записывал видео. Зацепило, что защитой оказалась не осведомлённость и не бдительность. Защитой оказалось то, что она набрала номер сама.Почему голос перестал доказывать, кто говорит
Как озвучить текст с помощью ИИ в 2026 году
Короткий ответ на вопрос из заголовка: открываете сервис синтеза речи, вставляете текст, выбираете модель и голос, скачиваете файл. В 2026 году это занимает минуту. В синтезе речи BotHub весь процесс это одно поле, два выпадающих списка и кнопка.Чтобы попробовать синтез речи, зарегистрируйтесь по реферальной ссылке: на счёт зачисляется 300 000 CAPS, и первые прогоны выходят бесплатными.Проблема в том, что первый файл почти всегда идёт в мусор.
Мы опубликовали стабильный, быстрый, качественный и доступный синтез ещё для 29 языков России
Многообразие языков нашей страныВ прошлый раз
Как устроены voice-2-voice модели
Вы говорите в телефон: «Объясни квантовую запутанность за минуту». Через долю секунды из динамика отвечает живой голос — не робот из навигатора, а почти собеседник: с паузами, интонацией, даже с лёгким «хм» перед сложным местом. Это voice-2-voice (V2V): модель принимает аудио и отвечает аудио. В этой статье мы разберём, как устроен этот фокус — от волны в микрофоне до звука в динамике.Откуда взялась статьяМне довелось поработать в Newo.ai — компании, которую основал Давид Ян
Неочевидные проблемы в Text‑to‑Speech, о которых редко говорят
Когда приходишь в Text‑to‑Speech из классического ML (или даже из CV/NLP), кажется, что всё знакомо: датасет, модель, loss, валидация, поехали. А потом довольно быстро ловишь себя на мысли, что что‑то тут не так.В TTS есть набор проблем, которые:не очевидны на старте;почти не обсуждаются;и при этом регулярно бьют по разработке.Причём это не какие‑то редкие кейсы. Это вещи, которые встречаются постоянно.Попробую описать несколько таких моментов, о которые обжегся сам во время работы над аудио ассистентом в одном из российских бигтехов.
Обрести свой голос: сложность выбора TTS-архитектуры для ИИ-агента
Продолжаю писать о разработке собственного TTS-сервиса, основанный на шишках, набитых в targetai. В первой статье я описал критерии оценки и методологию бенчмарка. В этой статье речь пойдет о том, как мы с командой применили эти критерии на практике.Дисклеймеры:

