asr.

asr.

ASR для языка, которого Whisper почти не знает: LoRA за полтора часа — и почему полдела сделал декодер

В первой статье серии я рассказывал про речевые технологии для крымскотатарского в целом и обещал отдельно разобрать распознавание. Разбираю.Итоговая таблица, чтобы сразу было видно, о каких величинах речь. Один и тот же отложенный тест, один и тот же скоринг, 893 клипа / 1.86 ч, два диктора, которых модель не слышала:WERCERCER foldedбазовая модель (whisper-large-v3, ранее дотюненная под crh)0.34630.11880.1070+ LoRA (1 ч 30 м на ноутбучной видеокарте)

продолжить чтение

Личное устройство. Как мы разработали интеллектуальную колонку СберБум 2.0

Салют, Хабр!Я Владимир, HW PM подразделения аудио в SberDevices. Сегодня мы выпустили новую интеллектуальную колонку —

продолжить чтение

Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями

Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо: загрузить веса, поднять runtime, отдать API, подключить приложение.Теорию я понимал. Но честный ответ был таким: собственного опыта, в котором всё это проходит путь от файлов модели до работающего пользовательского сценария, у меня тогда не было.Через несколько дней такой опыт появился.

продолжить чтение

Собеседник замолчал или просто задумался: как мы учили голосового ассистента не перебивать людей

«Мой номер заказа... сейчас, секунду...» — и бодрое «Да, я вас понял, минуточку!» прямо в середину фразы.Все, кто звонил в поддержку за последние пару лет, это слышали. Выглядит как мелкая недоработка, а на деле это одна из самых неприятных задач в голосовом стеке, и решается она заметно хуже, чем кажется со стороны.Формулируется она так: понять, что человек в трубке закончил говорить, а не взял паузу. Ниже — про то, почему готовые VAD эту задачу не решают в принципе, что мы перебрали, прежде чем взяться за свое, и где у нас до сих пор не получается.

продолжить чтение

Как сжать 300+ часов D&D сериала в пересказ для актеров

Я давно играю в ДнД и почти с самого начала смотрю «Грядут приключения» - ребята снимают настольные ролевые игры как сериалы: живая партия актеров за столом, постоянный каст, сквозной сюжет, серии по пять-шесть часов. Нравится у них всё, но больше всего - «Архипелаг» и «Эндемия». В какой-то момент несравненный Мастер Гоша Воронин кинул в своём канале клич: проекту нужна помощь с пересказом сериала. Нужен был текст, по которому актёры смогут прочитать всё случившееся за 55 серий.

продолжить чтение

AudioToText: управление требованиями через записи встреч

Ссылка на GitHub с кодом проекта в конце статьиТранскрибация встреч и краткое summary сегодня уже не редкость: это умеют и корпоративные сервисы, и связка «транскрипт + LLM». Не хватает другого — материала, по которому можно сопоставлять позиции разных людей по одним и тем же сущностям и не терять историю принятых решений. Из этой задачи и вырос AudioToText: pet‑проект, который пытается превратить записи встреч в основу для управления требованиями на проекте, а не просто в ещё один текстовый артефакт.

продолжить чтение

Я ошибался: бенчмарк 23 ASR-нейросетей для русской айтишной диктовки

23 модели в 60+ конфигурациях, больше 100 000 прогонов на русско-английском IT-корпусе — пять суток (120+ часов) чистого инференса на одной RTX 5070 Ti. В марте я рекомендовал Whisper Large v3, а потом случайно нашёл модель не хуже — и понял, что выбор держался на инерции. Пересобрал всё по-научному, и мартовская рекомендация устарела. Кто её сместил — дальше.В марте я написал статью про voice-to-text и пришёл к рекомендации: Whisper Large v3 + кастомный промпт на пунктуацию через свой форк Handy на Vulkan-ускорении (которое, к моему удивлению, оказалось быстрее CUDA — про это я тоже писал).

продолжить чтение

Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов

продолжить чтение

audiogear: как разметить миллионы аудиозаписей для TTS

Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт. Привет, Хабр!Я автор блога От обезьяны к LLM. Делюсь с вами пайплайном по подготовке аудиозаписей для обучения моделей синтеза речи (TTS). Для обучения TTS систем нужно много данных. И не просто «аудио + текст», а аудио, про которое известно всё

продолжить чтение

Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте

Dub Studio - локальная утилита для перевода коротких роликов. Та самая утка тоже тут.

продолжить чтение