обработка звука.

Думал, Android пишет двигатель хуже iOS. Передумал. Потом оказалось, что прав, но по своему

ТезисноgetUserMedia({audio:true}) включает подавление шума, настроенное на речь; работающий двигатель для него тот шум, который надо вычесть(sic!). Выключил три флага — доля тишины в записях упала с 36% до 2%.На iOS та же правка сработала наоборот: выключение обработки роняет весь тракт на 18 дБ — сигнал, пик и уровень шума одинаково.Дело не в цене телефона и не в версии Android, а в модели устройства: разброс между 170 моделями от 0% до 100% тишины на одном и том же коде.Я делаю пет-проект

продолжить чтение

Как добавить в умную колонку новые команды и ничего не сломать

продолжить чтение

Пишем свой voice-to-text на Python: 4 бэкенда и батч-обработка голосовых

Каждый из нас хоть раз получал голосовое сообщение на 5 минут, которое проще было бы прочитать за 30 секунд. А если таких сообщений - целая папка? Я написал open-source инструмент voice-to-text, который умеет массово расшифровывать голосовые из Telegram, WhatsApp и других мессенджеров. В статье расскажу про архитектуру, подводные камни Whisper и сравнение четырех бэкендов транскрипции.Зачем это нужноУ проекта было три причины:1. Практическая потребность.

продолжить чтение