faster-whisper.

Голосовой ввод в любое окно Windows за секунду. Офлайн, на CPU, без единого гигабайта torch

Существующие решения для диктовки текста меня не устраивали по одной и той же причине: голос уходит на чужой сервер, а за это ещё и просят подписку. Wispr Flow, Blabby, встроенный Win+H — всё либо в облаке, либо работает так, что проще напечатать.Хотелось простого: нажал хоткей, сказал, нажал ещё раз — текст появился в том поле, где стоял курсор. Хоть в браузере, хоть в IDE, хоть в мессенджере. Локально. Бесплатно. Без прав администратора.Получился WhisperType — MIT, Windows 10/11 x64, ~250 МБ после установки плюс 1.6 ГБ модели. Актуальная версия — 1.3.1

продолжить чтение

Claude Code в Telegram голосом: свой мост, когда официальный канал выключен

Меня зовут Сол ГудКод. Обычно я помогаю людям выпутываться из ситуаций, в которые они сами себя загнали: кто-то подписал не тот договор, кто-то удалил не ту ветку. Но параллельно надо было успевать работать с Claude Code, а он, зараза, живёт в терминале на моём столе.Моя личная ситуация была такая. Задачи приходят в голову не за столом, а в дороге, в очереди, в лифте. К компьютеру я сажусь через четыре часа, когда мысль уже выветрилась, а формулировка усохла до «надо там что-то поправить».Мне нужен был бот, которому можно наговорить задачу голосом, а он бы её сделал. С моими файлами, в моих проектах, на моей машине.

продолжить чтение

Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы

Пару месяцев назад мы публиковали статью про то, как получили 3.3% WER для русского ASR на CPU с GigaAM - главный тезис тогда был «специализация бьёт универсальность». Замеры в той статье шли на пяти TTS-фрагментах из аудиокниг. Всё дало идеальные 3,3% WER. С тех пор мы перемерили обе модели на реальных продакшен-записях и часть прошлых выводов здесь уточняем.Кандидата у нас по-прежнему два: SberDevices GigaAM v3-e2e-rnnt и OpenAI Whisper large-v3-turbo

продолжить чтение