speech-to-text.

Как нейросеть переводит видео. Часть 1: Whisper врёт, и мы это знаем

Я делаю speeek.io, сервис дубляжа видео. Один. Код писал сам, с 2022 года, когда OpenAI выложил Whisper и я подумал: речь → текст → перевод → синтез → обратно на видео, делов-то. Делов оказалось на три года. В 2026-м через конвейер прошло 9 203 задачи, и он всё ещё ломается в тех же местах, что и в первый месяц. Просто теперь я знаю, в каких.

продолжить чтение

Whisper без облака: локальное распознавание чувствительных записей

продолжить чтение

Локальный ассистент для зумов, часть 3: кто это говорит — и почему я трижды ошибся, отвечая на этот вопрос

В конце второй части я пообещал честный замер новых локальных моделей распознавания. Обещание пришлось выполнять целый день, и результат оказался самым обидным из возможных: менять нечего. Ни модель, ни эмбеддер, ни алгоритм. А три дефекта, которые я за этот день торжественно нашёл, оказались дефектами не системы, а моего измерительного стенда.Эта часть — про диаризацию: как ассистент отвечает на вопрос «кто это сказал» и почему на рабочем созвоне этот вопрос сложнее, чем разобрать слова. Предыдущие части читать не обязательно: первая

продолжить чтение

Локальный ассистент для зумов, часть 2: как граф встреч становится памятью и почему ему можно верить

В первой части я собрал ассистента, который слушает созвон, различает голоса, пишет стенограмму и складывает встречу в граф знаний в Obsidian. Всё на своём Маке, ничего не уходит в облако. С тех пор прошло полтора месяца ежедневной работы, и оказалось, что записать встречу — это меньшая половина дела. Большая — сделать так, чтобы через месяц из этих записей можно было достать правду, а не то, что модель придумала по мотивам.

продолжить чтение

Голосовой ввод в любое окно Windows за секунду. Офлайн, на CPU, без единого гигабайта torch

Существующие решения для диктовки текста меня не устраивали по одной и той же причине: голос уходит на чужой сервер, а за это ещё и просят подписку. Wispr Flow, Blabby, встроенный Win+H — всё либо в облаке, либо работает так, что проще напечатать.Хотелось простого: нажал хоткей, сказал, нажал ещё раз — текст появился в том поле, где стоял курсор. Хоть в браузере, хоть в IDE, хоть в мессенджере. Локально. Бесплатно. Без прав администратора.Получился WhisperType — MIT, Windows 10/11 x64, ~250 МБ после установки плюс 1.6 ГБ модели. Актуальная версия — 1.3.1

продолжить чтение

Написал локального ИИ-ассистента для зумов: диаризация, граф знаний и ноль облаков

Полгода назад я прикинул, сколько рабочих созвонов ежедневно улетает на чужие сервера через модные ИИ-ноутейкеры. Стало как-то неуютно. Otter, Granola, Fireflies — все льют разговоры в облако. Granola в этом году вообще отличилась: The Verge раскопали, что заметки по дефолту доступны любому по ссылке, а на пользовательских данных крутят модели (opt-out ожидаемо зарыт в Enterprise-тарифе).Решил проверить, можно ли собрать ассистента целиком на своём железе. Спойлер: можно. Работает каждый день на M1 Max под Apache 2.0.Что получилось

продолжить чтение

Как мы превращаем звонок риэлтора в карточку лида за 15 секунд: ИИ-автолид изнутри

Риэлтор за рулём. Звонит собственник трёшки на Соколе: «Видел ваше объявление, хочу обсудить продажу». Двадцать минут живого разговора — район, перепланировка, срочность, вилка по цене. Разговор кончается, риэлтор едет на показ, к вечеру у него ещё пять звонков. Утром он помнит, что «был кто-то по трёшке», но не помнит ни имени, ни цены, ни телефона. Лид потерян не потому, что плохо отработали, а потому, что между звонком и CRM стоит человек с памятью и руками, которые в этот момент держат руль.Мы сделали так, чтобы между звонком и карточкой лида не стояло ничего, кроме кода. Это инженерный разбор того, как у нас в

продолжить чтение

Как я решил проблему русской диктовки для ИИ

Проблема

продолжить чтение

Speech-to-LaTeX: распознавание математических выражений и предложений в LaTeX

Представьте семинар у физиков или математиков. Идёт автоматическая запись лекции, а затем распознавание речи в аккуратный текст. В большинстве мест современные ASR-системы справятся неплохо. Но значительная часть такой записи будет состоять из фраз вроде «интеграл от икс в квадрате до бесконечности», «сумма по i от единицы до n» или «производная по t от функции f».Формально голос может быть распознан правильно. В расшифровке даже могут появляться отдельные символы вроде +, π или x

продолжить чтение

Почему Cluely и другие плохо слышат русских айтишников: разбор того, как Whisper ломается и что мы сделали с этим

фото с реального собеседования нашего клиента

продолжить чтение

123