Как нейросеть переводит видео. Часть 1: Whisper врёт, и мы это знаем
Я делаю speeek.io, сервис дубляжа видео. Один. Код писал сам, с 2022 года, когда OpenAI выложил Whisper и я подумал: речь → текст → перевод → синтез → обратно на видео, делов-то. Делов оказалось на три года. В 2026-м через конвейер прошло 9 203 задачи, и он всё ещё ломается в тех же местах, что и в первый месяц. Просто теперь я знаю, в каких.
Локальный ассистент для зумов, часть 2: как граф встреч становится памятью и почему ему можно верить
В первой части я собрал ассистента, который слушает созвон, различает голоса, пишет стенограмму и складывает встречу в граф знаний в Obsidian. Всё на своём Маке, ничего не уходит в облако. С тех пор прошло полтора месяца ежедневной работы, и оказалось, что записать встречу — это меньшая половина дела. Большая — сделать так, чтобы через месяц из этих записей можно было достать правду, а не то, что модель придумала по мотивам.
Голосовой ввод в любое окно Windows за секунду. Офлайн, на CPU, без единого гигабайта torch
Существующие решения для диктовки текста меня не устраивали по одной и той же причине: голос уходит на чужой сервер, а за это ещё и просят подписку. Wispr Flow, Blabby, встроенный Win+H — всё либо в облаке, либо работает так, что проще напечатать.Хотелось простого: нажал хоткей, сказал, нажал ещё раз — текст появился в том поле, где стоял курсор. Хоть в браузере, хоть в IDE, хоть в мессенджере. Локально. Бесплатно. Без прав администратора.Получился WhisperType — MIT, Windows 10/11 x64, ~250 МБ после установки плюс 1.6 ГБ модели. Актуальная версия — 1.3.1
Написал локального ИИ-ассистента для зумов: диаризация, граф знаний и ноль облаков
Полгода назад я прикинул, сколько рабочих созвонов ежедневно улетает на чужие сервера через модные ИИ-ноутейкеры. Стало как-то неуютно. Otter, Granola, Fireflies — все льют разговоры в облако. Granola в этом году вообще отличилась: The Verge раскопали, что заметки по дефолту доступны любому по ссылке, а на пользовательских данных крутят модели (opt-out ожидаемо зарыт в Enterprise-тарифе).Решил проверить, можно ли собрать ассистента целиком на своём железе. Спойлер: можно. Работает каждый день на M1 Max под Apache 2.0.Что получилось
Как мы превращаем звонок риэлтора в карточку лида за 15 секунд: ИИ-автолид изнутри
Риэлтор за рулём. Звонит собственник трёшки на Соколе: «Видел ваше объявление, хочу обсудить продажу». Двадцать минут живого разговора — район, перепланировка, срочность, вилка по цене. Разговор кончается, риэлтор едет на показ, к вечеру у него ещё пять звонков. Утром он помнит, что «был кто-то по трёшке», но не помнит ни имени, ни цены, ни телефона. Лид потерян не потому, что плохо отработали, а потому, что между звонком и CRM стоит человек с памятью и руками, которые в этот момент держат руль.Мы сделали так, чтобы между звонком и карточкой лида не стояло ничего, кроме кода. Это инженерный разбор того, как у нас в
Speech-to-LaTeX: распознавание математических выражений и предложений в LaTeX
Представьте семинар у физиков или математиков. Идёт автоматическая запись лекции, а затем распознавание речи в аккуратный текст. В большинстве мест современные ASR-системы справятся неплохо. Но значительная часть такой записи будет состоять из фраз вроде «интеграл от икс в квадрате до бесконечности», «сумма по i от единицы до n» или «производная по t от функции f».Формально голос может быть распознан правильно. В расшифровке даже могут появляться отдельные символы вроде +, π или x
Почему Cluely и другие плохо слышат русских айтишников: разбор того, как Whisper ломается и что мы сделали с этим
фото с реального собеседования нашего клиента

