Как нейросеть переводит видео. Часть 1: Whisper врёт, и мы это знаем
Я делаю speeek.io, сервис дубляжа видео. Один. Код писал сам, с 2022 года, когда OpenAI выложил Whisper и я подумал: речь → текст → перевод → синтез → обратно на видео, делов-то. Делов оказалось на три года. В 2026-м через конвейер прошло 9 203 задачи, и он всё ещё ломается в тех же местах, что и в первый месяц. Просто теперь я знаю, в каких.
Deveillance представила Kalypta — приложение, которое мешает нейросетям расшифровывать созвоны
Стартап Deveillance представил Kalypta — приложение, которое мешает нейросетям расшифровывать речь во время созвонов. Программа работает локально и в реальном времени изменяет исходящий аудиопоток так, чтобы собеседник продолжал понимать пользователя, но системы распознавания речи получали искажённую расшифровку.
Вики из 48 часов видео: конвейер, который не даёт LLM выдумывать
У меня было 48 часов видеозаписей учебного курса и простая мысль: пересматривать это я не буду никогда. Сырой транскрипт немногим лучше — болото на сотни страниц. Я собрал конвейер, который превратил записи в Obsidian-вики: 47 связанных статей, и каждое утверждение в любой из них — в двух кликах от места в записи, где это было сказано.Зачем, если есть готовоеЗадача личная: вики для собственного использования. Я недавно писал
Голосовой ввод в любое окно Windows за секунду. Офлайн, на CPU, без единого гигабайта torch
Существующие решения для диктовки текста меня не устраивали по одной и той же причине: голос уходит на чужой сервер, а за это ещё и просят подписку. Wispr Flow, Blabby, встроенный Win+H — всё либо в облаке, либо работает так, что проще напечатать.Хотелось простого: нажал хоткей, сказал, нажал ещё раз — текст появился в том поле, где стоял курсор. Хоть в браузере, хоть в IDE, хоть в мессенджере. Локально. Бесплатно. Без прав администратора.Получился WhisperType — MIT, Windows 10/11 x64, ~250 МБ после установки плюс 1.6 ГБ модели. Актуальная версия — 1.3.1
Как сжать 300+ часов D&D сериала в пересказ для актеров
Я давно играю в ДнД и почти с самого начала смотрю «Грядут приключения» - ребята снимают настольные ролевые игры как сериалы: живая партия актеров за столом, постоянный каст, сквозной сюжет, серии по пять-шесть часов. Нравится у них всё, но больше всего - «Архипелаг» и «Эндемия». В какой-то момент несравненный Мастер Гоша Воронин кинул в своём канале клич: проекту нужна помощь с пересказом сериала. Нужен был текст, по которому актёры смогут прочитать всё случившееся за 55 серий.
Я ошибался: бенчмарк 23 ASR-нейросетей для русской айтишной диктовки
23 модели в 60+ конфигурациях, больше 100 000 прогонов на русско-английском IT-корпусе — пять суток (120+ часов) чистого инференса на одной RTX 5070 Ti. В марте я рекомендовал Whisper Large v3, а потом случайно нашёл модель не хуже — и понял, что выбор держался на инерции. Пересобрал всё по-научному, и мартовская рекомендация устарела. Кто её сместил — дальше.В марте я написал статью про voice-to-text и пришёл к рекомендации: Whisper Large v3 + кастомный промпт на пунктуацию через свой форк Handy на Vulkan-ускорении (которое, к моему удивлению, оказалось быстрее CUDA — про это я тоже писал).
Claude Code в Telegram голосом: свой мост, когда официальный канал выключен
Меня зовут Сол ГудКод. Обычно я помогаю людям выпутываться из ситуаций, в которые они сами себя загнали: кто-то подписал не тот договор, кто-то удалил не ту ветку. Но параллельно надо было успевать работать с Claude Code, а он, зараза, живёт в терминале на моём столе.Моя личная ситуация была такая. Задачи приходят в голову не за столом, а в дороге, в очереди, в лифте. К компьютеру я сажусь через четыре часа, когда мысль уже выветрилась, а формулировка усохла до «надо там что-то поправить».Мне нужен был бот, которому можно наговорить задачу голосом, а он бы её сделал. С моими файлами, в моих проектах, на моей машине.

