OpenAI Realtime против Яндекс Realtime: сравнил два голосовых движка для России и за вечер пересадил свой прод
Я делаю голосового ИИ-приёмщика для малого бизнеса — назвал её Айкой. Клиент звонит (пока — говорит через демо на сайте), Айка отвечает голосом: рассказывает про услуги, цены, записывает на разбор. Собрана на российском стеке: распознавание и синтез — Yandex SpeechKit, «мозг» — Claude. Классическая трёхзвенка.6 июля OpenAI выпустил gpt-realtime — обновление своего движка «речь в речь» (speech-to-speech). Лента запестрела: «говорит как человек», «можно перебивать», «латентность упала». Я занервничал: неужели мой проверенный стек уже вчерашний день?
Умная колонка своими руками
В этой статье я расскажу, как сделать своими руками две умные колонки, полностью поддерживающие русский язык:1) На микроконтроллере esp32s3, используя XiaoZhi
Разрабатываем голосового ассистента на Rockchip. Часть 2
Продолжаю разрабатывать DIY голосового ассистента на SOC-платформе Rockchip.В первой части мы соединили в единый конвейер вызов распознавания речи, локального чат-бота и синтез ответа.Если еще не читали, то вам
Робот Xiaozhi: беседа двух роботов
Дополнение к моей предыдущей мини-статье по роботу Xiaozhi. Я заказал детали и комплектующие, чтобы собрать такого робота самостоятельно. Сборка данного робота не доставляет существенных проблем.Детали, которые я использовал (вариант стандартного билда):
Vera — ваш личный десктопный агент
В прошлой статье я описывал свой эксперимент по возможностям маленьких LLM. Эта статья идет как продолжение, в которой я расскажу о проделанной работе по изменению и улучшению функционала голосового агента. И поверьте, мне есть что рассказать.Когда я задумывал своего агента, меня дико раздражали три вещи в существующих решениях:"Дай денег": Либо плати подписку за ChatGPT Plus, либо привязывай свою карту к API OpenAI/Anthropic/Perplexity."Дай данные":
Пишем персонального AI-ассистента на Python
Современные голосовые помощники это мощные приложения, сочетающие обработку речи, машинное обучение и интеграцию с внешними API. В этой статье мы разберём, как создать базовый проект персонального ассистента на Python, используя библиотеки whisper, webrtcvad, gTTS и другие. Наш ассистент будет:Слушать микрофонОпределять начало и конец речи с помощью VAD (Voice Activity Detection)Преобразовывать речь в текст через модель WhisperОтправлять запросы на локальный LLM для генерации ответаЧитать ответ вслух с помощью gTTSНачинать/останавливать запись по клавише пробел

