Hugging Face собрала open-source стек для локальных голосовых агентов… — Python Community — TG.ME

Hugging Face собрала open-source стек для локальных голосовых агентов

Репозиторий speech-to-speech содержит модульный пайплайн с низкой задержкой:

VAD → STT → LLM → TTS

Каждый компонент можно заменить. Для распознавания речи поддерживаются Parakeet TDT, Whisper, Faster Whisper и Paraformer. Для генерации голоса доступны Qwen3-TTS, Kokoro, Pocket TTS, ChatTTS и MMS.

LLM можно запускать через облачный OpenAI-совместимый API либо локально через Transformers, MLX, vLLM или llama.cpp. Весь стек способен работать на собственном железе без передачи аудио внешнему сервису.

Сервер поддерживает протокол OpenAI Realtime и WebSocket-эндпоинт /v1/realtime. Это позволяет подключать существующие клиенты с потоковой передачей аудио, транскрипцией, прерыванием ответа и tool calling.

Запуск:


pip install speech-to-speech
speech-to-speech


По умолчанию используются Parakeet TDT для распознавания и Qwen3-TTS для синтеза речи. Есть отдельные режимы для локального микрофона, WebSocket, TCP и Docker. Проект уже используется как разговорный бэкенд для тысяч роботов Reachy Mini.

Лицензия: Apache 2.0.

https://github.com/huggingface/speech-to-speech

@Python_Community_ru
July 23, 2026 682 14