Kyutai открыла готовый стек для потоковых голосовых агентов Delayed… — Python Community — TG.ME

🎙 Kyutai открыла готовый стек для потоковых голосовых агентов

Delayed Streams Modeling — репозиторий с моделями и примерами для streaming STT и TTS. Аудио обрабатывается частями: агент начинает распознавать речь и генерировать ответ, не дожидаясь окончания записи.

Что внутри:

• потоковая транскрибация с временными метками для каждого слова
• модель 1B EN/FR с задержкой около 0,5 секунды и semantic VAD
• английская модель 2.6B с задержкой около 2,5 секунды
• PyTorch-ноутбуки для экспериментов
• Rust-сервер с WebSocket для продакшена
• MLX-реализация для Mac и iPhone
• streaming TTS, который принимает текст и сразу выдаёт звук частями.

На H100 разработчики заявляют обработку до 400 одновременных STT-потоков, а Rust-сервер на L40S обслуживает 64 подключения быстрее реального времени.

Лицензии разделены по компонентам: Python и web — MIT, Rust backend — Apache 2.0, веса STT — CC BY 4.0.

🔗 https://github.com/kyutai-labs/delayed-streams-modeling

@Python_Community_ru
t.me/Python_Community_ru/3216Translating to English…
July 29, 2026 560 8