🎙 Kyutai открыла готовый стек для потоковых голосовых агентов
Delayed Streams Modeling — репозиторий с моделями и примерами для streaming STT и TTS. Аудио обрабатывается частями: агент начинает распознавать речь и генерировать ответ, не дожидаясь окончания записи.
Что внутри:
• потоковая транскрибация с временными метками для каждого слова
• модель 1B EN/FR с задержкой около 0,5 секунды и semantic VAD
• английская модель 2.6B с задержкой около 2,5 секунды
• PyTorch-ноутбуки для экспериментов
• Rust-сервер с WebSocket для продакшена
• MLX-реализация для Mac и iPhone
• streaming TTS, который принимает текст и сразу выдаёт звук частями.
На H100 разработчики заявляют обработку до 400 одновременных STT-потоков, а Rust-сервер на L40S обслуживает 64 подключения быстрее реального времени.
Лицензии разделены по компонентам: Python и web — MIT, Rust backend — Apache 2.0, веса STT — CC BY 4.0.
🔗 https://github.com/kyutai-labs/delayed-streams-modeling
@Python_Community_ru

t.me/Python_Community_ru/3216Translating to English…
July 29, 2026 560 8