NVIDIA сделала модель, которая работает иначе, и её уже можно попробовать.
Она называется Nemotron 3 VoiceChat и входит в открытый набор NeMo Speech.
Модель слушает и отвечает в реальном времени в полнодуплексном режиме, поэтому её можно перебить прямо посреди фразы — почти как в обычном разговоре.
Для локального запуска самого фреймворка нужны GPU и CUDA.
Но у модели есть живая демоверсия, которую может открыть и попробовать любой.
https://github.com/NVIDIA-NeMo/Speech

