Двадцать человек в комнате, все перебивают друг друга, кто-то посреди фразы перескакивает на другой язык. Обычно на таком месте любая транскрибация складывает лапки. Новая модель от Meta* — нет.
Muse Voice Transcribe стала первой у компании моделью, которая работает со звуком в реальном времени. Она разделяет говорящих и сама определяет, где заканчивается реплика. Всё внутри одной модели.
Самое любопытное — как она решает, когда «дослушать». Марк Цукерберг объяснил механику так: модель сама выбирает момент. На сложных словах она ждёт чуть дольше, на простых фиксирует результат быстрее. Этот адаптивный сдвиг помогает точнее предсказывать каждый следующий фрагмент.
Обучали её на более чем 70 языках, из которых 25 подтверждены на старте. Заявлено, что модель держит смешение языков прямо посреди предложения и не разваливается на часовых записях с двумя десятками участников.
Разработчикам её отдали через Muse Code и Model API — 3 доллара за 1000 минут аудио. Демоверсия лежит в исследовательском блоге компании.
*Компания Meta Platforms Inc. признана экстремистской организацией и запрещена на территории РФ.
@droidergram



