🎙️⚡ مدل Muse Voice Transcribe؛ مدل جدید Meta برای تشخیص گفتار Real-time
تیم Meta Superintelligence Labs مدل Muse Voice Transcribe را معرفی کرده؛ مدلی برای تبدیل گفتار به متن بهصورت Streaming که همزمان میتواند گویندهها را تفکیک کند و پایان جمله را تشخیص دهد.
قابلیتهای اصلی آن شامل Real-time STT، Diarization برای بیش از ۲۰ گوینده، تشخیص End-of-Utterance، تغییر زبان داخل یک جمله و تنظیم Context برای اسامی و اصطلاحات خاص است.
در دموی منتشرشده، مدل توانسته گفتوگوی ۸ نفر بهصورت همزمان را تفکیک کند و مشخص کند هر جمله متعلق به چه کسی است. بیش از ۲۵ زبان نیز پشتیبانی میشود؛ فعلاً روسی در فهرست اعلامشده دیده نمیشود.
🔥 نکته جالب، Context-aware Transcription است: میتوان نام اشخاص، مکانها یا اصطلاحات تخصصی را از قبل به مدل داد تا احتمال اشتباه در تشخیص آنها کاهش پیدا کند.
https://research.meta.ai/blog/introducing-muse-voice-transcribe
@rss_ai_ir
❤️ حمایت از کانال:
https://daramet.com/Virsun
#SpeechToText #RealtimeAI #Diarization #MetaAI #VoiceAI #ASR #MuseVoice #هوش_مصنوعی
21
11
8
6
6September 3, 2026 758 11
