مدل Muse Voice Transcribe؛ مدل جدید Meta برای تشخیص گفتار Real-time… — VIRSUN — TG.ME

🎙️ مدل Muse Voice Transcribe؛ مدل جدید Meta برای تشخیص گفتار Real-time

تیم Meta Superintelligence Labs مدل Muse Voice Transcribe را معرفی کرده؛ مدلی برای تبدیل گفتار به متن به‌صورت Streaming که هم‌زمان می‌تواند گوینده‌ها را تفکیک کند و پایان جمله را تشخیص دهد.

قابلیت‌های اصلی آن شامل Real-time STT، Diarization برای بیش از ۲۰ گوینده، تشخیص End-of-Utterance، تغییر زبان داخل یک جمله و تنظیم Context برای اسامی و اصطلاحات خاص است.

در دموی منتشرشده، مدل توانسته گفت‌وگوی ۸ نفر به‌صورت هم‌زمان را تفکیک کند و مشخص کند هر جمله متعلق به چه کسی است. بیش از ۲۵ زبان نیز پشتیبانی می‌شود؛ فعلاً روسی در فهرست اعلام‌شده دیده نمی‌شود.

🔥 نکته جالب، Context-aware Transcription است: می‌توان نام اشخاص، مکان‌ها یا اصطلاحات تخصصی را از قبل به مدل داد تا احتمال اشتباه در تشخیص آن‌ها کاهش پیدا کند.

https://research.meta.ai/blog/introducing-muse-voice-transcribe

@rss_ai_ir
❤️ حمایت از کانال:
https://daramet.com/Virsun

#SpeechToText #RealtimeAI #Diarization #MetaAI #VoiceAI #ASR #MuseVoice #هوش_مصنوعی
🙏21🔥11👌8❤6👍6
September 3, 2026 758 11