گوگل از مدلهای جدید خود برای تبدیل گفتار به متن با نرخ خطای بسیار پایین (WER) رونمایی کرد. این فناوری در دو نسخه عرضه شده است که هر کدام برای نیازهای متفاوتی بهینهسازی شدهاند. جزئیات، زمینه و نکات تکمیلی این مطلب در نسخه کامل مطلب با عمق بیشتری آمده است.
مدل
gemini-3.5-transcribe-live برای استریمینگ آنی و زیر یک ثانیه از طریق WebSockets طراحی شده است، در حالی که مدل gemini-3.5-transcribe برای پردازش فایلهای ضبطشده با قابلیت شناسایی گوینده و واژگان تخصصی بهینه شده است.مهمترین نکات درباره این مدلها:
- در انتخاب نسخه دقت کنید؛ قابلیت استریمینگ با تأخیر کم و شناسایی گوینده (Diarization) در این مدلها همزمان در دسترس نیست.
- حالت هوشمند (Smart mode) امکان ترکیب با تایماستمپ یا شناسایی گوینده را ندارد و برای خلاصه و متن دقیق باید دو درخواست مجزا ارسال شود.
- عملکرد مدل در حالت دستهای (Batch) نرخ خطای ۲.۶ درصد را ثبت کرده و نسبت به مدل Chirp 3 حدود ۷۰ درصد سریعتر نهاییسازی میشود.
- پشتیبانی از بیش از ۸۵ زبان زنده دنیا با هزینهای رقابتی.
برای بررسی تحلیل کامل و جزئیات فنی میتوانید به منبع اصلی مراجعه کنید.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Gemini_3_5_Transcribe #Diarization
