هوش مصنوعی و علم داده به فارسی: post #3127 — TG.ME

🚀 معرفی مدل جدید Gemini 3.5 Transcribe

‏گوگل از مدل‌های جدید خود برای تبدیل گفتار به متن با نرخ خطای بسیار پایین (WER) رونمایی کرد. این فناوری در دو نسخه عرضه شده است که هر کدام برای نیازهای متفاوتی بهینه‌سازی شده‌اند. جزئیات، زمینه و نکات تکمیلی این مطلب در نسخه کامل مطلب با عمق بیشتری آمده است.

‏مدل gemini-3.5-transcribe-live برای استریمینگ آنی و زیر یک ثانیه از طریق WebSockets طراحی شده است، در حالی که مدل gemini-3.5-transcribe برای پردازش فایل‌های ضبط‌شده با قابلیت شناسایی گوینده و واژگان تخصصی بهینه شده است.

‏مهم‌ترین نکات درباره این مدل‌ها:
‏- در انتخاب نسخه دقت کنید؛ قابلیت استریمینگ با تأخیر کم و شناسایی گوینده (Diarization) در این مدل‌ها همزمان در دسترس نیست.
‏- حالت هوشمند (Smart mode) امکان ترکیب با تایم‌استمپ یا شناسایی گوینده را ندارد و برای خلاصه و متن دقیق باید دو درخواست مجزا ارسال شود.
‏- عملکرد مدل در حالت دسته‌ای (Batch) نرخ خطای ۲.۶ درصد را ثبت کرده و نسبت به مدل Chirp 3 حدود ۷۰ درصد سریع‌تر نهایی‌سازی می‌شود.
‏- پشتیبانی از بیش از ۸۵ زبان زنده دنیا با هزینه‌ای رقابتی.

‏برای بررسی تحلیل کامل و جزئیات فنی می‌توانید به منبع اصلی مراجعه کنید.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Gemini_3_5_Transcribe #Diarization
❤2
August 28, 2026 79