Tensorflow(@CVision): post #4382 — TG.ME

Tensorflow(@CVision)گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفته‌ی گوگل، دقیق‌ترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمه‌به‌کلمه‌ی…
مدل جدید در مکالمه‌های واقعی می‌تواند مکث‌ها و کلمات اضافه مثل «اِمم» را حذف کند، اصلاح جمله توسط گوینده را متوجه شود و متن را به‌صورت خودکار فرمت کند. همچنین امکان تعریف Custom Vocabulary برای اصطلاحات تخصصی و نام‌های خاص هم وجود دارد؛ قابلیتی که برای کاربردهای سازمانی و فنی اهمیت زیادی دارد. 📝⚡️

یکی از جذاب‌ترین بخش‌ها، پشتیبانی از بیش از ۸۵ زبان، تشخیص لهجه‌ها و جابه‌جایی بین زبان‌هاست. برای فایل‌های ضبط‌شده هم قابلیت تشخیص گوینده و Word-level Timestamp در نظر گرفته شده و مدل می‌تواند تا سه گوینده را تفکیک کند؛ پشتیبانی از تعداد بیشتر فعلاً آزمایشی است. 🌍🎧
برای کاربردهای Real-time هم گوگل نسخه‌ی جداگانه‌ی gemini-3.5-transcribe-live را از طریق Live API ارائه کرده که برای Voice Agentها، زیرنویس زنده و اپلیکیشن‌های تعاملی طراحی شده و Latency زیر یک ثانیه را هدف قرار می‌دهد. نسخه‌ی دیگر هم برای پردازش فایل‌های ضبط‌شده، جلسات و تماس‌ها در دسترس است. 🚀

از نظر بنچمارک هم اعداد جالب‌اند؛ طبق داده‌ای که گوگل با استناد به Artificial Analysis منتشر کرده، میانگین WER حدود ۴٪ در حالت Streaming و ۲.۶٪ در حالت Non-streaming گزارش شده و زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰٪ بهبود داشته است. 📊
نکته‌ی مهم‌تر این است که گوگل Transcribe را صرفاً به چشم یک موتور STT نمی‌بیند. این مدل در بعضی تجربه‌های Gemini می‌تواند با Context صفحه و مدل‌های دیگر ترکیب شود؛ یعنی فرمان صوتی در آینده فقط برای «تایپ با صدا» نیست و می‌تواند بخشی از رابط اصلی تعامل با AI Agentها باشد. 🤖🎤
فعلاً دسترسی توسعه‌دهندگان به Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio به‌صورت Public Preview فراهم شده؛ این فناوری در Gemini روی macOS و قابلیت Rambler اندروید هم استفاده می‌شود و گوگل گفته پشتیبانی آن در Chrome نیز در راه است. 🧪🌐

به‌نظر می‌رسد رقابت مدل‌های صوتی حالا از «چه کسی دقیق‌تر صدا را متن می‌کند؟» عبور کرده و به سؤال بزرگ‌تری رسیده: چه کسی بهتر می‌تواند منظور کاربر را از صدا بفهمد و آن را مستقیماً به عمل تبدیل کند؟ 👀

🌀 @cvision 🌀
❤8🔥3
August 27, 2026 2K 35