هوش مصنوعی و علم داده به فارسی: post #3083 — TG.ME

🚀 معرفی مدل قدرتمند Qwen3.8-Flash

‏تیم Qwen از مدل جدید خود با نام Qwen3.8-Flash رونمایی کرد؛ یک مدل چندوجهی (Multimodal) از نوع MoE که پیش‌نمایشی از معماری نسل آینده یعنی Qwen4 محسوب می‌شود.

‏این مدل با وجود ۱۲۵ میلیارد پارامتر، تنها ۶ میلیارد پارامتر را برای هر توکن فعال می‌کند که منجر به بهینگی خیره‌کننده‌ای شده است. از دیگر ویژگی‌های فنی این مدل می‌توان به موارد زیر اشاره کرد:

‏- پشتیبانی از متن پیش‌فرض ۲۶۲ هزار توکن با قابلیت گسترش تا ۱ میلیون
‏- استفاده از معماری نوین شامل GDN و QSA hybrid attention
‏- بهینه‌سازی هزینه‌های آموزش تا ۹ برابر کمتر از مدل‌های قبلی
‏- ثبت نتایج درخشان در بنچ‌مارک‌های مطرحی چون MathVision با امتیاز ۹۵.۷ و SWE-bench Pro با ۶۲.۵

‏شما می‌توانید جزئیات فنی و گزارش کامل این مدل را در گزارش تخصصی Qwen مطالعه کرده و وزن‌های نسخه اولیه آن را از هگینگ‌فیس دریافت کنید. نسخه تولیدی این مدل نیز در پلتفرم QwenCloud با قیمت بسیار رقابتی در دسترس قرار گرفته است.

📚 مطالعه با جزئیات بیشتر

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Qwen3_8_Flash #Muon_optimizer
August 26, 2026 177 3