Edge Of Future: پست #3304 — TG.ME

🔌بنچمارک WeirdML v3؛ آزمون حل تسک‌های ناشناخته ML توسط ایجنت‌ها و برتری GPT-6 Astra در اسکیل توکن

هاوارد تویت ایله (Håvard Tveit Ihle) نسخه سوم بنچمارک تحقیقاتی WeirdML را منتشر کرد؛ یک بنچمارک کاملاً ایجنتی شامل ۱۱ تسک دست‌ساز و پیچیده که توانایی مدل‌ها را در نقش یک مهندس ML می‌سنجد. در این آزمون، مدل‌ها با دیتاست‌های ناآشنا، اهداف مبهم و فیدبک‌های بسیار کم روبه‌رو می‌شوند و باید داده‌ها را تحلیل کنند، پایپ‌لاین‌های ماشین لرنینگ بسازند، کدهای PyTorch بنویسند و در چند مرحله بر اساس خروجی‌های ترمینال، کدهایشان را دیباگ و بهینه کنند.

نمودار مقایسه نمره مدل‌ها نسبت به توکن مصرفی در هر تسک (از ۱۰۰ هزار تا ۵۰ میلیون توکن)، تفاوت مدل‌ها را در کارهای طولانی نشان می‌دهد. پنجره حل تسک‌ها عملاً از حدود ۴۰۰ تا ۵۰۰ هزار توکن باز می‌شود، یعنی مدل برای فهم اولیه مسئله به توکن زیادی نیاز دارد. در این بین، مدل GPT-6 Astra با حفظ رشد مداوم به نمره ۵۴ درصد در ۵۰ میلیون توکن رسید و رتبه اول را گرفت. مدل Claude Fable 5.1 با نمره ۴۴ درصد دوم شد، در حالی که GPT-5.6 Sol روی ۲۲ درصد فلت شد و مدل‌های Flash (مثل Gemini 3.8 و DeepSeek V4.1) زیر ۱۵ درصد ماندند.

این نتایج نشان می‌دهد که برای تسک‌های پیچیده مهندسی و ML، مدل‌های سبک توانایی حفظ زنجیره استدلال در زمان طولانی را ندارند. برتری Astra و Fable ثابت می‌کند که افزایش Test-Time Compute تنها زمانی جواب می‌دهد که مدل پایه در تحلیل داده‌ها و حل گام‌به‌گام باگ‌ها در پایتون تسلط داشته باشد تا با تکرار تست‌ها به نتیجه درست برسد.

@ACCELERATIONERS
🤯3👍3🔥1