Edge Of Future: پست #3300 — TG.ME

🔌رونمایی از بنچمارک CUA-bench؛ آزمون کنترل کیبورد و ماوس در بازی‌ها و سقوط تمام مدل‌های فرانتیر به زیر ۲۰ درصد

مؤسسه پژوهشی Vals AI از بنچمارک جدیدی به نام «CUA-bench» رونمایی کرد که یکی از دشوارترین چالش‌های فعلی هوش مصنوعی را هدف گرفته است: تسک‌هایی که برای انسان‌ها بسیار ساده‌اند، اما قوی‌ترین مدل‌های فرانتیر هنوز در آن‌ها با چالش‌های جدی روبه‌رو هستند. این بنچمارک توانایی ایجنت‌ها را در استفاده مستقل از کیبورد و ماوس برای انجام ۶ بازی ویدیویی تجاری (شامل ۳ بازی عمومی و ۳ بازی مخفی برای جلوگیری از اورفیتینگ) در طول سشن‌های ۳ ساعته ارزیابی می‌کند. بازی‌های عمومی شامل ماینکرفت (ژانر سندباکس)، سوپرهات (واکنش و رفلکس سریع) و ای‌فوتبال (ورزشی) هستند.

نتایج اجرای اولیه این بنچمارک نشان داد که مرز جدید هوش مصنوعی کجاست: تمام مدل‌های فرانتیر نمره‌ای زیر ۲۰ درصد کسب کردند. مدل GPT-6 Astra شرکت OpenAI با کسب امتیاز ۱۹.۱۷ درصد در رتبه نخست ایستاد، اما این اجرا بیش از ۲,۰۵۹ دلار هزینه پردازشی برای هر ران در پی داشت. مدل Claude Fable 5.1 با امتیاز ۱۳.۱۷ درصد و هزینه ۵۹۶ دلار در رتبه دوم قرار گرفت و مدل‌های Claude Opus 5 (۹ درصد)، GPT-5.6 Sol (۸.۳۳ درصد) و Gemini 3.8 Flash (۴.۱۷ درصد) در رده‌های بعدی قرار گرفتند. این نتایج نشان می‌دهد پردازش پیوسته فریم‌های ویدیویی، حفظ حافظه محیطی سه‌بعدی و واکنش بلادرنگ با ماوس و کیبورد، شکاف عمیقی میان توانایی انسان و مدل‌ها ایجاد کرده است.

اهمیت بنیادین CUA-bench در پیوند مستقیم آن با آینده رباتیک نهفته است؛ مهارت‌های مورد نیاز برای کنترل کیبورد و ماوس در محیط‌های شبیه‌سازی‌شده (درک فضایی، واکنش به محرک‌های متغیر، کنترل حرکتی و یادگیری در حین اجرا)، دقیقاً همان قابلیت‌هایی هستند که ربات‌های انسان‌نما در دنیای فیزیکی به آن نیاز دارند. مؤسسه Vals AI تأکید کرده است که اشباع شدن این بنچمارک نیازمند خروج مدل‌ها از چارچوب پردازش متنی و دستیابی به سیستم‌های اکشن آنی و یادگیری پیوسته از تصویر خواهد بود؛ جهشی که رسیدن به آن، گام کلیدی بعدی در توسعه ایجنت‌های عمومی به شمار می‌رود.

@ACCELERATIONERS
🤯3👏2🔥2