مؤسسه پژوهشی Vals AI از بنچمارک جدیدی به نام «CUA-bench» رونمایی کرد که یکی از دشوارترین چالشهای فعلی هوش مصنوعی را هدف گرفته است: تسکهایی که برای انسانها بسیار سادهاند، اما قویترین مدلهای فرانتیر هنوز در آنها با چالشهای جدی روبهرو هستند. این بنچمارک توانایی ایجنتها را در استفاده مستقل از کیبورد و ماوس برای انجام ۶ بازی ویدیویی تجاری (شامل ۳ بازی عمومی و ۳ بازی مخفی برای جلوگیری از اورفیتینگ) در طول سشنهای ۳ ساعته ارزیابی میکند. بازیهای عمومی شامل ماینکرفت (ژانر سندباکس)، سوپرهات (واکنش و رفلکس سریع) و ایفوتبال (ورزشی) هستند.
نتایج اجرای اولیه این بنچمارک نشان داد که مرز جدید هوش مصنوعی کجاست: تمام مدلهای فرانتیر نمرهای زیر ۲۰ درصد کسب کردند. مدل GPT-6 Astra شرکت OpenAI با کسب امتیاز ۱۹.۱۷ درصد در رتبه نخست ایستاد، اما این اجرا بیش از ۲,۰۵۹ دلار هزینه پردازشی برای هر ران در پی داشت. مدل Claude Fable 5.1 با امتیاز ۱۳.۱۷ درصد و هزینه ۵۹۶ دلار در رتبه دوم قرار گرفت و مدلهای Claude Opus 5 (۹ درصد)، GPT-5.6 Sol (۸.۳۳ درصد) و Gemini 3.8 Flash (۴.۱۷ درصد) در ردههای بعدی قرار گرفتند. این نتایج نشان میدهد پردازش پیوسته فریمهای ویدیویی، حفظ حافظه محیطی سهبعدی و واکنش بلادرنگ با ماوس و کیبورد، شکاف عمیقی میان توانایی انسان و مدلها ایجاد کرده است.
اهمیت بنیادین CUA-bench در پیوند مستقیم آن با آینده رباتیک نهفته است؛ مهارتهای مورد نیاز برای کنترل کیبورد و ماوس در محیطهای شبیهسازیشده (درک فضایی، واکنش به محرکهای متغیر، کنترل حرکتی و یادگیری در حین اجرا)، دقیقاً همان قابلیتهایی هستند که رباتهای انساننما در دنیای فیزیکی به آن نیاز دارند. مؤسسه Vals AI تأکید کرده است که اشباع شدن این بنچمارک نیازمند خروج مدلها از چارچوب پردازش متنی و دستیابی به سیستمهای اکشن آنی و یادگیری پیوسته از تصویر خواهد بود؛ جهشی که رسیدن به آن، گام کلیدی بعدی در توسعه ایجنتهای عمومی به شمار میرود.
@ACCELERATIONERS


