سقوط آخرین سنگر انسانی بازی‌های فکری؛ شکست قهرمان تاریخ استراتگو توسط… — Edge Of Future — TG.ME

✅️سقوط آخرین سنگر انسانی بازی‌های فکری؛ شکست قهرمان تاریخ استراتگو توسط هوش مصنوعی Ataraxos

پژوهشگران دانشگاه‌های کارنگی ملون، نیویورک، استنفورد و MIT در مقاله‌ای که در ژورنال نیچر (Nature) منتشر شد، از هوش مصنوعی Ataraxos رونمایی کردند؛ سامانه‌ای که موفق شد آخرین سنگر انسان در بازی‌های تخته‌ای کلاسیک را تسخیر کند. استراتگو (Stratego) به دلیل وجود اطلاعات ناقص و «چیدمان اولیه پنهان مهره‌ها» همواره چالشی فراتر از شطرنج و گو برای هوش مصنوعی به شمار می‌رفت؛ جایی که هر بازیکن ۴۰ مهره خود را پشت به حریف می‌چیند و بیش از ۱۰³³ چینش اولیه ممکن وجود دارد. در یک مسابقه رسمی و ۲۰ مرحله‌ای که در طول سه هفته برگزار شد، Ataraxos با نتیجه قاطع ۱۵ برد، ۱ باخت و ۴ تساوی (نرخ پیروزی مؤثر ۸۵ درصد) موفق شد «پیم نیمایر»، پرافتخارترین بازیکن تاریخ این بازی با ۴ دوره قهرمانی جهان و بیش از ۶۰۰ هفته صدرنشینی رنکینگ جهانی را شکست دهد؛ برتری مطلقی که حتی با وجود امتیاز آنالیز آزادانه سبک بازی مدل توسط این قهرمان هلندی در طول رقابت‌ها به دست آمد.

شگفتی اصلی این دستاورد در معماری و بهره‌وری محاسباتی خارق‌العاده آن در مقایسه با تلاش‌های پیشین نهفته است. در سال‌های گذشته، دیپ‌مایند گوگل با پروژه DeepNash تلاش کرده بود این بازی را مهار کند، اما پس از ماه‌ها آموزش روی ۱۰۲۴ نود TPU و صرف هزینه‌ای بین ۳ تا ۴.۵ میلیون دلار، نتوانست از سد بازیکنان برتر انسانی عبور کند. در نقطه مقابل، تیم دانشگاهی سازنده Ataraxos کل فرآیند آموزش را تنها روی ۱۶ تراشه Nvidia H100 ظرف یک هفته (به همراه ۴ روز پردازش شبکه باور روی ۴ تراشه) و با هزینه‌ای کمتر از ۸ هزار دلار به سرانجام رساند؛ یعنی حدود ۱/۵۰۰ هزینه پردازشی دیپ‌مایند با ۱/۳۰ تعداد بازی‌های خودآموز. این جهش با نوشتن یک شبیه‌ساز اختصاصی بر بستر GPU، تنظیم پویای فشار یادگیری (مجبور کردن مدل به کاوش‌های غیرمنتظره در ابتدای مسیر برای جلوگیری از افتادن در الگوهای قابل پیش‌بینی) و توسعه یک «شبکه باور» محقق شد که پیش از هر حرکت، وضعیت محتمل مهره‌های مخفی حریف را تخمین زده و یک گام جستجوی تصمیم‌گیری لحظه‌ای انجام می‌دهد.

پیامد این پیروزی، فروپاشی این فرضیه قدیمی است که پنهان بودن اطلاعات مانعی عبورناپذیر در برابر یادگیری تقویتی (RL) و الگوریتم‌های جستجو است. پژوهشگران نشان دادند همین روش در بازی‌های کارتی با اطلاعات ناقص دیگر نظیر Hanabi (با ۱۰۰ برابر پردازش کمتر از رکوردهای پیشین) و بازی چینی Dou Dizhu نیز سامانه‌های شاخص قبلی را به طور کامل مغلوب ساخته است. مهار فضای راهبردی با ۱۰³³ حالت پنهان ثابت می‌کند که هرگاه بتوان شبیه‌سازهای دقیق و سریع طراحی کرد، هوش مصنوعی می‌تواند پیچیده‌ترین تصمیم‌گیری‌های مبتنی بر حدس، بلوف و مه‌آلودگی اطلاعاتی را حل کند؛ قابلیتی که مستقیماً به میادین واقعی دنیای خارج، از تحلیل نوسانات پیش‌بینی‌ناپذیر بازارهای مالی گرفته تا شبیه‌سازی منازعات نظامی و رزمایش‌های خودران، تعمیم‌پذیر خواهد بود.

@ACCELERATIONERS
721
October 1, 2026 333 4 6