پژوهشگران دانشگاههای کارنگی ملون، نیویورک، استنفورد و MIT در مقالهای که در ژورنال نیچر (Nature) منتشر شد، از هوش مصنوعی Ataraxos رونمایی کردند؛ سامانهای که موفق شد آخرین سنگر انسان در بازیهای تختهای کلاسیک را تسخیر کند. استراتگو (Stratego) به دلیل وجود اطلاعات ناقص و «چیدمان اولیه پنهان مهرهها» همواره چالشی فراتر از شطرنج و گو برای هوش مصنوعی به شمار میرفت؛ جایی که هر بازیکن ۴۰ مهره خود را پشت به حریف میچیند و بیش از ۱۰³³ چینش اولیه ممکن وجود دارد. در یک مسابقه رسمی و ۲۰ مرحلهای که در طول سه هفته برگزار شد، Ataraxos با نتیجه قاطع ۱۵ برد، ۱ باخت و ۴ تساوی (نرخ پیروزی مؤثر ۸۵ درصد) موفق شد «پیم نیمایر»، پرافتخارترین بازیکن تاریخ این بازی با ۴ دوره قهرمانی جهان و بیش از ۶۰۰ هفته صدرنشینی رنکینگ جهانی را شکست دهد؛ برتری مطلقی که حتی با وجود امتیاز آنالیز آزادانه سبک بازی مدل توسط این قهرمان هلندی در طول رقابتها به دست آمد.
شگفتی اصلی این دستاورد در معماری و بهرهوری محاسباتی خارقالعاده آن در مقایسه با تلاشهای پیشین نهفته است. در سالهای گذشته، دیپمایند گوگل با پروژه DeepNash تلاش کرده بود این بازی را مهار کند، اما پس از ماهها آموزش روی ۱۰۲۴ نود TPU و صرف هزینهای بین ۳ تا ۴.۵ میلیون دلار، نتوانست از سد بازیکنان برتر انسانی عبور کند. در نقطه مقابل، تیم دانشگاهی سازنده Ataraxos کل فرآیند آموزش را تنها روی ۱۶ تراشه Nvidia H100 ظرف یک هفته (به همراه ۴ روز پردازش شبکه باور روی ۴ تراشه) و با هزینهای کمتر از ۸ هزار دلار به سرانجام رساند؛ یعنی حدود ۱/۵۰۰ هزینه پردازشی دیپمایند با ۱/۳۰ تعداد بازیهای خودآموز. این جهش با نوشتن یک شبیهساز اختصاصی بر بستر GPU، تنظیم پویای فشار یادگیری (مجبور کردن مدل به کاوشهای غیرمنتظره در ابتدای مسیر برای جلوگیری از افتادن در الگوهای قابل پیشبینی) و توسعه یک «شبکه باور» محقق شد که پیش از هر حرکت، وضعیت محتمل مهرههای مخفی حریف را تخمین زده و یک گام جستجوی تصمیمگیری لحظهای انجام میدهد.
پیامد این پیروزی، فروپاشی این فرضیه قدیمی است که پنهان بودن اطلاعات مانعی عبورناپذیر در برابر یادگیری تقویتی (RL) و الگوریتمهای جستجو است. پژوهشگران نشان دادند همین روش در بازیهای کارتی با اطلاعات ناقص دیگر نظیر Hanabi (با ۱۰۰ برابر پردازش کمتر از رکوردهای پیشین) و بازی چینی Dou Dizhu نیز سامانههای شاخص قبلی را به طور کامل مغلوب ساخته است. مهار فضای راهبردی با ۱۰³³ حالت پنهان ثابت میکند که هرگاه بتوان شبیهسازهای دقیق و سریع طراحی کرد، هوش مصنوعی میتواند پیچیدهترین تصمیمگیریهای مبتنی بر حدس، بلوف و مهآلودگی اطلاعاتی را حل کند؛ قابلیتی که مستقیماً به میادین واقعی دنیای خارج، از تحلیل نوسانات پیشبینیناپذیر بازارهای مالی گرفته تا شبیهسازی منازعات نظامی و رزمایشهای خودران، تعمیمپذیر خواهد بود.
@ACCELERATIONERS
