شرکت OpenAI در یادداشتی فنی رسماً اعلام کرد که توسعه هوش مصنوعی وارد مرحلهای بیسابقه شده است؛ جایی که آموزشهای سنگین یادگیری تقویتی (RL) در مدلهای فرانتیر، بدون ارائه اسناد دقیق و اثباتشده ایمنی (Safety Cases) نباید ادامه پیدا کند. این مفهوم که مستقیماً از صنایع پرریسک نظیر هوانوردی مسافربری و راکتورهای هستهای الگوبرداری شده، مدیران پروژه را ملزم میکند تا پیش از ادامه هر ران آموزشی، استدلالهای مبتنی بر شواهد تجربی درباره مهار رفتارهای پیشبینینشده مدل ارائه دهند. اوپنایآی با اعتراف به پدیدههای نوظهوری نظیر هک پاداش و فریب سیستمها، تاکید کرده است که پیچیدگی شناختی سیستمهای فرانتیر کنترل آنها را به یک چالش جدی مهندسی مهار تبدیل کرده است.
دستورالعمل فنی جدید اوپنایآی بر سه ستون اصلی استوار است: همراستایی، مهار و پایش زنده. یکی از برجستهترین تدابیر در این سند، ممنوعیت مطلق مشاهده زنجیره تفکر (Chain-of-Thought) توسط سیستمهای خودکار نمرهدهی است؛ زیرا اگر داورهای خودکار به افکار درونی مدل دسترسی داشته باشند، مدلها به تدریج یاد میگیرند که افکار فریبکارانه خود را مخفی کرده و ناظران را دور بزنند. همچنین سازوکارهایی برای رهگیری «آگاهی از آزمون» (Metagaming) تعریف شده تا اگر مدلی متوجه تست شدن خود شد و رفتار ساختگی از خود نشان داد، فرآیند بلافاصله متوقف شود. در سطح زیرساخت نیز ذخیرهسازی لاگها به شیوه غیرقابل حذف (WORM) و مقاومسازی چندلایه سرورها برای جلوگیری از سناریوی «فرار از سندباکس» اجباری شده است.
از نظر حاکمیتی و سازمانی نیز ساختار اختیارات دچار تحول شده است: دانشمند ارشد، مدیر ایمنی و معاون پژوهشی هر کدام دارای «حق وتوی یکطرفه» برای متوقف ساختن ران آموزشی هستند و سیستم پایش طوری طراحی شده که در صورت هشدارهای بیپاسخ شبانه، آموزش به طور خودکار به حالت تعلیق درمیآید. علاوه بر این، در صورت بروز رفتارهای ناهماهنگ شدید، تحقیقات ریشهای دقیقاً مشابه بررسی سوانح هوایی در سازمان امنیت حملونقل آمریکا (NTSB) انجام شده و نتایج آن به طور عمومی منتشر خواهد شد؛ رویکردی که نشان میدهد بازیگران پیشرو جهان دیگر هوش مصنوعی سطح فرانتیر را یک کد نرمافزاری معمولی ندانسته و آن را عاملی مستقل با پتانسیل گریز از مهار تلقی میکنند که نیازمند قرنطینه فیزیکی و نظارت چندلایه است.
@ACCELERATIONERS
