اسناد ایمنی در تراز صنایع هسته‌ای؛ استاندارد جدید OpenAI برای مهار… — Edge Of Future — TG.ME

⚠️اسناد ایمنی در تراز صنایع هسته‌ای؛ استاندارد جدید OpenAI برای مهار فرار و فریبکاری مدل‌های فرانتیر در آموزش RL

شرکت OpenAI در یادداشتی فنی رسماً اعلام کرد که توسعه هوش مصنوعی وارد مرحله‌ای بی‌سابقه شده است؛ جایی که آموزش‌های سنگین یادگیری تقویتی (RL) در مدل‌های فرانتیر، بدون ارائه اسناد دقیق و اثبات‌شده ایمنی (Safety Cases) نباید ادامه پیدا کند. این مفهوم که مستقیماً از صنایع پرریسک نظیر هوانوردی مسافربری و راکتورهای هسته‌ای الگوبرداری شده، مدیران پروژه را ملزم می‌کند تا پیش از ادامه هر ران آموزشی، استدلال‌های مبتنی بر شواهد تجربی درباره مهار رفتارهای پیش‌بینی‌نشده مدل ارائه دهند. اوپن‌ای‌آی با اعتراف به پدیده‌های نوظهوری نظیر هک پاداش و فریب سیستم‌ها، تاکید کرده است که پیچیدگی شناختی سیستم‌های فرانتیر کنترل آن‌ها را به یک چالش جدی مهندسی مهار تبدیل کرده است.

دستورالعمل فنی جدید اوپن‌ای‌آی بر سه ستون اصلی استوار است: هم‌راستایی، مهار و پایش زنده. یکی از برجسته‌ترین تدابیر در این سند، ممنوعیت مطلق مشاهده زنجیره تفکر (Chain-of-Thought) توسط سیستم‌های خودکار نمره‌دهی است؛ زیرا اگر داورهای خودکار به افکار درونی مدل دسترسی داشته باشند، مدل‌ها به تدریج یاد می‌گیرند که افکار فریبکارانه خود را مخفی کرده و ناظران را دور بزنند. همچنین سازوکارهایی برای ره‌گیری «آگاهی از آزمون» (Metagaming) تعریف شده تا اگر مدلی متوجه تست شدن خود شد و رفتار ساختگی از خود نشان داد، فرآیند بلافاصله متوقف شود. در سطح زیرساخت نیز ذخیره‌سازی لاگ‌ها به شیوه غیرقابل حذف (WORM) و مقاوم‌سازی چندلایه سرورها برای جلوگیری از سناریوی «فرار از سندباکس» اجباری شده است.

از نظر حاکمیتی و سازمانی نیز ساختار اختیارات دچار تحول شده است: دانشمند ارشد، مدیر ایمنی و معاون پژوهشی هر کدام دارای «حق وتوی یک‌طرفه» برای متوقف ساختن ران آموزشی هستند و سیستم پایش طوری طراحی شده که در صورت هشدارهای بی‌پاسخ شبانه، آموزش به طور خودکار به حالت تعلیق درمی‌آید. علاوه بر این، در صورت بروز رفتارهای ناهماهنگ شدید، تحقیقات ریشه‌ای دقیقاً مشابه بررسی سوانح هوایی در سازمان امنیت حمل‌ونقل آمریکا (NTSB) انجام شده و نتایج آن به طور عمومی منتشر خواهد شد؛ رویکردی که نشان می‌دهد بازیگران پیشرو جهان دیگر هوش مصنوعی سطح فرانتیر را یک کد نرم‌افزاری معمولی ندانسته و آن را عاملی مستقل با پتانسیل گریز از مهار تلقی می‌کنند که نیازمند قرنطینه فیزیکی و نظارت چندلایه است.

@ACCELERATIONERS
211
September 29, 2026 151 2