چه رخ داده؟ این عکس یک رشته توییت است که به یک نگرانی مهم در حوزه… — افــــــق رویـــــداد — TG.ME

چه رخ داده؟

این عکس یک رشته توییت است که به یک نگرانی مهم در حوزه ایمنی هوش مصنوعی اشاره می‌کند.

گزارشی از نشریه The Information (اوایل سپتامبر ۲۰۲۶) منتشر شد مبنی بر این‌که OpenAI در مدل Astra از یک تکنیک استدلالی به نام recurrent depth (عمق بازگشتی) استفاده کرده است.

طبق گزارش‌ها، این تکنیک بخشی از فرایند تفکر مدل را از حالت زنجیرهٔ‌فکر متنی و قابل‌خواندن (chain-of-thought) به سمت یک جریان عددی و کدگذاری‌شده درونی سوق می‌دهد؛ همان چیزی که در محافل ایمنی هوش مصنوعی به آن نورالیز (neuralese) می‌گویند.

این واقعا نگران‌کننده است

تا امروز، یکی از معدود ابزارهای قابل‌اتکا برای نظارت بر نیت واقعی مدل‌های پیشرفته، همین بود که می‌شد زنجیره فکر آن‌ها را به زبان طبیعی خواند.

اگر این تفکر به شکل بردارهای عددی غیرقابل‌فهم برای انسان دربیاید، آن پنجرهٔ نظارتی عملا بسته می‌شود ـ یعنی نمی‌توان فهمید مدل واقعا چه فکر می‌کند، حتی اگر خروجی نهایی‌اش بی‌خطر به نظر برسد. OpenAI رسما اعلام کرده که کاربرد این روش را محدود نگه‌داشته و همچنان به شفافیت زنجیره فکر متعهد است (سخنان جیکوب پاچوکی، دانشمند ارشد OpenAI)، اما همین گزارش کافی بود تا جامعه ایمنی هوش مصنوعی را نگران کند.

توماس لارسن، از تدوین‌کنندگان سناریوی معروف AI 2027، اشاره می‌کند که در آن سناریوی فرضی، دقیقا همین اتفاق ـ گذار از زنجیره فکر متنی به حافظه و بازگشتِ نورال با پهنای باند بالاتر ـ برای مارس ۲۰۲۷ پیش‌بینی شده بود (تصویر بالا، برگرفته از خودِ سند AI 2027 است).

دنیل کوکوتایلو، از بنیان‌گذاران همان پروژه AI 2027 و کارشناس سابق OpenAI، با دیدن خبر واقعی واکنش نشان داده: این اتفاق در واقعیت، حدود شش ماه زودتر از پیش‌بینیِ خودشان رخ داده است ـ و دقیقا همان نوع پیشرفتی است که در سناریوی آن‌ها به‌عنوان یکی از نقاط عطف نگران‌کننده به سمت از‌دست‌رفتنِ قابلیت نظارت بر هوش مصنوعی معرفی شده بود.

خلاصه اینکه نگرانی اصلی این است که واقعیت دارد سریع‌تر از پیش‌بینی‌های بدبینانه به سمت سناریویی حرکت می‌کند که در آن دیگر نمی‌توان فهمید هوش مصنوعی واقعا چه می‌اندیشد.

🚀 @ofoghroydad

➕ گزارش‌های بعدی می‌گویند استفاده Astra از این روش محدود شده است و زنجیره فکر مدل همچنان تا حد زیادی قابل مشاهده است. OpenAI هم صراحتا گفته که می‌خواهد CoT monitoring را حفظ کند

➕اOpenAI نخستین مدل frontier خود را با مقداری محاسبات بازگشتیِ نهفته وارد مرحله عملیاتی کرده است؛ بنابراین بخشی از محاسبات مدل دیگر الزاما به شکل زنجیره فکر زبانی ظاهر نمی‌شود.

➕ ادعای این می‌تواند در آینده monitorability را شدیدا کاهش دهد؛ کاملا یک نگرانی معتبر در امنیت مدل‌ها است.
September 4, 2026 2.7K 48