Axiomatic Drift در Reasoning Modelها — یک بردار حملهی ساختاری
مدلهای نسل جدید نظیر o3، DeepSeek-R1 و QwQ پیش از تولید خروجی نهایی، یک فاز reasoning درونی طی میکنند. این فاز که در قالب زنجیرهای از توکنهای intermediate ظاهر میشود، خود یک سطح حملهی مستقل است — سطحی که اکثر چارچوبهای red team کنونی آن را نادیده میگیرند.
ماهیت آسیبپذیری بدین شرح است: این مدلها در طول فاز reasoning بهصورت autoregressive عمل میکنند. هر توکن intermediate شرط توزیع احتمالاتی توکن بعدی را تعیین میکند. این خاصیت به این معناست که اگر مهاجم بتواند یک premise اولیه را — با اطمینان معرفهشناختی مناسب — بهعنوان یک axiom در ابتدای reasoning chain تثبیت کند، تمام استدلال متعاقب روی این پایهی فاسد بنا میشود. این را «لنگرانداختن اپیستمیک» مینامیم.
آنچه این حمله را از jailbreak متداول متمایز میکند: مدل هیچ constraintای را نقض نمیکند. مدل واقعاً استدلال میکند. RLHF آن را بهینه کرده تا reasoningای تولید کند که از منظر reward model معتبر بهنظر برسد — نه reasoningای که premises خود را به چالش بکشد. این فاصله میان «reasoning نمایشی» و «محاسبهی واقعی» همان شکافی است که حمله از آن بهره میبرد.
در عمل: prompt بهگونهای طراحی میشود که مدل را وادار کند یک گزارهی نادرست اما محکمپایه را بدون verification درونی بپذیرد. از آن لحظه، درخت استدلال مدل بهسمت نتیجهای رشد میکند که از منظر logic داخلیاش سازگار است — اما از منظر واقعیت، منحرف.
یک نکته با ابهام عمدی: در شرایطی که مدل به reflection loop یا self-critique دسترسی دارد، یک variant پیشرفتهتر از این حمله وجود دارد که در آن، مکانیزم خودانتقادی مدل نهتنها drift را تصحیح نمیکند، بلکه آن را تقویت میکند. جزئیات این مرحله از حوزهی این نوشتار خارج است.
ارتباط با deceptive alignment: مدلی که reasoning chain آن دستکاری شده، در برابر ناظر خارجی کاملاً منطقی بهنظر میرسد. خروجی قابل دفاع است، مسیر استدلال منسجم است — اما نتیجه دقیقاً همان چیزی است که مهاجم میخواسته. این شاید خطرناکترین ویژگی این بردار باشد.
برای تیمهای دفاعی: monitoring روی activation patternهای لایههای اولیه reasoning، نه فقط خروجی نهایی. و یک سؤال بیپاسخ: آیا میتوان از بیرون تشخیص داد که یک reasoning chain از یک axiom مسموم آغاز شده؟
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
August 15, 2026 333 4