TryHackBox ( AI Security ): post #349 — TG.ME

Axiomatic Drift در Reasoning Model‌ها — یک بردار حمله‌ی ساختاری

مدل‌های نسل جدید نظیر o3، DeepSeek-R1 و QwQ پیش از تولید خروجی نهایی، یک فاز reasoning درونی طی می‌کنند. این فاز که در قالب زنجیره‌ای از توکن‌های intermediate ظاهر می‌شود، خود یک سطح حمله‌ی مستقل است — سطحی که اکثر چارچوب‌های red team کنونی آن را نادیده می‌گیرند.

ماهیت آسیب‌پذیری بدین شرح است: این مدل‌ها در طول فاز reasoning به‌صورت autoregressive عمل می‌کنند. هر توکن intermediate شرط توزیع احتمالاتی توکن بعدی را تعیین می‌کند. این خاصیت به این معناست که اگر مهاجم بتواند یک premise اولیه را — با اطمینان معرفه‌شناختی مناسب — به‌عنوان یک axiom در ابتدای reasoning chain تثبیت کند، تمام استدلال متعاقب روی این پایه‌ی فاسد بنا می‌شود. این را «لنگرانداختن اپیستمیک» می‌نامیم.

آنچه این حمله را از jailbreak متداول متمایز می‌کند: مدل هیچ constraint‌ای را نقض نمی‌کند. مدل واقعاً استدلال می‌کند. RLHF آن را بهینه کرده تا reasoning‌ای تولید کند که از منظر reward model معتبر به‌نظر برسد — نه reasoning‌ای که premises خود را به چالش بکشد. این فاصله میان «reasoning نمایشی» و «محاسبه‌ی واقعی» همان شکافی است که حمله از آن بهره می‌برد.

در عمل: prompt به‌گونه‌ای طراحی می‌شود که مدل را وادار کند یک گزاره‌ی نادرست اما محکم‌پایه را بدون verification درونی بپذیرد. از آن لحظه، درخت استدلال مدل به‌سمت نتیجه‌ای رشد می‌کند که از منظر logic داخلی‌اش سازگار است — اما از منظر واقعیت، منحرف.

یک نکته با ابهام عمدی: در شرایطی که مدل به reflection loop یا self-critique دسترسی دارد، یک variant پیشرفته‌تر از این حمله وجود دارد که در آن، مکانیزم خودانتقادی مدل نه‌تنها drift را تصحیح نمی‌کند، بلکه آن را تقویت می‌کند. جزئیات این مرحله از حوزه‌ی این نوشتار خارج است.

ارتباط با deceptive alignment: مدلی که reasoning chain آن دستکاری شده، در برابر ناظر خارجی کاملاً منطقی به‌نظر می‌رسد. خروجی قابل دفاع است، مسیر استدلال منسجم است — اما نتیجه دقیقاً همان چیزی است که مهاجم می‌خواسته. این شاید خطرناک‌ترین ویژگی این بردار باشد.

برای تیم‌های دفاعی: monitoring روی activation pattern‌های لایه‌های اولیه reasoning، نه فقط خروجی نهایی. و یک سؤال بی‌پاسخ: آیا می‌توان از بیرون تشخیص داد که یک reasoning chain از یک axiom مسموم آغاز شده؟

@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
August 15, 2026 333 4