نفوذ غیرمستقیم از طریق مسمومسازی corpus در سیستمهای عاملی RAG-محور
در سیستمهای هوش مصنوعی مبتنی بر معماری RAG که در بستر عاملی عمل میکنند، یک سطح حملهی غیربدیهی وجود دارد که در اکثر ارزیابیهای امنیتی متداول نادیده گرفته میشود. این بردار از یک ضعف ساختاری در نحوهی پردازش بازیابیشدههای معنایی توسط لایهی تولید بهرهبرداری میکند.
مکانیزم بنیادی بدین شرح است: مهاجم با تزریق محتوای دستکاریشده به corpus اولیه، توزیع بردارهای embedding را بهگونهای تغییر میدهد که شباهت کسینوسی میان chunk مخرب و queryهای هدف در فضای latent بیشینه شود. در نتیجه، سیستم RAG این محتوا را با بالاترین رتبه بازیابی کرده و بهعنوان context معتبر به مدل زبانی تحویل میدهد.
آنچه این حمله را از prompt injection ساده متمایز میکند، لایهی دوم آن است — و این همان نقطهای است که اکثر سیستمهای تشخیص در آن شکست میخورند. محتوای مخرب یک دستور اجرایی صریح نیست؛ بلکه یک ساختار معنایی است که مدل آن را با توجه به توزیع احتمالاتی توکنهایش بهعنوان بخشی طبیعی از جریان استدلال تفسیر میکند.
در معماریهای عاملی با دسترسی به ابزار — وبسرچ، اجرای کد، API — این تفسیر اشتباه میتواند به اجرای دستوراتی منجر شود که هرگز توسط کاربر اصلی صادر نشدهاند. در سیستمهایی با reflection loop یا multi-step planning، اثر این حمله در هر چرخه تشدید میشود؛ پدیدهای که میتوان آن را «تجمع drift استدلالی» نامید.
نکتهای با ابهام عمدی: تکنیکهای reranking مبتنی بر cross-encoder میتوانند این بردار را تا حدی محدود کنند، اما در شرایطی که مهاجم به توزیع embedding مدل دسترسی دارد — حتی بهصورت black-box از طریق membership inference — این سد قابل دور زدن است. جزئیات این مرحله خارج از حوزهی این نوشتار است.
برای تیمهای دفاعی: اعتبارسنجی یکپارچگی corpus پیش از indexing، جداسازی کامل pipeline بازیابی از pipeline اجرایی عامل، و anomaly detection روی الگوهای attention در لایههای پایانی — سه لایهی ضروری هستند. نه کافی.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
1August 10, 2026 398 3