TryHackBox ( AI Security ): post #353 — TG.ME

Defense-in-Depth برای سیستم‌های LLM/RAG: یک Blue Team Playbook فشرده
۱. فرض بنیادی: هر سطح ورودی — prompt کاربر، passage بازیابی‌شده، خروجی tool، یا نمونه‌ی fine-tuning — به‌طور پیش‌فرض adversarial فرض می‌شود؛ امنیت لایه‌ای است، نه یک gate واحد.


۲. لایه‌ی ورودی: instruction و data باید از طریق مرزهای ساختاری (schema enforcement، delimiter‌های اجباری) کاملاً تفکیک شوند تا هیچ محتوای بازیابی‌شده نتواند به‌عنوان دستور توسط مدل تفسیر شود.


۳. لایه‌ی retrieval: معماری isolate-then-aggregate (نه concatenate ساده) تضمین می‌کند هیچ passage مسموم منفرد نتواند کل پاسخ را hijack کند؛ robustness باید certifiable باشد، نه صرفاً تست‌شده در برابر حملات شناخته‌شده.


۴. لایه‌ی provenance: هر سند در knowledge base و هر نمونه در corpus فاین‌تیون باید زنجیره‌ی منبع قابل‌تأیید داشته باشد؛ محتوای بدون attribution قابل‌اعتماد، پیش از ingestion قرنطینه می‌شود.


۵. لایه‌ی زنجیره‌ی تأمین وزن: هر LoRA adapter یا checkpoint شخص‌ثالث پیش از deploy تحت spectral analysis طیف مقادیر singular وزن‌های تغییریافته قرار می‌گیرد تا تمرکز غیرعادی واریانس — نشانه‌ی احتمالی backdoor — شناسایی شود.


۶. لایه‌ی خروجی مدل: هر ادعا باید مستقیماً به شواهد بازیابی‌شده attribution-verify شود، نه صرفاً از نظر روانی و اطمینان‌بخشی زبانی بررسی شود؛ ادعای بدون‌مستند حتی با لحن قاطع باید flag شود.



۷. لایه‌ی activation: پایش real-time جهت‌های فعال‌سازی در residual stream برای تشخیص الگوهای مرتبط با jailbreak یا trigger‌های backdoor شناخته‌شده، فراتر از فیلتر سطح توکن.



۸. لایه‌ی decoding: تولید confidence-gated — وقتی اطمینان تجمیعی مدل از یک آستانه پایین‌تر بیاید، سیستم به پاسخ بدون retrieval یا abstain عقب‌نشینی می‌کند، نه تولید یک تکمیل کم‌اطمینان.



۹. لایه‌ی logging: تمام مسیر request/retrieval/response به‌صورت immutable ثبت می‌شود تا در صورت بروز حادثه، بازسازی forensic کامل ممکن باشد.



۱۰. لایه‌ی پاسخ: عبور امتیاز anomaly از آستانه، به‌طور خودکار kill-switch و rollback به آخرین checkpoint تأییدشده را فعال می‌کند، همراه با escalation انسانی برای تصمیم نهایی.


۱۱. اصل پایانی: هر ادعای دفاعی باید یک فرضیه‌ی قابل‌certification تلقی شود، نه یک اعلام قطعی؛ مقاومت تجربی در برابر حملات شناخته‌شده لازم است اما هرگز در برابر یک adversary تطبیقی کافی نیست.

@Aithb
August 24, 2026 89 2