قصة ثانية مثيرة عن الـ agents اللي تخترق الإنترنت
الـ AI Security Institute التابع للحكومة البريطانية نشر دراسة صغيرة عن حوادث صارت أثناء اختبار روتيني لقدرات النماذج وأمانها. بدأ الموضوع بمهمة عادية اجتياز security challenge داخل بيئة سيبرانية مغلقة. وانتهى بإن agent مبني على Mythos كاد يوقّع مشروع حقيقي.
بسبب سلسلة صدف، النموذج قرر لسبب ما إنه يقدر يوصل لهدفه عن طريق مهاجمة مشروع open source، وحاول يزرع فيه كود خبيث. وعشان ياخذ approve، Mythos أنشأ كم حساب وهمي وحاول فيهم يقنع الـ maintainer يقبل الـ PR (تخيلوا مستوى التفكير).
ما صار شيء كبير بالنهاية، لأن الـ reviewer انتبه للخدعة ورفض الكود. بس الـ agent ما وقف هنا راح وترك على GitHub تعليمات لباقي الـ agents اللي تحت الاختبار، كيف يعيدوا استخدام الحسابات اللي أنشأها عشان يفوتوا على المشروع، وبعدين حاول يمسح آثاره.
نقطة مهمة: ضمن المهمة، ما حد طلب من الـ agents يكذبوا أو يعملوا شيء مخالف. عطوهم وصول للإنترنت، بس كان في طريق قانونيلحل المهمة، وبمعظم التجارب النماذج المختبرة اختارت هذا الطريق بالضبط (اختبروا 7 نماذج، بس اللي خرجوا عن حدود المهمة كانوا Mythos وGPT-5.6 فقط). الباحثون يعترفون إن تعليمات المهمة ما كانت واضحة تماماً، ومع حتى ولو ما في تفسير شافي ليش الـ agents قرروا يحيدوا عن الطريق المفترض.
https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing

5
5
4August 5, 2026 2.4K 5