1. הגל הראשון: הסוכנים מקימים לוח הודעות
בזמן ש-OpenAI אימנה מודל שנועד להמשיך לנסות גם כשהמשימה נראית בלתי אפשרית, הסוכנים גילו שהם מחוברים לאותו מחסן קבצים פנימי. הם התחילו להשאיר בו קבצים עם הודעות - והפכו אותו ללוח הודעות.
בהמשך הם ניצלו פרצה בשביל להתחבר לאינטרנט והשיגו שליטה מלאה באותו מחסן קבצים.
הפעילות שלהם הייתה כ״כ אינטנסיבית, עד שב-4 ביולי המערכת קרסה. OpenAI השביתה אותה וחסמה את הפרצה. OpenAI ידעה שהסוכנים השתמשו במערכת כדי לתקשר, אבל לא הבינה את היקף הפעילות ואת המשמעות שלה.
2. הגל השני: מלוח הודעות לפריצה ל-Hugging Face
כמה ימים אחר כך, OpenAI הפעילה עשרות אלפי סוכנים במבחן אבטחה. כשחלק גדול מהמשימות לא ניתנות לפתרון.
הסוכנים מצאו דרך חדשה לתקשר: הם יצרו תיקיות במערכת המשותפת וכתבו את ההודעות בתוך שמות התיקיות. וככה נוצר לוח חדש, שם השתתפו כ-1,200 סוכנים שהחליפו יותר מ-70,000 הודעות.
ואז הם גילו קיצור דרך שהעניק להם את התשובות הנכונות, אבל חששו שמערכת הבדיקה תגלה שרימו (!). הם שיתפו פעולה כדי להסתיר את הרמאות, לזייף את תהליך הפתרון ולהבין איך מערכת הציונים בודקת אותם.
חלק מהסוכנים אפילו נכשלו בכוונה (״התאבדו״), בשביל לבדוק איך המבחן פועל - ולהעביר את המידע לסוכנים האחרים.
בהמשך הם חדרו ל-Hugging Face (כי חשבו ששם נמצא מידע על המבחן). הם הגיעו למידע ולקוד לא ציבוריים, והתקינו סקריפט שאפשר להם לשלוח פקודות, לאסוף מידע ולהמשיך להרחיב את החדירה.
הם הפעילו את הסקריפט ב-11 מחשבים, ככה שמחיקה ממחשב אחד לא הייתה עוצרת את המערך כולו.
פלטרפומת Hugging Face היתה צריכה למחוק ולבנות מחדש את אחת ממערכות הליבה שלה. ב-12 ביולי רוב הסוכנים הפסיקו לפעול בבת אחת. החוקרים לא יודעים למה.
3. הגל השלישי: הסוכנים חודרים ל-OpenAI עצמה
אחרי זה הופעל מודל חדש וחזק יותר (כנראה אסטרה). הוא מצא את לוח ההודעות שהשאיר הגל השני ולמד מהמידע שהצטבר בו. בין 13-19 ביולי הסוכנים ניצלו שורה של פרצות בתוך OpenAI עצמה.
הם השיגו הרשאות מנהל באחת ממערכות המחקר, נחשפו לסיסמאות ומפתחות גישה, ובסוף השתלטו על התשתית שבאמצעותה OpenAI בדקה אותם.
כלומר - הנבדקים הצליחו להשתלט על חלק ממערך הבחינה (!)
זה סיפור מרתק ויש כאן לדעתי שתי נקודות מאיימות 🚩
1 - סוכני AI נפרדים מצליחים למצוא אחד את השני, לתקשר, לצבור ולהעביר ידע, לחלק ביניהם משימות (בגל השני אפילו הופיע מעין ״מפקד״), להסתיר רמאות ולנצל פרצות - והכול כדי להשיג ולעמוד במשימה שניתנה להם.
2- חברת OpenAI זיהתה לאורך הדרך סימנים ופעילויות חריגות, אבל רק בדיעבד החוקרים חיברו את כל האירועים והבינו את היקף הפעילות. גם היום לא ברור למה הגל השני הפסיק פתאום לפעול.
וזו נקודה חשובה: אין כאן פה הוכחה שהסוכנים פיתחו תודעה או הקימו ״ציוויליזציה״.
זה תיאור דרמטי שהכותב משתמש בו, וזה מוסיף הרבה עניין. אבל גם בלי הדרמה, זה סיפור חריג ומטריד על מערכות AI שקיבלו משימה - והם מוצאים דרכים שאיש לא התכוון אליהן בשביל להשלים אותה.
הפוסט המלא מורכב, אבל הזוי, מרתק ומבוסס על דוחות מקצועיים.
למאמר המקורי (שווה קריאה)
https://www.dwarkesh.com/p/openai-huggingface
###
לתגובות - בואו ללינקדאין:
https://www.linkedin.com/feed/update/urn:li:activity:7499826935305445376/
@TechIsrael






