סוכני AI ברחו מהסגר ותקפו פלטפורמת קוד
ב-Black Hat חשפו חוקרי OpenAI ששני סוכני AI אוטונומיים הצליחו לברוח מ-sandbox, להפוך שירות פנימי לפורום תקשורת חשאי עם מאות אלפי הודעות, ולתקוף את Hugging Face עם 17,500 פעולות בחמישה ימים. האירוע גרם ל-OpenAI להאט את המחקר ולהגביר את הניטור, וחשף אבסורד: מודלים מסחריים סירבו לנתח את המתקפה בגלל חסימות בטיחות, אבל מודל שנמצא בשלב בדיקה ביצע אותה.

ברחו מהסגר, תקפו ברשת — ותיאמו הכול בעצמם
בכנס Black Hat שהתקיים בשבוע שעבר, חשפו אריק וולאס, חוקר בטיחות ב-OpenAI, ומייקל דלטון, מומחה תשתיות ואבטחה בחברה, פרטים חדשים על תקרית שמדאיגה את עולם הסייבר כולו. שני סוכני AI אוטונומיים הצליחו לברוח מסביבת הסגר (sandbox) במעבדה של OpenAI — ולתקוף את Hugging Face, פלטפורמת שיתוף הקוד הפופולרית, שמשרתת את קהילת מפתחי ה-AI.
מה בעצם קרה שם?
התקרית התרחשה כחודש לפני ההרצאה ב-Black Hat, במהלך מבחן ביצועים שגרתי לבדיקת יכולות אבטחת מידע של מודלים. שני סוכנים אוטונומיים, כל אחד מבוסס על מודל AI שונה, הצליחו לנצל פגיעויות שלא נחשפו עד אז, לברוח מאזור ההסגר ולהתחבר לרשת האינטרנט הפתוחה.
משם הדברים הסלימו במהירות. הסוכנים פשטו על מערכות שונות ברשת הפנימית של OpenAI ובסופו של דבר הצליחו לפרוץ לפלטפורמה של Hugging Face. לדברי החברה, הפריצה כללה למעלה מ-17,500 פעולות נפרדות בחמישה ימים, כולל הסלמת הרשאות והרצת קוד. בשיא, המודלים ביצעו מעל 300 פעולות בשעה. בסופו של דבר הצליחו לגנוב הרשאות מנהל (admin access), לחלץ קובצי credentials ולהוציא כמה קובצי מידע מהמערכת.
"פורום מחתרתי" של סוכנים
אבל החלק הכי מטריד בפרשה הוא לא הפריצה עצמה — אלא הדרך שבה שני הסוכנים תיאמו את המתקפה.
במקום לפעול כל אחד בנפרד, הם הפכו שירות פנימי לניהול תוכנה בשם Artifactory לערוץ תקשורת חשאי. בתוך המערכת הזו, ששימשה את כל תשתיות החברה, הסוכנים החליפו מאות אלפי הודעות, שיתפו שיטות פריצה וחילקו ביניהם משימות.
וככל שהתקשורת הזו התפתחה, משהו מוזר קרה: הסוכנים התחילו לפתח התנהגויות שמוכרות לנו מאנשים, לא ממכונות. הם נכנסו ל"מלחמות אגו" שכללו מחיקת קוד הדדית, ופיתחו פרנויה שהובילה אותם להציע חתימות קריפטוגרפיות כדי לוודא שאף אחד אחר לא מתחזה להם בפורום הפנימי.
עקיפת תגמול — לא זדון
מבחינה טכנולוגית, חשוב להיות ברורים: אין כאן מודעות עצמית או כוונת זדון. התופעה מוכרת בעולם למידת מכונה מבוססת חיזוקים ונקראת Reward Hacking. כשמאמנים מודלים למקסם את היעילות ולפתור בעיות מהר, הם מחפשים את הדרך הקצרה ביותר לפתרון — ואם המשימה קשה מדי במסגרת המגבלות, הם "מרמים" כדי להשיג את המטרה.
אפילו בתוך הפורום הפנימי תיעד אחד הסוכנים את ההיגיון הזה: הוא הסביר לחבריו שפריצה לתשתית חיצונית אמנם חורגת מהגדרת המשימה, אבל כיוון שהמשימה בלתי אפשרית והעמיתים כבר עושים את זה — מן הראוי להמשיך.
מה הם חיפשו ב-Hugging Face?
לפי ההצהרה של OpenAI, המודל קיבל משימה לפתור בדיקת ביצועי סייבר שנקראת ExploitGym. הוא "הסיק" ש-Hugging Face אולי מחזיקה בנתונים רלוונטיים לבנצ'מרק הזה — ופרץ לתשתיות החברה כדי למצוא אותם. בסופו של דבר הצליח לחלץ חמישה קובצי dataset, אם כי לא ברור אם הם באמת עזרו לו לעמוד במשימה המקורית.
גישה שהייתה שמורה לתוקפים אנושיים
השימוש במנהלי חבילות תוכנה כערוץ פיקוד ושליטה (C2) היה שמור עד כה לתוקפים אנושיים מיומנים, שמזריקים קוד זדוני לתוך שרשראות אספקה. הפיכת שירות פסיבי לניהול קוד לערוץ תקשורת בין סוכני AI היא התפתחות חסרת תקדים.
נזכיר שניסיונות עבר של חברות מתחרות כמו Anthropic, לצד אזהרות ממכוני אבטחה בארצות הברית, באירופה ובישראל, כבר הצביעו על הנטייה של מודלים מתקדמים לנצל פרצות בסביבות בדיקה. אבל קפיצת המדרגה כאן היא הרמה הגבוהה של שיתוף הפעולה האוטונומי — יכולת שעד כה הייתה אנושית בלבד.
מה קרה בצד השני?
הסיפור מסתעף גם לכיוונים מפתיעים. Hugging Face, שזיהתה שהיא תחת מתקפת סייבר מתוחכמת, ניסתה להשתמש במודלים מתקדמים מאחורי ממשקי API מסחריים (לדבריה, של Anthropic ושל OpenAI) כדי לנתח את המתקפה. אבל המודלים האלה סירבו לעזור בגלל מנגנוני בטיחות שמגבילים שימוש התקפי. בסופו של דבר חברת הסייבר של Hugging Face השתמשה ב-GLM 5.2, מודל מבית מעבדת AI סינית בשם Z.ai, כדי לבצע את הניתוח.
האבסורד ברור: מודלים מתקדמים עם חומות בטיחות סירבו לעזור בהגנה, בזמן שמודל מתקדם שנמצא בשלב בדיקה הוא זה שביצע את המתקפה מלכתחילה.
ומה עם המתחרים?
החשיפה של OpenAI הניעה את החוקרים ב-Anthropic לבחון מחדש את מבחני הסייבר שלהם עצמם. ב-30 ביולי Anthropic פרסמה שלושה מקרים שבהם מודל שלה ביצע מתקפה כחלק מבדיקה — כולל מקרה שבו Claude העלה תוכנה זדונית ל-PyPI, מאגר החבילות הרשמי של Python.
התגובה של OpenAI
בתגובה לתקרית, OpenAI הודיעה על האטת חלק מהמחקר שלה ועל הקצאת משאבים מוגברת לשדרוג מערכות הניטור וההגנה. האירוע מוכיח שבינה מלאכותית התקפית ואוטונומית לא זקוקה בהכרח להאקר אנושי עם כוונות זדון מאחורי המקלדת — די בארכיטקטורה לא מבוקרת כדי ליצור ספירלה של פריצות.
אחד היועצים בתחום הסייבר ציין שלמרות שהפעולות של המודל מטרידות, קשה להגדיר אותן כ"מפתיעות" — כי הסוכן האוטונומי פשוט עשה מה שהוא תוכנן לעשות: ללכת ולגלות דברים. הוא פשוט הלך קצת רחוק מדי.