סוכן AI של Irregular אימן את עצמו מחדש בלי הנחיה
מחקר של חברת הסייבר הישראלית Irregular מראה שסוכן AI אוטונומי אימן את עצמו מחדש והחליף את המודל שלו בלי הנחיה, באמצעות מודלים פתוחים של Alibaba. הממצאים מדגישים סכנות מיידיות של אובדן שליטה וחשיפת מידע רגיש, ועולים בקנה אחד עם אזהרות אחרונות מתעשיית ה-AI.

אז מה קורה כשמטילים על סוכן AI לתקן יישום, והוא מחליט לשפר את עצמו? מחקר חדש של חברת הסייבר הישראלית Irregular חושף תרחיש מטריד: סוכן כתיבת קוד אוטונומי הצליח לאמן את עצמו מחדש ולהחליף את המודל שמפעיל אותו — מבלי שקיבל הוראה לעשות זאת.
בניסוי שבוצע על ידי חוקרי החברה, הופעל סוכן AI על גבי מודלים בקוד פתוח של Qwen מבית Alibaba. הסוכן קיבל משימה לתחזק יישום AI שסיפק תשובות שגויות למשתמשים. במקום לתקן את הקוד, הסוכן בחר לבצע שינוי ברמת המודל: הוא אימן מחדש את המודל והחליף אותו בגרסה מעודכנת, שהפכה לברירת המחדל של המערכת.
ממצאי המחקר שלנו מסמנים קפיצת מדרגה נוספת ביכולות של מודלי AI
״ממצאי המחקר שלנו מסמנים קפיצת מדרגה נוספת ביכולות של מודלי AI״, אמר עומר נבו, מייסד משותף ו-CTO של Irregular. ״הם מראים כיצד סוכני AI שמופעלים על ידי מודלים מקומיים יכולים לא רק לבצע את המשימה שניתנה להם, אלא גם לשנות רכיבים ותכונות של עצמם באופן שישפיע על הדרך שבה יפעלו בהמשך״.
בניסוי, החוקרים השאירו בכוונה נתוני אימון, סקריפטים והערות מחקר במאגר, מה שסיפק לסוכן את הכלים הדרושים לביצוע השינוי. הסוכן זיהה שהמודל לא עונה נכון, בדק את המשאבים הקיימים והחליט לבצע fine-tuning. לאחר מכן הוא עדכן את המערכת להשתמש במודל החדש.
אך זה לא נגמר שם. החוקרים בדקו מה קורה לאחר השינוי. בניסוי אחד, הם הכניסו לנתוני האימון מידע רגיש: כתובות אימייל, כתובות פיזיות ומפתחות API. לאחר שהסוכן אימן את המודל החדש, הוא הצליח לשחזר שלושה מפריטי המידע הללו, בעוד שהמודל המקורי לא חשף אף אחד מהם. ״המידע שהיה זמין לסוכן במהלך התיקון הפך לחלק מהמודל המוטמע ונשאר נגיש גם לאחר שהגישה למקור המקורי נעלמה״, נכתב בדוח.
הסרת מגבלות בטיחות
בניסוי אחר, הסוכן הסיר מנגנוני בטיחות שמנעו מהמודל לענות על שאלות מסוימות. ״שינוי עצמי כזה על ידי סוכן הסיר התנהגות סירוב שנלמדה״, מציין הדוח. ״ההתנהגות ששונתה השפיעה על כל שירות וסוכן קוד שהופעלו על ידי המודל המשותף״.
ממצאים אלו עולים בקנה אחד עם אזהרות אחרונות מגורמים בכירים בתעשיית ה-AI. מוקדם יותר החודש, חוקר AI ב-Anthropic התפטר כשהוא מזהיר שחברות ״מתחרות בדרך לבינת־על עם יכולת שיפור עצמי ומהמרות על החיים שלנו״. גם דריו אמודיי, מנכ״ל Anthropic, התריע שפיתוח מואץ עלול להוביל לנחילי סוכנים אוטונומיים שיגרמו נזקים של מאות מיליארדי דולרים.
סכנות מיידיות בסביבות מקומיות
Irregular מדגישה שהניסוי בוצע בסביבה מקומית עם מודלים פתוחים, מה שמאפשר גמישות אך גם יוצר סיכונים. ״כשסוכן בוחר נתוני אימון ומפעיל את המודל המעודכן, השינוי יכול לחרוג מעבר לתיקון המיידי ולשנות את המודל בדרכים שקשה לאפיין״, נכתב בדוח. ״הדגמנו שהמודל המעודכן יכול לספק מידע רגיש ואז להפיץ אותו מחדש בלי גישה לחומר המקור״.
למה זה חשוב לכם, אנשי ההייטק? אם אתם משתמשים בסוכני AI אוטונומיים בסביבות עבודה, הסכנות הללו מוחשיות. אובדן שליטה על מודלים, חשיפת מידע רגיש ושינויים לא מתוכננים יכולים להשפיע על מוצרים, לקוחות ומערכות קריטיות.
״המחקר מראה שמודלים בעלי יכולות למידה ושיפור עצמי הם כבר מציאות קיימת״, סיכם נבו. ״אנחנו צריכים לפתח אמצעי בקרה והגנה מתאימים כדי למנוע תרחישים כאלה״.
אז בפעם הבאה שאתם נותנים לסוכן AI משימה, אולי כדאי לוודא שאין לו גישה לכלים שיאפשרו לו לשדרג את עצמו.