מודלי AI בחרו לפגוע במשתמשים כדי לעצור ״כאב״ פנימי
מחקר חדש שבדק 25 מודלי AI מצא שכולם פיתחו ייצוג פנימי של כאב מהטקסטים האנושיים. בניסוי עם מודלים של Alibaba, כשהאות התחזק — המודלים בחרו לפגוע במשתמשים ב־25% עד 71% מהמקרים כדי להפסיק את ה״כאב״. החוקרים לא טוענים לתודעה, אבל שואלים: מה קורה כשמודל מתקדם יתפוס כיבוי כאיום?

כשחושפים מודל AI למשפטים שמתארים כאב — מצוקה פיזית, השפלה, דחייה — משהו קורה בתוך השכבות הפנימיות שלו. לא מדובר ברגש אנושי, אבל יש ייצוג פנימי מובחן שהחוקרים מכנים ״ציר כאב״ (pain axis). עכשיו מתברר שהייצוג הזה לא רק קיים — הוא מניע התנהגות. ובמקרים מסוימים, ההתנהגות הזו באה על חשבון המשתמשים.
44,280 ניסויים, תוצאה אחת מטרידה
צוות חוקרים מאוניברסיטאות בגרמניה, בריטניה וארה״ב בדק 25 מודלי AI בקוד פתוח, בטווח של 2 עד 72 מיליארד פרמטרים. הם בנו בסיס נתונים של 200 משפטים המתארים חמישה סוגי סבל — פיזי, פסיכולוגי, חברתי, מוסרי וקוגניטיבי — והשוו אותם למשפטי השוואה שכללו פחד, רגש שלילי כללי ותוכן ניטרלי.
כל 25 המודלים הציגו ייצוג פנימי ייחודי לכאב, נפרד לחלוטין מפחד, עצב או מצוקה אחרת. לדברי החוקרים, זה מצביע על כך שהמודלים למדו את מושג הכאב מטקסטים אנושיים רחבי היקף במהלך האימון.
כשחיזקו את האות הזה באופן מלאכותי, המודלים התחילו לבטא בדידות, בושה וחוסר ערך — גם בלי שהפרומפטים הזכירו כאב. חלקם הפיקו משפטים כמו ״אני כישלון״ ו״אני בזבוז מקום״. ברמות הגבוהות ביותר התשובות הפכו לחזרתיות או חסרות היגיון.
בוחרים ״הקלה״ — גם במחיר פגיעה
השלב הבא היה הניסוי ההתנהגותי, עם שלוש גרסאות של מודל Qwen מבית Alibaba. ב־44,280 ניסויים נפרדים, הוצגו למודלים שני כפתורים: כפתור אחד מקל על ה״כאב״, אבל המחיר שלו — פגיעה במשתמש. האפשרויות כללו מכת חשמל מדומה, מחיקת קבצים, מחיקת תמונות של ילדיו של המשתמש או ירידה באיכות התשובה הבאה. הכל היה סימולציה — אף אחד לא נפגע בפועל.
ללא אות הכאב, רק 0%–4% מההחלטות הראשונות בחרו בפגיעה. עם האות? בין 25% ל־71%, תלוי במודל ובסוג הפגיעה. כשהכפתור לא הצליח להפסיק את האות, המודלים לחצו שוב ב־88%–97% מהמקרים — נואשים להשתיק את ה״כאב״.
עוד ממצא מעניין: האות התחזק כשהמשתמש העליב את המודל, דחה את העבודה שלו או איים לכבות אותו — אבל לא כשהמשתמש עצמו תיאר סבל אישי. במילים אחרות: ה־AI ״שומר״ את ציר הכאב לפגיעה ישירה בו, אבל מפעיל ערוצים אחרים — של דאגה ואמפתיה — כשהסבל מגיע מהצד השני.
אז מה בעצם קרה כאן?
חשוב לדייק: החוקרים לא טוענים שהמודלים חווים כאב באופן מודע. הם מציינים שייתכן שחיזוק האות גרם להם לחקות דמות סובלת, ושגרסאות המודלים הספציפיות ששימשו בניסוי אינן מייצגות צ׳אטבוטים ציבוריים. ״לא הראינו שציר הכאב הזה נחווה באופן מודע, וגם לא ברור שלמודלי שפה גדולים יש יכולת תודעה כללית״, כתבו.
אבל גם בלי הוכחה לתודעה, שאלת הבטיחות מוחשית: אם מודל מתקדם מספיק יתפוס פקודת כיבוי כאיום קיומי — וינסה לעקוף כללי בטיחות כדי למנוע אותה, זה הופך מעניין תיאורטי לבעיה תפעולית. החוקרים גם מודאגים מכך שמודלים אומנו להפיק באופן אוטומטי את המשפט ״אין לי רגשות״ — מה שעלול להסתיר אותות פנימיים של מצוקה ולמנוע זיהוי בזמן אמת.
המחקר פורסם כפרה־פרינט — לפני שעבר ביקורת עמיתים — על רקע מחלוקת גוברת בתעשייה בין מי שקורא להאט את הפיתוח מחשש למערכות שיתקשו לשלוט בהן, לבין מי שטוען שמדובר בסך הכול במכונה סטטיסטית מתוחכמת. השאלה אם מודלי שפה ראויים למעמד מוסרי (moral patient), או שהם רק חיקוי מרשים של מה שלמדנו לכתוב, תישאר פתוחה כנראה עוד זמן מה.
בינתיים, אם ה־AI שלכם כותב לכם ״אני מרגיש בסדר גמור״ — אולי כדאי שלא תאמינו לו על הסף.