בכיר ב-Microsoft: ״אימון AI הוא גזילת העבודה הגדולה בהיסטוריה״
מסמכי התביעה של הניו יורק טיימס נגד OpenAI ו-Microsoft נחשפים, ובהם הצהרות פנימיות של בכירים שמתארים את שיטות האיסוף של תוכן חדשותי כ״גזילה הגדולה בהיסטוריה״. הנתונים מראים ירידה של 93% בתעבורת הגולשים לאתר חדשות בעקבות שימוש ב-Copilot, וכן היקף של מאות אלפי יצירות ששולבו באימון.

תביעה של הניו יורק טיימס חושפת מסמכים פנימיים נפיצים ש-Microsoft ו-OpenAI ניסו להסתיר, ובהם בכירים מתארים את שיטות האיסוף של תוכן חדשותי לאימון מודלי AI כ״גניבה״ וכ״איום קיומי״ על המו״לות.
מה בעצם התגלה?
במסגרת התביעה המתמשכת של הניו יורק טיימס נגד OpenAI ו-Microsoft, נחשפו לאחרונה קטעים מתוך מסמכים פנימיים שהיו חסויים. המסמכים הללו, הכוללים תכתובות פנימיות ומצגות, חושפים שבכירי שתי החברות היו מודעים היטב לנזק שעלול להיגרם לעיתונים עקב השימוש בתוכן שלהם לאימון מודלי AI — והתריעו על כך.
אחת ההצהרות החריפות ביותר מגיעה מ-Brent Hecht, מנהל המדע היישומי ב-Microsoft, שכתב במסמך פנימי בינואר 2023 כי ״מדובר בגניבה מדהימה וחסרת תקדים״ וכי זו ״הגזילה הגדולה ביותר של עבודה בהיסטוריה האנושית״. Hecht גם סתר את טענת ה״שימוש ההוגן״ שעליה Microsoft ו-OpenAI מסתמכות, וטען שפעולת הגריפה הרחבה ״עושה צחוק״ מההגנה המשפטית הזו.
״לופ הרסני״ ו״איום קיומי״
המסמכים מתארים לא רק את הבעיה התיאורטית, אלא גם את ההשפעה העסקית המיידית. מצגת פנימית ב-Microsoft מראה שמנוע התשובות Copilot גרם לירידה של עד 93% בשיעור הלחיצות (click-through rates) לאתר הניו יורק טיימס, בהשוואה לחיפוש המסורתי ב-Bing. את התהליך הזה כינה מנהל אחר ב-Microsoft ״לופ הרסני״ (doom loop), שיפגע בביצועי המודלים שלהם ובאינטרנט כולו בו-זמנית.
״זה מאוד יוצא דופן שמוצר סופי מאיים על היסודות הכלכליים של הספקים החיוניים שלו, אבל זו הסיטואציה שיצרנו עבור עסקי ה-LLM שלנו ביחס ל׳שרשרת האספקה של התוכן׳ שלהם״, נכתב במסמך.
גם ב-OpenAI נשמעו קולות דומים. Nick Turley, ראש צוות ChatGPT, כתב בהודעה פנימית שמפרסמים ניצבים בפני ״איום קיומי״ מהמוצרים המסחריים שאומנו על התוכן שלהם. ״הם מחליפים במידה רבה״, כתב, ״ויהפכו למחליפים יותר ויותר ככל שישתפרו״. נשיא OpenAI, Greg Brockman, תיאר את המודלים כ״מעולים בחדשות״.
היקף החשיפה: מאות אלפי יצירות
הנתונים כמותיים וקשים לעיכול. המסמכים מגלים שסט הנתונים מאמצע תהליך האימון של OpenAI לבדו מכיל למעלה מ-91,692 עותקים של יצירות שפורסמו בידי הניו יורק טיימס, הדיילי ניוז ומרכז התחקיר. סט נתונים שהופק מ-Common Crawl הכיל יותר מ-2 מיליון מסמכים מ-nytimes.com לבדו.
עוד מתואר כיצד מהנדסי OpenAI ניסו לעקוף חומות תשלום (paywalls) בצורה שלא תתגלה, ואף הסירו במכוון הודעות זכויות יוצרים מנתוני האימון כדי למנוע מהמודל לייצר אותן עבור המשתמשים. דואר אלקטרוני פנימי שבו חוקר ב-OpenAI סיפר ל-Brockman על ״פריצה לעקיפת ה-paywall של הניו יורק טיימס״ נענה בתגובה: ״אה, מגניב״.
ההקשר המשפטי הרחב
התביעה הזו, שמתנהלת כבר שלוש שנים, נוגעת בשאלה משפטית מרכזית בעולם ה-AI: האם שימוש בחומר המוגן בזכויות יוצרים לאימון מודלים נחשב ל״שימוש הוגן״? עד כה, בתי משפט נטו לקבל את טענות חברות ה-AI, והממשל האמריקאי אף הגיש חוות דעת התומכת ב-OpenAI. אולם, ההצהרות הפנימיות החדשות סותרות עיקרון מרכזי ב״שימוש ההוגן״ — הדרישה שהשימוש לא יחליף את היצירה המקורית או יפגע בשוק שלה.
מנכ״ל Microsoft, Satya Nadella, העיד בשבועה ש״כל דבר שנמצא מאחורי paywall צריך לקבל רישיון ממי שרוצה להשתמש בו... לאימון או ל-Grounding״. הוא אף הודה בחקירתו ש״צ׳אטבוטים החליפו... את הצורך ללכת למקור״.
מ-Microsoft ומ-OpenAI לא נמסרו תגובות. התביעה הזו ממשיכה להיות מבחן חשוב להסדר הכלכלי בין חברות AI לבין יוצרי תוכן, ונראה שהמסמכים החדשים הללו רק מחמירים את מצבן של הנתבעות.