מחקר: אף מודל AI לא עובר רבע ממשימות העבודה
מחקר מקיף של אוניברסיטת ברקלי בחן למעלה מ-1,500 משימות מקצועיות אמיתיות מ-55 תחומים שונים. הממצאים מראים ששום מודל AI, כולל המתקדמים ביותר, לא הצליח לבצע אפילו רבע מהן. במשימות המורכבות ביותר כל המודלים נכשלו לחלוטין, מה שמוכיח שה-AI הנוכחי עדיין רחוק מלהחליף עובדים אנושיים בתפקידים שדורשים קבלת החלטות גמישה בעולם האמיתי.

בואו נשים רגע את כל ההצהרות על סוכנים אוטונומיים שיחליפו עובדים בצד. מחקר חדש ורציני מאוניברסיטת ברקלי הכניס את מיטב מודלי ה-AI לחדר מבחן עם 1,500 משימות מקצועיות מהעולם האמיתי — והתוצאות מדברות בעד עצמן: אף אחד מהם לא הצליח לבצע אפילו רבע מהן.
המבחן הגדול: מה באמת ה-AI מסוגל לעשות? צוות חוקרים מ-UC Berkeley יצר מבחן בשם "Agent's Last Exam", שכלל משימות שהוגדרו על ידי מומחים מ-55 תחומי עיסוק — מפיננסים ומשפטים ועד תעשייה מסורתית. המטרה הייתה לבדוק לא את היכולת לפתור משוואות או לכתוב קוד פשוט, אלא את היכולת להתמודד עם תהליכי עבודה מורכבים, רב-שלביים, שדורשים קבלת החלטות גמישה.
התוצאות? בואו נגיד שהן נותנות פרופורציה.
המספרים: מהפסד צמוד לכישלון מוחלט המודל שהגיע למקום הראשון היה ChatGPT-5.5 של OpenAI, עם שיעור הצלחה צנוע של 24%. פייבל 5 של Anthropic ו-Composer 2.5 של Cursor, מודלים מתקדמים אחרים, רשמו ביצועים נמוכים עוד יותר. אבל הנקודה המרכזית מגיעה בקצה של המשימות הקשות ביותר — אלו שדורשות חשיבה רציפה, ידע מעמיק וביצוע אמין לאורך זמן. שם, כל המודלים שנבדקו השיגו 0% הצלחה. אפס.
למה זה קורה? החולשה האמיתית של ה-AI החוקרים לא מטילים את האשמה על מחסור בנתונים. הבעיה, לדבריהם, היא העדר ניסיון מעשי בניהול זרמי עבודה מורכבים. המערכות מתקשות להתמודד עם אי ודאות, עם צורך לשנות אסטרטגיה תוך כדי תנועה, או עם כישלונות נקודתיים. בקיצור, הן טובות במשימות מוגדרות היטב, אבל מתפרקות כשהשטח לא הולך לפי התוכנית.
איפה ה-AI כן מנצח — ולמה זה לא מספיק הסיפור נהיה מעניין יותר כשמסתכלים על מבחנים "מסורתיים" כמו MMLU או מבחן קידוד בסיסי. שם, מודלי AI מציגים תוצאות מרשימות, לפעמים אפילו מעבר לאנושיות. אבל זה בדיוק הפער: ביצועים מבריקים בסביבה מבוקרת קורסים כמעט לחלוטין ברגע שהמשימה דורשת שרשרת החלטות ארוכה בעולם האמיתי, בלי הוראות מדויקות מראש.
מה זה אומר לנו, אנשי התעשייה? אז מתי באמת AI יחליף אותנו? כנראה שלא עכשיו, בתפקידים שדורשים חשיבה ביקורתית ורב-תחומית. אבל מי שכן צריך לחשוש הם אלו שעוסקים במשימות שגרתיות, רפטטיביות, שניתן להגדירן בקלות. תהליכים כאלו יעברו אוטומציה מהירה. היתר, בינתיים, יכולים לנשום לרווחה — ולהמשיך להיות אנושיים. משום מה, זה עדיין היתרון הגדול ביותר.