פרויקטי AI נתקעים בגלל המטא-דטה
פרויקטי AI נתקעים לא בגלל חולשות של מודלים, אלא בגלל שכבת מטא-דטה חסרה. באנצ'מרק של Spider 2.0, שינוי המעטפת סביב אותו מודל שיפר ביצועים ב-23 נקודות. כעת חברות נאלצות לתעד את הידע שעד כה ישב רק אצל עובדים.

אתם מכירים את זה — משקיעים מיליונים בסוכני AI, מטמיעים מודלים מתקדמים, ובסוף הפרויקט נתקע בין ה-Demo לפרודקשן. אחרי שנתיים של תלאות, המסקנה מתחילה לחלחל: הפער אינו ביכולת של המודלים, אלא בכל מה שסביבם. בין אם מדובר במטא-דטה לא מסודר ובין אם בהגדרות עסקיות לא עקביות, הבעיה היא ארכיטקטורת הנתונים שלכם, לא כוח עיבוד נוסף.
מה באמת מראה הנתונים?
ניקח את Spider 2.0, אחד הבנצ'מרקים הרציניים בתחום. הוא בוחן מודלים בסביבות אמיתיות של טקסט-ל-SQL, הכוללות מאות אלפי עמודות ונתונים מ-Google Analytics ומ-Salesforce. מה שמעניין הוא לא הציון הכולל, אלא ההפרשים: עם אותו מודל (Claude Sonnet 4.5), שינוי ב-harness — המעטפת הסמנטית סביב המודל — יכול לשנות את הציון מ-67 ל-90 נקודות. זה פער של 23 נקודות, שנובע אך ורק מדרך הטיפול בנתונים.
המשמעות ברורה: אם יש לכם מודל חזק אבל הנתונים שלכם מבוססים על קונבנציות שמוטמעות בראשיהם של עובדים, ולא בקונפיגורציה מסודרת, הסוכן שלכם ייכשל. הוא מגיע בלי דפוסי הגישה שאתם רגילים אליהם, מנסה לבצע joins אקראיים, ולא יודע שהשדה status = 4 בעצם אומר שההזמנה נשלחה, או שהשדה EMEA Region שבור מאז 2019.
הדוגמה המוחשית: ״לקוח פעיל״
סמנכ״ל טכנולוגיה בחברת MedTech גדולה תיאר לאחרונה כיצד המונח ״לקוח פעיל״ הוגדר בשלושה אופנים שונים בתוך אותה חברה: אחד ספר את כל מי שהיה לו חשבון פתוח ב-90 הימים האחרונים, השני ספר את כל מי שביצע טרנזקציה, והשלישי ספר רק לקוחות שלא עזבו רשמית. כל ההגדרות האלה היו מדויקות מבחינה טכנית, הנתונים היו נקיים ותקינים, אבל הן לא תאמו זו את זו. כשה-AI מנסה לענות על שאלות עסקיות עם בלבול כזה, התוצאות יהיו לא אמינות.
הבעיה היא לא באיכות הנתונים, אלא בשכבת הסמנטיקה — שכבת התיווך שאמורה לתרגם מונחים טכניים לתנאים עסקיים. כרגע, ברוב החברות, הידע הזה מפוזר בתוך ה-BI tools, ב-dbt models או אצל אנשים ספציפיים. ה-AI לא יכול לגשת אליו מעצמו.
העלות האמיתית: לכתוב דברים שמעולם לא נכתבו
כשחושבים על יישום שכבת סמנטיקה מסודרת, העלות הגדולה היא לא בפיתוח. היא בכתיבה — באופן פורמלי ולראשונה — של מה העסק מתכוון במונחים כמו ״הכנסה״ או ״לקוח פעיל״. הידע הזה מעולם לא נכתב כי הוא לא היה צריך להיכתב; הוא חי בראשיהם של האנליסטים ומנהלי הדאטה. הפיכת הידע הזה ל-Queryable Definition היא תהליך יקר, אבל הוא הקריטי.
ב-2021, במערכת להנפקת התחזיות הפיננסיות עם מודל שפה, הבינו שהפתרון הוא לא למנוע hallucination, אלא למנוע מהמודל להוציא מספרים ישירות. בנו ארכיטקטורה שבה מודל ה-AI תיאר תרחישים באמצעות תוויות, ומנוע חוקים דטרמיניסטי ביצע את החישובים. הפרויקט הגיע ל-300,000 עסקים. החלק היקר לא היה עבודת המודלים, אלא הגדרת כל האילוצים כנתונים — שכבת סמנטיקה אמיתית עם שיניים.
למה זה תקוע עכשיו?
הדוח של Deloitte מ-2026 מראה ש-42% מהארגונים מרגישים ״מוכנים מאוד״ בנוגע לאסטרטגיית ה-AI שלהם, אבל רק לאחד מתוך חמישה יש ממשל בוגר לסוכנים אוטונומיים. הפער הזה לא ייסגר רק עם מודלים חזקים יותר. ה-scaffolding סביב המודל — איך הוא מפרש נתונים ואיך הוא מנווט במטריצות של 4,000 עמודות — הוא המפתח.
כפי ש-HPCwire מציין, הבעיות שעלו בניתוח הכישלונות של Spider 2.0 היו חקירת סכמות, הבדלי דיאלקטים ותכנון שאילתות מקוננות — כולן מאפיינים של המטא-דטה, לא של המודל. הבנצ'מרקים האחרונים מראים שה-harness, ולא המודל, הוא הכוח המניע מאחורי השיפורים.
מה אפשר לעשות?
הצעד הראשון הוא להפסיק לרדוף אחרי מודלים גדולים יותר. במקום זאת, יש להתמקד ב:
- יצירת שכבת סמנטיקה מרכזית שמתרגמת מונחים עסקיים לשאילתות מדויקות.
- תיעוד מפורש של כללים עסקיים ושל ה-context שטמונים כיום בראשיהם של אנשים.
- בחירת task-specific models קטנים יותר, כפי ש-Gartner חוזה שעד 2027 יהיו נפוצים פי שלושה בהשוואה ל-LLMs כלליים.
הסיכוי לשפר ביצועים קיים: עם אותו מודל בדיוק, עיבוד טוב יותר של המטא-דטה יכול להניב שיפור של עד 20 נקודות בבנצ'מרק. זה פער משמעותי שיכול להבדיל בין פרויקט תקוע לפרויקט מוצלח.
בסופו של דבר, האתגר הוא לא טכנולוגי גרידא — הוא ארגוני. הופכים ידע אנושי למשהו שהמכונה צריכה ללמוד פעם אחת. וזה, במקרים רבים, החלק הקשה ביותר.