Gartner: עלויות ה-AI יזנקו ביותר מפי חמישה עד 2028
מחקר של Gartner צופה שעלויות ה-inference של תהליכי AI אג'נטיים יגדלו ביותר מפי חמישה עד 2028, למרות ירידת מחירי הטוקנים. הסיבה: מערכות AI מורכבות יותר צורכות הרבה יותר טוקנים, וחברות כבר חורגות מתקציבים. זה נקרא ״פרדוקס ה-inference״ — החדשנות מתקדמת מהר יותר מההוזלות.

מחירי הטוקנים של מודלי AI צונחים, אבל החשבון שלכם לא קטן — הוא גדל. זה הפרדוקס ש-Gartner קוראת לו ״פרדוקס ה-inference״, והוא הולך להכות בארגונים בשנים הקרובות.
מה Gartner חוזה?
על פי דוח חדש של Gartner, עלויות ה-inference של תהליכי AI אג'נטיים (agentic) יגדלו ביותר מפי חמישה עד 2028. זאת בזמן שמחירי הטוקנים צפויים לרדת ב-95% עד 2030. במילים אחרות, המחיר ליחידת מידע יורד, אבל הצריכה הכוללת מזנקת.
למה זה קורה? הכירו את ״אשליית ההוזלה״
הסיבה לכך היא שהחדשנות בתחום ה-AI מתקדמת מהר יותר מקצב הירידה במחירי הטוקנים. Gartner קוראת לזה ״אשליית ההוזלה״: חברות מניחות בטעות שכאשר ספקי AI מייעלים את כלכלת הטוקנים, החיסכון יתבטא בעלויות שלהן בפועל. אבל, כדברי האנליסטים Will Sommer ו-Sabine Zimmerhansl, ״הם לא״.
מה שמשתנה הוא לא המחיר ליחידת מידע, אלא המורכבות של מערכות ה-AI עצמן. מוצרים מתקדמים יותר, כמו AI agent שיכול לבצע משימות מורכבות, דורשים הרבה יותר טוקנים מצ'אטבוט פשוט.
שלוש מגמות מרכזיות:
- מודלים בסיסיים נעשים זולים יותר — העלות של מודלי AI יורדת.
- יעילות מובילה לכוח — היעילות הזו מאפשרת פריסת מודלים חזקים (ויקרים) יותר ליישומים עתירי ערך.
- מורכבות עולה — תהליכי AI מתוחכמים צורכים פי כמה וכמה יותר טוקנים.
חשבון הנפש של עולם ה-Enterprise
התוצאה היא שמנהלי מוצר עומדים בפני אתגר חדש: מחירי המודלים יורדים, אבל העלות הכוללת של ה-AI עולה. דוגמאות מהשטח כבר מראות את המגמה:
- Uber: ה-CTO שלהם, Praveen Neppalli Naga, הודה שהתקציב שהוקצה ל-Claude Code ״כבר נשפך״.
- Box: המנכ״ל Aaron Levie הזהיר שכאשר AI agents נכנסים לתחומי המשפט, המכירות ועבודת ידע אחרת, ״תקציבי המחשוב רק ילכו ויעלו עם הזמן״.
- Ramp: נתונים פנימיים מראים שההוצאות על טוקנים בארגונים גדלו פי 13 בין ינואר 2025 לתחילת 2026.
פרדוקס ג'בונס: למה הוזלות מובילות לגידול בצריכה?
התופעה הזו מזכירה את פרדוקס ג'בונס מהמאה ה-19: כאשר מנועי קיטור הפכו ליעילים יותר, צריכת הפחם לא ירדה — היא התפוצצה, כי היעילות פתחה שימושים חדשים לחלוטין. כשמחירו של משאב יורד, אנשים לא צורכים פחות ממנו — הם מוצאים עשרה שימושים חדשים.
ב-AI, זה מתבטא בכך שצוותים שהריצו פעם מודל אחד בייצור מריצים עכשיו חמישה. צינורות RAG (אחזור-יצירה) ששלחו פעם 50 טוקנים שולחים עכשיו 4,000. מפתחים ג'וניורים מריצים מודלים בחופשיות, בצורה שהייתה יקרה מדי לפני שנה.
מניעים תקציביים נסתרים
המחיר הנקוב לטוקן הוא רק חלק מהסיפור. ההרגלים התקציביים האמיתיים הם מבניים:
- א-סימטריה בעלויות: קלט לעומת פלט. מודל קורא את כל הקלט במעבר חישוב אחד, אבל מייצר פלט טוקן-טוקן, עם חישוב מלא בכל פעם. טוקן פלט עולה משמעותית יותר.
- צינורות RAG: שאלה של 50 טוקנים הופכת לקריאה של 4,000 טוקנים כשמוסיפים הקשר, היסטוריה והנחיות מערכת. זו תקורה של פי 80.
- מודלי חשיבה: מודלים כמו GPT-5.4 Thinking מייצרים ״טוקני חשיבה״ פנימיים לפני שהם מגיבים. אלה נספרים בחשבון שלכם, גם אם אתם לא רואים אותם.
- tokenmaxxing: מגמה שבה צוותים מתייחסים לטוקנים זולים כאילו הם בחינם. הנחיות תפוחות, שיחות ארוכות ו-agents מסתחררים בלופים.
מה באמת על הכף?
לדברי Gartner, ברירת מחדל של ״אינטליגנציה אוטונומית גנרית״ תוביל לעלויות בלתי מוגבלות, בסדרי גודל גבוהים בהרבה מאשר מערכות מוצרים מותאמות.
המסר למנהלי מוצר: ניהול עלויות inference הפך לעדיפות עליונה. זה דורש בניית אקוסיסטם מורכב של מודלים, ניתוב חכם של משימות ואופטימיזציה מתמדת.
אז בפעם הבאה שאתם מתכננים תקציב AI — זכרו שהמחיר לטוקן הוא רק ההתחלה. השאלה האמיתית היא כמה טוקנים העבודה שלכם באמת שורפת.