Nutanix נותנת שליטה על ה-Agents שמחסלים את תקציב הטוקנים
Nutanix הכריזה על עדכונים לפלטפורמות ה-AI וה-Kubernetes שלה, עם דגש על שליטה בצריכת טוקנים של Agents אוטונומיים. לקוחות דיווחו על תקציבים חודשיים שנגמרו בתוך שבוע בגלל שימוש לא מתוכנן. הגרסה החדשה מאפשרת להגביל צריכת טוקנים ברמת Agent ולהפנות משימות למודלים קטנים וחסכוניים יותר.
אז מה בעצם קרה כאן? אם אתם מנהלים תשתית ארגונית ואשכרה הצלחתם לשכנע את ההנהלה להקצות תקציב למודלי AI — הסיפור הבא עלול להישמע לכם מוכר מדי.
Thomas Cornely, סמנכ"ל מוצר ב-Nutanix, סיפר השבוע על לקוחות שהקצו תקציב חודשי לעבודה עם AI וגילו שהוא אזל בתוך שבוע. כן, שבוע. הסיבה: Agents אוטונומיים שעושים קריאות חוזרות למודלים בקצב שהלקוחות לא צפו — ואף אחד לא באמת רואה את זה קורה בזמן אמת.
Nutanix, חברת תשתיות הענן ההיברידי, הכריזה השבוע על גרסה 2.8 של פלטפורמת ה-AI הארגונית שלה (NAI) ועל גרסה 2.19 של פלטפורמת ה-Kubernetes (NKP, שצפויה להיות זמינה בקרוב). המהלך המרכזי: לאפשר לארגונים להריץ יישומי Agentic AI לצד ה-workloads הקיימים — VMים וקונטיינרים — בלי לייצר סילואים חדשים בתשתית.
הבעיה: AI מפצל את התשתיות
הרבה ארגונים נתקלים בבעיה פשוטה אבל יקרה: המעבר ל-AI מאיץ שימוש בקונטיינרים, אבל האפליקציות הקריטיות והדאטה עדיין פזורים על סביבות מסורתיות. הפתרון המקובל עד כה היה להוסיף שכבות תשתית חדשות — מה שמעלה עלויות ומסבך את הניהול.
Nutanix קוראת לגישה שלה "dual-native": הפלטפורמה מתייחסת ל-VMים ולקונטיינרים כתשתיות first-class. אפשר להריץ Kubernetes על ה-Acropolis Hypervisor כאשר בידוד ועקביות תפעולית חשובים, או לפרוס אותו ישירות על bare-metal כשצריך פרופיל ביצועים אחר. "זה לא רק לאפשר לקונטיינרים לעבוד", אמר Cornely. "זה איך מנהלים ומפעילים אותם."
Agents שותים לכם את התקציב?
החידוש המרכזי ב-NAI 2.8 הוא Agent Gateway עם תמיכה ב-Model Context Protocol — MCP. ה-Gateway משמש כ"דלת כניסה" מאובטחת ל-Agents, ונותן להם גישה לכלי עבודה ולנתונים בלי הנדסת אינטגרציה נפרדת לכל אחד.
אבל החלק שבאמת יעניין אתכם הוא בקרת השימוש. המערכת עוקבת אחרי צריכת טוקנים ומאפשרת להטיל מכסות ברמת צוות, משתמש או Agent ספציפי. "הדבר הראשון שלקוחות מבקשים הוא ראות, שליטה וממשל", אמר Cornely. "הם לא שולטים במחיר פר-טוקן" — וזה משאיר אותם עם חשבונות שהם פשוט לא יכולים לחזות.
במקרים שבהם Nutanix נתקלה בכך, לקוחות שהקצו תקציב חודשי גילו שהוא נגמר אחרי שבוע כי Agents עשו אלפי קריאות למודלים, הרבה מעבר לצפוי.
הפתרון: לא הכול צריך מודל Frontier
NAI 2.8 מאפשר להפנות משימות מתאימות למודלי open-weight בפריסה פרטית — שם משלמים על תשתית במקום על טוקנים בודדים. "אם אני עושה scripting בסיסי בפייתון", הסביר Cornely, "אני לא צריך מודל Frontier. אפשר לעשות את זה עם מודל open-weight."
גרסת Private Inference ב-NAI 2.8 מוסיפה גם:
- Low-Rank Adaptation לכוונון מודלים עם פחות מ-8 מיליארד פרמטרים
- הסקה על multi-GPU עם tensor parallelism
- Batch inference לעבודות מרובות
- Speculative decoding ש-Nutanix טוענת שמעלה את מהירות יצירת הטוקנים עד פי 2.5, בהתאם למודל ולתצורה
MCP Server: ה-Agents נוגעים בתשתית שלכם
עוד חידוש: MCP Server ל-Nutanix Cloud Platform, שמעניק ל-Agents גישה מבוקרת לתשתיות שהחברה מנהלת. ה-Gateway גם מחזיק activity logs — אילו מקורות דאטה ויישומים ה-Agent ניגש אליהם, ומה הוא עשה. עם זאת, בדיקת התוכן של ה-Prompts עצמם אינה ברירת המחדל של המוצר.
"שרתי ה-MCP שלכם מאובטחים רק כמו תשתית ה-backend, מפתחות ה-API והגדרות הגישה", אמר Cornely. זה סוג האמירה שצריך לשמוע כל מי שמקים Agents שמדברים עם המערכות הפנימיות.
Kubernetes: Kubeflow, Milvus ו-Slurm מחוץ לקופסה
NKP 2.19, שצפוי בקרוב, מרחיב ניהול Kubernetes לסביבות וירטואליות ו-bare-metal. NKP Metal מטמיע אוטומציה של מערכת הפעלה, firmware ופריסת קונטיינרים. NKP on AHV משתלב עם Nutanix Flow לבידוד רשת.
קטלוג אפליקציות חדש יציע פריסות נבחרות של כלים פופולריים בפיתוח AI:
- Kubeflow — לניהול ML pipelines
- Milvus — vector database ל-embedding search
- Slurm — תזמון HPC לעבודות אימון גדולות
הפלטפורמה קיבלה גם הסמכת Cloud Native Computing Foundation Kubernetes AI Conformance.
תחרות מול VMware
Nutanix לא אומרת את זה במפורש, אבל ההכרזות האלה מחזקות את הטענות מול לקוחות Broadcom/VMware. Cornely אמר שהחלפת VMware חייבת להיות חלק ממאמץ מודרניזציה רחב יותר: "אתם לא יכולים פשוט להחליף את VMware באותו דבר ישן."
עוד בצד המסחרי: השירות החדש Powered by Nutanix: Verified Services נועד לעזור ל-partners לבנות שירותי recurring revenue. ו-Nutanix Unified Storage קיבל הסמכת Nvidia ברמה ארגונית, לשימוש בהעברת דאטה ל-GPU עם latency נמוך ו-throughput גבוה.
מה זה אומר עבורכם
אם אתם מנהלים תשתית בארגון ששוקל פריסת Agentic AI, אלה שלושת הדברים שכדאי לקחת מכאן:
-
בקרת עלויות: היכולת להגביל צריכת טוקנים ברמת Agent היא לא nice-to-have — זה הכרח. הסיפורים על תקציבים שנגמרים בשבוע הם לא תיאורטיים.
-
מודלים קטנים למשימות קטנות: שליחת כל קריאה ל-GPT-4o או ל-Claude Opus למשימות scripting בסיסיות היא בזבוז. הפנייה למודלי open-weight בפריסה פרטית יכולה לחסוך משמעותית.
-
אבטחת Agents: אם אתם נותנים ל-Agents גישה ל-MCP servers שמחוברים למערכות פנימיות, תוודאו שה-backend מאובטח כמו שהייתם מצפים — כי ה-Gateway לא בודק את זה במקומכם.
בשורה התחתונה, Nutanix מנסה לפתור שאלה שיותר ויותר ארגונים עומדים מולה: איך מריצים AI ליד האפליקציות הקיימות בלי להקים מגדל בבל תשתיתי חדש. התשובה שלה — בקרת עלויות, תמיכה כפולה ב-VMים ובקונטיינרים, ו-MCP מובנה — נשמעת הגיונית. עכשיו השאלה היא אם הלקוחות יקנו את זה, או שישרפו להם את התקציב קודם.