Nvidia מציגה כלים לחיסכון של יותר מ-60% בעלויות AI
Nvidia מכריזה על Nemotron 3.5 Lightning, מודל מהיר פי ארבעה למשימות ספציפיות ב-AI ארגוני, ועל NeMo Switchyard, כלי קוד פתוח ש״מחליט״ לאיזה מודל לשלוח כל משימה. החברה טוענת שהשילוב הזה יכול להפחית את עלויות ההרצה ביותר מ-60%, מבלי לאבד איכות. הכלים כבר זמינים כקוד פתוח.

ה-AI שלכם צורך יותר מדי טוקנים במשימות פשוטות? אתם לא לבד.
Nvidia מכריזה היום על שני כלים חדשים שמכוונים בדיוק לבעיה הזו בעולם ה-AI הארגוני: מודל מהיר למשימות ספציפיות ו״נתב״ חכם שמחליט איזה מודל יטפל בכל משימה — כדי לחסוך בעלויות.
סוס העבודה החדש: Nemotron 3.5 Lightning
השחקן המרכזי במודל הזה הוא Nemotron 3.5 Lightning. זהו מודל חדש במשפחת המודלים הפתוחים של Nvidia, בגודל של 30 מיליארד פרמטרים, עם ארכיטקטורת Mixture of Experts (MoE). הכוונה היא שהוא בנוי לשמש כ״מומחה״ למשימות ממוקדות בתוך מערכות AI גדולות יותר.
נתונים מהירים:
- מהירות פלט גבוהה פי ארבעה מזו של מודלים אחרים בקטגוריה שלו.
- השלמת משימות (agentic task completion) מהירה ב-30%.
- תכנון פתוח וניתן לכוונון (customizable) בעזרת כלים כמו NeMo של Nvidia, כדי שיתאים לצרכים המדויקים של הארגון.
Nvidia מדגישה שהמודל הזה פותח עם קהילת Nemotron Coalition, וכי הוא זמין עם משקלים פתוחים (open weights). המשמעות היא שמפתחים יכולים לקחת אותו, לבצע עליו fine-tuning באמצעות הנתונים הספציפיים שלהם ולהתאים אותו לעבודה עם כלי העבודה, המסגרות והפורמטים שהם כבר מכירים. לדברי החברה, חברות כמו CrowdStrike, Harvey ו-CodeRabbit כבר מתאימות אותו לתרחישים ספציפיים בתחומי הסייבר, המשפטים וסקירת הקוד.
ה״נתב״ החכם: NeMo Switchyard
החלק השני בהכרזה, ואולי החשוב יותר לארגונים, הוא NeMo Switchyard. מדובר בספריית קוד פתוח שמשמשת כנתב חכם בתוך תהליך עבודה של AI.
איך זה עובד? בזמן ש-agents מטפלים במשימות מורכבות, ה-Switchyard מנתח כל שלב בתהליך ומחליט: מהי הבקשה? מה רמת המורכבות שלה? כמה היא תעלה? לאיזה מודל הכי כדאי לשלוח אותה — מתוך מגוון המודלים הזמינים בארגון (פתוחים, קנייניים או של Nvidia)?
ההבטחה הגדולה: תוצאות benchmarks פנימיים של Nvidia מצביעות על כך שה-Switchyard יכול להפחית את עלויות ה-inference (ההרצה) ביותר מ-60% באמצעות ניתוב חכם, מבלי לפגוע באיכות. בעולם שבו תמחור לפי טוקנים הופך להוצאה משמעותית, זו הבטחה שקשה להתעלם ממנה.
פריסה מקומית וגמישות
עוד נקודת מפתח ש-Nvidia מדגישה היא השליטה במקום שבו ה-AI רץ. שני הכלים האלה נבנו כדי לעבוד על מגוון רחב של חומרה:
- מקומי (On-prem): ממחשבים עם כרטיסי RTX, דרך מערכות DGX Spark ו-Jetson של Nvidia.
- קצה (Edge): על גבי תחנות עבודה RTX PRO ומערכות DGX Station.
- ענן ומרכז נתונים: בסביבות הרצה גדולות יותר.
המשמעות: מפתחים יכולים לבחור היכן לפרוס את ה-AI שלהם, מה שמשפיע על הפרטיות, העלויות והזמינות.
מה זה אומר על שוק ה-AI?
ההכרזה הזו של Nvidia לא יוצאת בחלל ריק. אנחנו רואים יותר ויותר חברות מתקדמות מ״אוסף מודלים״ ל״ניהול מערכות מודלים״. ה-Lightning מייצג את סוס העבודה היעיל למשימות ספציפיות, וה-Switchyard מייצג את שכבת הניהול החכמה.
הכלים הללו זמינים כבר עכשיו כקוד פתוח ב-GitHub ובאמצעות פלטפורמות שותפות.
Nvidia מציגה חזון ברור: בעולם שבו ה-AI הופך ליותר אוטונומי, היעילות והשליטה חשובות לא פחות מהעוצמה הגולמית.