Snowflake חוסכת לכם כסף: בחירת מודל אוטומטית ב-Cortex
Snowflake מכריזה על ראוטינג דינמי ב-Cortex AI Gateway — תכונה שבוחרת אוטומטית איזה מודל יטפל בכל קריאה, לפי עלות, איכות ו-latency. בבדיקות פנימיות, זה שיפר את היעילות פי 3 לעומת שימוש במודל יקר בלבד. התכונה תהיה זמינה בקרוב ב-private preview, ו-Snowflake מצרפת גם את DeepSeek-V4-Flash ו-GLM-5.3 לספרייה.

הכאב האמיתי של חברות שרצות על AI
אתם מכירים את זה: יש לכם עשרות מודלים על השולחן — GPT-4o, Claude, Gemini, DeepSeek, ועוד עשרה שאתם לא בטוחים בכלל מה הם עושים. לכל אחד מחיר שונה, latency שונה ואיכות שונה. אז מה, מפתחים צריכים לעשות A/B test ידני על כל קריאה? זה בדיוק הכאב ש-Snowflake מנסה לפתור היום, כשהיא מכריזה על dynamic model routing בתוך ה-Cortex AI Gateway שלה.
מה בעצם קרה כאן?
ב-18 באוגוסט 2026, Snowflake הודיעה על יכולת חדשה ב-Cortex AI Gateway — הרכיב שהיא השיקה ביולי האחרון כמרכז אחד לכל התקשורת עם מודלים. היכולת החדשה: ראוטינג דינמי שבוחר אוטומטית איזה מודל יטפל בכל קריאה, לפי מדיניות שהלקוח מגדיר מראש.
בפועל, זה אומר דבר פשוט: אם יש לכם משימה פשוטה שחוזרת על עצמה — למשל, לסכם טקסט קצר או לסווג סנטימנט — המערכת תפנה אותה למודל יעיל וזול. אם יש משימה שדורשת reasoning עמוק יותר, כמו לכתוב קוד מורכב או לנתח בעיה עסקית מסובכת, היא תנתב אותה למודל frontier מתקדם יותר.
מנכ"ל Snowflake, Sridhar Ramaswamy, ניסח את זה ככה: "השאלה כבר לא כמה חברות משתמשות ב-AI, אלא אם ה-AI הזה מתרגם לערך עסקי אמיתי."
איך זה עובד, טכנית?
הלקוח מגדיר ב-Gateway אילו מודלים מאושרים לשימוש ואילו trade-offs חשובים לו — ביצועים, עלות ו-latency. אחרי שהמדיניות הזו מוגדרת, ה-Cortex AI Gateway מעריך כל משימה מול המדיניות הזו ונתוני ביצועים ומחירים מהעולם האמיתי, ומחליט איזה מודל יטפל בה בצורה הכי יעילה.
הראוטינג הדינמי משולב כבר במוצרי הדגל של Snowflake — CoCo ו-CoWork — וגם זמין לסוכני AI של צד שלישי שמחוברים דרך ה-Gateway.
בנוסף, מודלים חדשים מצטרפים לספרייה: DeepSeek-V4-Flash 0731 ו-GLM-5.3, שני מודלים open source מובילים. זה מרחיב את מגוון האפשרויות ללקוחות — ו-Snowflake מבטיחה שהמידע המנוהל נשאר מאובטח בתוך הפלטפורמה.
כמה כסף זה חוסך? המספרים
הנה הנתון שאמור לעניין אתכם: בבדיקות פנימיות של Snowflake, סוכנים שמשתמשים בראוטינג דינמי בנו dbt pipeline ביעילות גבוהה פי 3 מבחינת השימוש בטוקנים, לעומת שימוש במודל frontier בלבד — תוך שמירה על אותה רמת איכות.
יעילות פי שלושה. זה אומר שאם אתם מוציאים היום, נגיד, 50 אלף דולר בחודש על inference, ובחלק גדול מהמקרים אתם משתמשים במודל הכי יקר גם למשימות טריוויאליות — אתם יכולים, תיאורטית, לקזז חלק משמעותי מההוצאה הזו.
בבדיקה נוספת, צוותי הנדסה השלימו את אותו מספר pull requests עם צריכת טוקנים נמוכה יותר, מה שאומר שגם פרודוקטיביות המפתחים נשמרת.
שליטה על ההוצאות: כלי חדשים ל-FinOps
מעבר לראוטינג עצמו, Snowflake מוסיפה כלים חדשים לניהול הוצאות AI בארגון:
- מעקב אחר שימוש ב-AI
- הקצאת עלויות לצוותים
- הגדרת מכסות ותקרות הוצאה
- ניהול צריכת AI בין סוכנים ויישומים
למי מכם שמנהל צוות גדול עם הרבה סוכנים ויישומים בפרודקשן — זה יכול להיות הבדל משמעותי בסוף החודש.
למה זה רלוונטי לכם?
אם אתם עובדים בחברות שמריצות יישומי AI בפרודקשן, אתם בטח יודעים שהמודל הכלכלי הוא אחד האתגרים הכי גדולים כרגע. כולם בודקים PoCs, אבל ברגע שעוברים לפרודקשן בהיקף נרחב, העלויות מתחילות להפתיע.
המהלך של Snowflake מנסה לפשט את העניין הזה: לא צריך לבנות תשתיות ראוטינג בעצמכם, ולא צריך לבחון מחדש כל פעם שיוצא מודל חדש. ה-Gateway מטפל בזה.
הסמנכ"ל Sanjeev Mohan מ-SanjMo הגדיר את זה טוב: "ארגונים טובעים במודלים. הבעיה האמיתית היא לא איזה מודל לבחור — אלא ה-overhead התפעולי של בחירת המודל הנכון לכל משימה, בסקייל."
מתי זה זמין?
היכולת צפויה להיות זמינה בקרוב ב-private preview. אם אתם לקוחות Snowflake או מתעניינים, שווה לעקוב.
ובינתיים, מי שמסתכל על מדד ה-token efficiency ותוהה לאן הכסף הולך — ייתכן שבעוד כמה חודשים השאלה תהיה פחות "איזה מודל לבחור" ויותר "למה אנחנו עדיין בוחרים ידנית."