CoreWeave: ה-AI כבר לא נגמר ב-GPU
CoreWeave מרחיבה את ערימת ה-AI שלה עם CoreWeave Forge, בעוד Nvidia מדגישה שיפורים ביעילות עם Vera Rubin, שבה Cognition ראתה גידול של פי 4.8 ב-throughput. כלכלת ה-AI עוברת מדחיפת GPU למדידת tokens per watt, עם צפי לכך שיחס האימון ל-inference יגיע ל-10/90 בשנה הבאה.

אם אתם עובדים בעולם ה-AI, אתם יודעים שהמשחק השתנה. כבר לא מדובר רק בלדחוף כמה שיותר GPU לענן – הכלכלה של בינה מלאכותית עוברת מהפך, וכעת המדד החשוב ביותר הוא כמה tokens אפשר לייצר לכל וואט חשמל. השינוי הזה משפיע על הכול: מתכנון מרכזי הנתונים ועד למחיר שאתם משלמים על שירותי ענן.
אז מה בעצם קרה כאן?
בכינוס Fully Connected של CoreWeave בסן פרנסיסקו, אנליסטים ומובילים בתעשייה הציגו תמונה ברורה: הביקוש ל-inference – הפעילות שבה מודלים פרוסים מטפלים בבקשות ומפיקים פלט – גדל בקצב מהיר הרבה יותר מאשר האימון. "היום היחס הוא 50/50, וצופים שהוא יגיע ל-10/90 בשנה הבאה", אמר דייוויד וולנטה, אנליסט ראשי ב-TheCUBE Research. "שתי העקומות גדלות, אבל ה-inference מאיץ. אם מסתכלים על המספרים של CoreWeave, הם פשוט מטפסים לשמים."
המשמעות היא שספקי תשתית צריכים לחשוב מחדש על מה שהם מציעים. ג'ון פוררייר, אנליסט ב-TheCUBE Research, הוסיף: "אם המעבר הזה מתרחש, מרכזי הנתונים ייראו אחרת לגמרי. המשחק נשאר אותו דבר: להפיק כמה שיותר tokens per watt. אתם מקבלים את הסערה המושלמת מצד הספקים: Dell, מערכות אקולוגיות פורחות ו-CoreWeave בעמדת זינוק."
מה זה אומר על הכלכלה?
ב-Nvidia, שחקנית המפתח בתחום החומרה, מתייחסים ל-AI factories – מרכזי ענק המייצרים בינה מלאכותית – כאל נכסים כלכליים. איאן באק, סגן נשיא ב-Nvidia, הסביר: "במקום מכוניות או מכשירים, מדובר ב-tokens. הנכסים האלה הם לא IT ולא עלות – הם מוערכים, מייצרים הכנסה, ניתנים להמרה, עמידים ויצרניים."
הסיבה לחשיבות ה-tokens per watt פשוטה: ההספק הוא האילוץ העיקרי במפעל AI. כל מגה-וואט עולה בסביבות 60 מיליון דולר, ומשקיעים צריכים לראות תשואה ברורה. לכן, המדד הקריטי הוא tokens per second per megawatt – ככל שתוכלו להכניס יותר tokens לתוך מעטפת הספק קבועה, כך ההכנסה גדלה והעלות לכל token יורדת.
נתונים מ-SemiAnalysis מראים ש-Nvidia מובילה בתחום זה, אבל החשוב הוא לא רק החומרה. "האימון לא מוחלף לחלוטין", ציין באק. "חברות מעדכנות מודלים כל הזמן – מחדדות אותם, מיישרות אותם, מוסיפות נתונים. זה דורש קצת אימון מתמשך. אנחנו רואים עבודה עם למידת חיזוק והתאמה מקוונת."
CoreWeave מרחיבה את הערימה
CoreWeave, שידועה כספקית ענן מותאמת ל-AI, לוקחת את הרעיון הזה קדימה. החברה הרחיבה את ההיצע שלה מעבר ל-GPU עם CoreWeave Forge – סביבה מחוברת לאימון, הערכה ושיפור מודלים ו-agents על גבי תשתית מחשוב מואצת של Nvidia. הצעד הזה נועד לתמוך בדרישות של מערכות AI agentic, שצריכות לעבוד כל הזמן בין inference, משוב ואימון.
דוגמה בולטת היא Cognition AI, החברה שמאחורי הסוכן החכם Devin. "הריצות שלנו תמיד פעילות", אמר סילאס אלברטי, ראש מחקר ב-Cognition. "אנחנו תמיד מאמנים, תמיד מחפשים את הנתונים הבאים ואותות תגמול כדי לשפר את המודלים."
Cognition מפזרת אימון על פני מרכזי נתונים במדינות שונות, מה שמעלה את הצורך באמינות גבוהה. "אם אתם מפעילים ריצה גדולה, אתם צריכים uptime", הוסיף אלברטי. "אם העתק אחד נופל, כל הריצה נופלת. יעד חשוב הוא להגיע לאמינות של 99.99%."
Nvidia ו-CoreWeave סוגרות את הלופ
שיתוף הפעולה בין Nvidia ל-CoreWeave הוביל להכרזה על מערכות Nvidia Vera Rubin NVL72 עם רשתות Spectrum-X 102.4T Ethernet. Cognition הייתה הלקוחה הראשונה שהפעילה עומסי עבודה על Vera Rubin, וראתה שיפור של פי 4.8 ב-throughput של tokens לעומת קו הבסיס GB200 NVL72.
Nvidia גם מדגישה את החשיבות של מערכות Blackwell, שמציעות קפיצות יעילות. "מחשוב מואץ של Nvidia מספק ערך לאורך דורות", אמר באק. "מעבדי ה-GPU מסוג V100 של CoreWeave עדיין מפעילים עומסי עבודה כמעט עשור אחרי ש-Volta הושק, אפילו כש-Vera Rubin כבר נכנסת לייצור. זו הפלטפורמה של Nvidia: תשתיות שממשיכות להרוויח שנים."
המשמעות ללקוחות היא ברורה: הם יכולים להפעיל מגוון רחב יותר של עומסי עבודה, מאימון מודלים חדשים ועד להסקת מסקנות בזמן אמת, על אותה תשתית. CoreWeave גם מציעה את Nvidia Vera, מעבד ראשון שנבנה עבור AI agents.
מה עומד על הכף?
המעבר ל-inference efficiency משנה את כללי המשחק. לא עוד מי שיש לו הכי הרבה GPU מנצח – אלא מי שמצליח למקסם את הפלט מכל וואט. זה מחייב ארכיטקטורות מערכת שלמות שמותאמות לסיליקון, לרשת, לאחסון ולתוכנה, ולא רק לרכיב בודד.
לתעשיית ההייטק הישראלית, שאין לה נוכחות ישירה בסיפור הזה, יש מה ללמוד: המיקוד ביעילות ובמדדים מעשיים כמו tokens per watt הוא לא טרנד חולף, אלא בסיס לכלכלת AI בת־קיימא. חברות שיתכננו תשתיות עם עין על המדד הזה יהיו בעמדת יתרון.
אז מי אמר שאי אפשר למכור tokens?