AI + INFERENCE

    ידיעות בינה מלאכותית בנושא INFERENCE

    תחזית: AMD תעקוף את Nvidia בשלוש השנים הקרובות

    שתי תחזיות מ-Motley Fool טוענות שמניות של חברות שבבי AI אחרות יעלו על Nvidia בשנים הקרובות. הראשונה מתמקדת בצמיחה של AMD בשוק ה-Inference, הצפוי לגדול ב-32% בשנה, והשנייה צופה זינוק במניית Micron בזכות הוצאות של יותר מ-700 מיליארד דולר מצד חברות ענן כמו Microsoft ו-Amazon.

    תחזית: AMD תעקוף את Nvidia בשלוש השנים הקרובות

    Gartner: עלויות ה-AI יזנקו ביותר מפי חמישה עד 2028

    מחקר של Gartner צופה שעלויות ה-inference של תהליכי AI אג'נטיים יגדלו ביותר מפי חמישה עד 2028, למרות ירידת מחירי הטוקנים. הסיבה: מערכות AI מורכבות יותר צורכות הרבה יותר טוקנים, וחברות כבר חורגות מתקציבים. זה נקרא ״פרדוקס ה-inference״ — החדשנות מתקדמת מהר יותר מההוזלות.

    Gartner: עלויות ה-AI יזנקו ביותר מפי חמישה עד 2028

    הסטארטאפ הישראלי Decart בדרך לעסקה של 7 מיליארד דולר

    Anthropic צפויה לרכוש את הסטארטאפ הישראלי Decart תמורת 7 מיליארד דולר, בעסקה שתהפוך את שלושת המייסדים הצעירים למיליארדרים. הרכישה, בין הגדולות בהיי-טק הישראלי, תוביל להעברת פעילות פיתוח משמעותית של חברת ה-AI האמריקאית לישראל, ותציב את הטכנולוגיה הישראלית בלב המירוץ העולמי.

    הסטארטאפ הישראלי Decart בדרך לעסקה של 7 מיליארד דולר

    OpenAI מציגה מהירות AI של 750 טוקנים בשנייה

    OpenAI ו-Cerebras משיקות את Ultrafast, שכבת API חדשה שפועלת על GPT-5.6 Sol במהירות של עד 750 טוקנים בשנייה — פי 14 מהמהירות הרגילה. המטרה: להפוך מודלים גדולים ו״חכמים״ למתאימים גם לתרחישים שבהם לזמן יש חשיבות, כמו שירות לקוחות חי וניתוח פיננסי. כרגע השירות זמין בתצוגה מקדימה מוגבלת ללקוחות נבחרים.

    OpenAI מציגה מהירות AI של 750 טוקנים בשנייה

    AMD רוכשת את Taalas להאצת inference של AI

    AMD רכשה את Taalas, סטארטאפ קנדי שפיתח שבבים שמקבעים מודלי AI בסיליקון כדי להאיץ inference. העסקה תחזק את AMD מול Nvidia עם ביצועים של אלפי tokens לשנייה, אך השימוש בשבבים דורש תכנון מחדש עבור מודלים חדשים. Taalas גייסה 219 מיליון דולר מאז 2023, והשבב הראשון שלה מריץ את Llama 3.1.

    AMD רוכשת את Taalas להאצת inference של AI

    Vultr ו-AMD: 33% יותר ביצועים במחיר 82% פחות

    Vultr מציגה שותפות עמוקה עם AMD וטוענת לעד 33% יותר ביצועים במחיר 82% פחות מה-hyperscalers. החברה מפעילה 33 מרכזי נתונים גלובליים עם ארכיטקטורות פתוחות ותואמת לדרישות Sovereign AI. האסטרטגיה מתמקדת בעידן ה-inference וה-agentic, עם פתרון משותף עם VAST Data ו-SUSE לפריסה מהירה ברובוטיקה, פיננסים ובריאות.

    Vultr ו-AMD: 33% יותר ביצועים במחיר 82% פחות

    Etched מכפילה את השווי ל-10.3 מיליארד דולר

    Etched, סטארטאפ שבבים ל-AI, גייס 300 מיליון דולר והכפיל את שוויו ל-10.3 מיליארד דולר בתוך שבעה חודשים, עם הזמנות של מיליארד דולר שכבר מאובטחות. המייסדים, נושרי הרווארד, מתגברים על ספקנות עם טכנולוגיה ייחודית שמכוונת ל-inference וקוצרת התעניינות מענקיות ה-AI.

    Etched מכפילה את השווי ל-10.3 מיליארד דולר

    NVIDIA קובעת: performance per watt מגדיר רווחיות ב-AI

    מדד ה-performance per watt הופך למרכזי בחוות AI, כש-NVIDIA מובילה שיפורים של פי 25 ביעילות לעומת דורות קודמים. המעבר נדחף על ידי גבולות חשמל וצורך ברווחיות, כאשר חברות כמו Anthropic כבר מיישמות. אחסון SSD מתקדם, כמו ה-122 טרה-בייט של Solidigm, מאפשר הפחתת צריכת חשמל ב-80%, מפנה אנרגיה ל-GPUs ומניע ארכיטקטורות חדשות.

    NVIDIA קובעת: performance per watt מגדיר רווחיות ב-AI

    DeepSeek מפתחת שבב AI משלה

    חברת ה-AI הסינית DeepSeek מפתחת שבב היסק משלה כדי להפחית תלות ב-Nvidia וב-Huawei. הפרויקט, שהחל לפני כשנה, מצטרף למגמה עולמית שבה חברות AI מפתחות שבבים פנימיים — אך הדרך לייצור המוני רצופה מכשולים טכנולוגיים וכלכליים.

    DeepSeek מפתחת שבב AI משלה

    NVIDIA משנה את חוקי המשחק: השקעה אסטרטגית בטכנולוגיית היסק AI של Groq

    NVIDIA השקיעה 20 מיליארד דולר ב-Groq וקיבלה רישיון לטכנולוגיית שבבי היסק ייעודיים, במטרה לחזק את שליטתה בשוק ה-AI. מהלך זה חושף אסטרטגיה לאמץ ארכיטקטורות חומרה מגוונות מעבר ל-GPU, תוך התמקדות בכלכלת ההיסק – שלב הפעלת המודלים שמהווה כיום 40% מההכנסות ועתיד לצמוח בקצב אקספוננציאלי.

    NVIDIA משנה את חוקי המשחק: השקעה אסטרטגית בטכנולוגיית היסק AI של Groq

    מהפכת הבינה המלאכותית: מודלים קטנים וחומרים חדשים מובילים את הקדמה

    שלוש פריצות דרך מערערות את תפיסת הבינה המלאכותית: רשת מבוזרת של מודלים קטנים (Swarm Inference) מנצחת את הענקיות הטכנולוגיות, מחקר חושף יתרונות מודלים קטנים בתעשייה, ופיתוח חומר חדש בטוקיו מפחית התנגדות חשמלית בפוטנציאל לשבבים חסכוניים יותר.

    מהפכת הבינה המלאכותית: מודלים קטנים וחומרים חדשים מובילים את הקדמה

    Ant Group משיקה מסגרת AI מהירה פי 10 מפתרון של Nvidia לחישובי דיפוזיה

    Ant Group השיקה את dInfer - מסגרת קוד פתוח לייעול תהליכי ה-inference במודלי דיפוזיה של AI. לפי החברה, המערכת מהירה פי 3 מפתרון vLLM של אוניברסיטת קליפורניה ופי 10 מפתרון Fast-dLLM של NVIDIA, עם יכולת ייצור של 1,011 טוקנים בשנייה. הצעד משקף מאמץ סיני לפצות על מחסור בשבבי AI מתקדמים באמצעות אופטימיזציה תוכנתית.

    Ant Group משיקה מסגרת AI מהירה פי 10 מפתרון של Nvidia לחישובי דיפוזיה