AMD רוכשת את Taalas להאצת inference של AI
AMD רכשה את Taalas, סטארטאפ קנדי שפיתח שבבים שמקבעים מודלי AI בסיליקון כדי להאיץ inference. העסקה תחזק את AMD מול Nvidia עם ביצועים של אלפי tokens לשנייה, אך השימוש בשבבים דורש תכנון מחדש עבור מודלים חדשים. Taalas גייסה 219 מיליון דולר מאז 2023, והשבב הראשון שלה מריץ את Llama 3.1.

המלחמה על שוק ה-inference ב-AI מתחדדת: AMD הודיעה על רכישת Taalas, סטארטאפ קנדי שפיתח טכנולוגיה לקיבוע מודלי AI ישירות בתוך סיליקון. הרכישה נועדה לחזק את יכולות ה-inference של AMD מול Nvidia, עם הבטחה לביצועים מהירים פי עשרות מאלה של מעבדי GPU מסורתיים.
אז מה בעצם קרה כאן? AMD רוכשת את Taalas בסכום שלא פורסם, בזמן שהסטארטאפ, שנוסד ב-2023, כבר גייס 219 מיליון דולר ממשקיעים כמו Fidelity ו-Quiet Capital. העסקה משקפת את ההכרה שמעבדי GPU אינם מספיקים לכל עומסי העבודה של AI, במיוחד ביישומים הדורשים latency נמוך.
איך זה עובד? Taalas בונה שבבים מותאמים אישית (model-specific integrated circuits) – במקום להעביר משקלים (weights) של מודל AI מזיכרון למעבד בכל פעולת עיבוד, הם חרוטים ישירות בטרנזיסטורים. זה מאפשר מהירות גבוהה מאוד: השבב הראשון שלהם, HC1, שנבנה בתהליך 6 ננומטר של TSMC, השיג כ-17,000 tokens לשנייה עם גרסת ה-8B של Llama 3.1 מבית Meta. לטענתם, זה מהיר פי 73 מזה של H200 מבית Nvidia וצורך עשירית בלבד מההספק.
אבל יש פשרה: כל שבב משרת מודל אחד בלבד. שינוי מודל דורש עיצוב מחדש, אם כי Taalas טוענת שבגלל שרק שתי שכבות מתכת משתנות מתוך 100+, זמן הפיתוח הוא כחודשיים בלבד.
AMD מתכננת לשלב את השבבים הללו במערכות שלה, למשל ב-racks של Helios, לצד GPU ממשפחת Instinct ומעבדים מסדרת Epyc, כשהכול מתוכנת דרך תוכנת ROCm. המטרה היא להציע ללקוחות כמו Meta ו-Microsoft אפשרויות מותאמות – מעבדי GPU לעומסי עבודה גמישים ושבבי Taalas לעבודות inference ספציפיות.
מנכ״ל Taalas, Ljubisa Bajic, מסביר שהפלטפורמה שלהם הופכת כל מודל AI לשבב סיליקון מותאם. זה מתחבר לאסטרטגיה הרחבה יותר של AMD, שבשנה האחרונה ביצעה רכישות נוספות בתחום ה-AI, כולל Silo AI ו-ZT Systems, כדי לבנות פתרונות rack-scale.
הרכישה הזו מגיעה על רקע התגברות התחרות: Nvidia השקיעה 20 מיליארד דולר ברכישת נכסים מ-Groq בדצמבר האחרון. בעולם שבו ה-AI מתפתח, נראה שאין פתרון אחד שמתאים לכולם – ו-AMD מנסה לכסות את כל הקצוות. בסופו של דבר, השאלה היא האם גמישות שווה את המחיר: שבב מהיר יותר למודל אחד קבוע, או GPU שיכול להתמודד עם מודלים חדשים מדי חודש.