OpenAI טוענת: Jalapeño עוקף את התחרות בביצועי AI
OpenAI פרסמה את תוצאות הביצועים של שבב Jalapeño, שמציג latency נמוכה פי 3.6 מזו של שבבי Nvidia ו-throughput גבוה פי 1.9. החברה מתכננת פריסה מוגבלת עד סוף 2026, והגדלת היקף הפריסה ב-2027, כחלק מאסטרטגיה להפחתת התלות בחומרה חיצונית.

OpenAI פרסמה את תוצאות ה-benchmark הראשונות לשבב ה-AI המותאם אישית שלה, Jalapeño, והנתונים מרשימים. החברה טוענת שהוא מספק throughput גבוה יותר ו-latency נמוכה יותר ממערכות חומרה קיימות, מה שמציב אותו כאופציה מובילה בתעשייה ל-AI inference. אז מה בעצם קרה כאן? OpenAI פרסמה פוסט בבלוג וקיימה תדרוך לעיתונאים, שבהם טענה ש-Jalapeño, ה-ASIC הראשון שלה ל-inference שנבנה בשיתוף עם Broadcom, מתעלה על מערכות קיימות גם בביצועים וגם ב-latency. השבב הוצג לראשונה ביוני ותוכנן במיוחד ל-AI inference — התהליך של הרצת מודלים מאומנים לצורך ביצוע משימות או פריסת agents.
כדי למדוד את הביצועים, OpenAI השתמשה ב-InferenceX, פלטפורמת benchmarking ציבורית של SemiAnalysis, שמודדת את התהליך המלא של serving בקשת AI. המבחן השווה את Jalapeño לתוצאות הטובות ביותר שנרשמו עד אז, עם שבבי העל GB200 או GB300 של Nvidia. לפי OpenAI, Jalapeño סיפק פי 1.5 עד פי 1.9 יותר עבודה ל-AI לכל וואט בפסגות throughput, ו-latency נמוכה פי 1.7 עד פי 3.6 מקצה לקצה בשלושה מודלים ציבוריים: GPT-OSS 120B, DeepSeek R1 ו-Kimi K2.5 1T. עבור עומסי עבודה אינטראקטיביים מאוד, הביצועים היו גבוהים פי 2.1 עד פי 4.1. ריצ'רד הו, סגן נשיא לתחום החומרה ב-OpenAI, אמר בתדרוך ש-Jalapeño מציע "את הטוב משני העולמות", עם latency נמוכה יותר ו-throughput גבוה יותר, בעוד שמערכות AI אחרות "צריכות לעשות trade-off בין השניים".
השבב תוכנן מאפס כדי למזער תנועת נתונים ועיכובים בתקשורת. מצב המודל, כולל ה-KV cache המשמש בעת יצירת תגובה, יכול להיות ממוקם באופן מפורש ולהישאר מקומי בזמן שהמערכת מפעילה את השילוב הנכון של חישוב, זיכרון ורשתות לכל שלב inference. הרשת היא חלק בלתי נפרד מהארכיטקטורה, עם מרחב גדול שמאפשר לכל עומס העבודה להישאר במערכת מחוברת אחת, מה שעוזר לבקשה המלאה להישאר מהירה ויעילה מתחילתה ועד סופה. התוצאה היא מאיץ מאוזן ו-fungible שיכול לתמוך בארכיטקטורות מודלים משתנות, להצטיין גם ב-prefill וגם ב-decode ולהתאים את עצמו ככל שהאיזון ביניהם משתנה — תכונה מגדירה של עומסי עבודה agentic.
AI מילאה תפקיד ישיר בפיתוח Jalapeño, ואפשרה לצוות לעבור מעיצוב ראשוני ל-tapeout בתשעה חודשים באמצעות חקירת יישומים, קיצור לולאות עיצוב, מדידה ואימות, ואיטרציה מתמשכת על עומסי עבודה של מודלים. AI גם עזרה לבצע אופטימיזציה למסלולים האריתמטיים של השבב, ואפשרה לצוות לדחוס יותר ביצועי חישוב לשבב נתון. Jalapeño תוכנן כיעד תכנות ברור וצפוי, הן לבני אדם והן ל-AI. מהנדסים יכולים לתאר עבודה באמצעות tensors מקומיים, תקשורת מפורשת וסנכרון צפוי, ואז AI יכולה לבצע אופטימיזציה לאופן שבו העבודה ממופה, ממוקמת, מתוזמנת ומאורגנת במערכת. המבנה הברור הזה נותן ל-AI דרך tractable להתמודד עם בעיית התכנות המקבילי המסורתית והקשה.
OpenAI מתכננת לפרוס את Jalapeño בכמויות קטנות בתשתית החישוב שלה עד סוף השנה, אך תתחיל להגדיל את היקף הפריסה ב-2027. החברה לא מציינת כמה שבבים היא מתכננת לפרוס בשנה הבאה. למרות השיפורים האלה בביצועים, OpenAI לא מצפה להחליף את כל מערך השבבים שלה ב-Jalapeño, ואומרת שתוכנית החישוב הכוללת שלה כוללת "שותפים טובים מאוד", כמו Nvidia. החברה תמשיך לפתח את הדור השני והשלישי של השבב החדש, כחלק מפלטפורמה רב-דורית.
המשימה של OpenAI היא להבטיח שבינה מלאכותית כללית תועיל לכל האנושות. ההישגים האלה יעזרו להפוך AI בעלת יכולות רבות יותר למשתלמת ונגישה יותר. Jalapeño מרחיב את האפשרויות ל-inference יעיל ו-latency נמוכה: inference במצב ultra-fast עם יעילות שהייתה זמינה רק במצב fast, inference במצב fast עם יעילות שהייתה זמינה רק במצב batched, ויעילות גבוהה יותר ל-inference במצב batched. OpenAI מציינת שהשבב הוא עדות ליתרון full-stack רחב יותר — החברה יכולה לעצב מודלים, מוצרים, תוכנת serving, שבבים, זיכרון, רשתות ומערכות יחד, תוך שימוש במה שהיא לומדת מעומסי עבודה אמיתיים כדי לשפר כל שכבה ב-stack. Jalapeño הוא שבב הסיליקון הראשון שלה עם תוצאות מדודות, והוא ההתחלה של פלטפורמה רב-דורית.
לסיכום, בזמן ש-OpenAI בונה שבבים משלה, היא עדיין לא מפטרת את Nvidia — הכול עניין של having the best tools for the job.