OpenAI מציגה מהירות AI של 750 טוקנים בשנייה
OpenAI ו-Cerebras משיקות את Ultrafast, שכבת API חדשה שפועלת על GPT-5.6 Sol במהירות של עד 750 טוקנים בשנייה — פי 14 מהמהירות הרגילה. המטרה: להפוך מודלים גדולים ו״חכמים״ למתאימים גם לתרחישים שבהם לזמן יש חשיבות, כמו שירות לקוחות חי וניתוח פיננסי. כרגע השירות זמין בתצוגה מקדימה מוגבלת ללקוחות נבחרים.

בכל פעם שאתם ממתינים לתגובת מודל AI, כמה זמן זה באמת לוקח? אם זה עניין של שניות, זה מרגיש איטי. אם זה דקות, זה כבר פוגע בזרימת העבודה. OpenAI טוענת שהיא מצאה פתרון דרמטי לבעיה הזו, והיא קוראת לו Ultrafast.
אתמול (ג׳) הכריזה החברה על שכבה חדשה (Service Tier) ב-API שלה, שפועלת על גבי מודל ה-GPT-5.6 Sol. המספרים שהיא מציגה הם לא שיפור הדרגתי, אלא קפיצה משמעותית: עיבוד מהיר פי 14 מהעיבוד הסטנדרטי, עם הפקה של עד 750 טוקנים (יחידות תוכן) בשנייה. כדי להשיג את המהירות הזו, OpenAI שיתפה פעולה עם חברת החומרה האמריקאית Cerebras, שמפעילה את מצב ה-Ultrafast בשלב הראשון של ההרצה.
אז מה בעצם קרה כאן?
ההבטחה המרכזית של Ultrafast היא פירוק החומה שהייתה קיימת עד כה: כדי לקבל מהירות גבוהה, נאלצתם לבחור במודל קטן או פחות ״חכם״. מודלים גדולים באמת, כמו GPT-5.6 Sol, היו איטיים יחסית. המוצר החדש נועד לשבור את הדילמה הזו, ולאפשר להשתמש ביכולות המלאות של המודל הגדול ביותר, אבל במהירות שיא.
Sachin Katti, VP Compute Strategy & GPT-Infra ב-OpenAI, הסביר שהם בודקים כעת עם קבוצה קטנה של לקוחות ״מה הופך להיות אפשרי כאשר לקוחות יכולים להשתמש ביכולות של המודלים החזקים ביותר שלנו, עם זמן שיהוי נמוך באופן משמעותי. נתחיל בקבוצה קטנה של לקוחות כדי ללמוד היכן המהירות הזו יוצרת ערך משמעותי״.
מהירות של 750 טוקנים בשנייה?
בואו ננסה להבין את המספר. 750 טוקנים זה בערך 500–600 מילים באנגלית בשנייה. מדובר בקצב שקשה להשוות אותו לשיחה אנושית. בעולם שבו AI הופך למתווך במכירות, בתמיכת לקוחות או בניתוח פיננסי, הבדל כזה יכול להיות קריטי.
OpenAI מפרטת תרחישים שבהם זה רלוונטי מיידית:
- תגובה לאירועים ו-SRE: כאשר מערכת קריטית קורסת, אפשר לנתח לוגים, שינויים אחרונים בקוד ודוחות מהנדסים כדי לזהות את הסיבה הסבירה תוך כדי הפסקת השירות.
- מחקר פיננסי ואבטחת מידע: ניתוח אותות שוק, הערכת עסקאות וזיהוי פעילות חשודה כאשר התנאים עדיין משתנים.
- שירות לקוחות וקול: פתרון בעיות לקוח מורכבות בזמן אמת, בלי לשבור את השיחה.
- מחקרים וניסויים בזמן אמת: הפיכת מחקר שנמשך לילה שלם לסשן עבודה אינטראקטיבי.
מאחורי הקלעים: איך זה עובד?
המפתח ל-Ultrafast הוא לא רק התוכנה, אלא החומרה של Cerebras. בניגוד למעבדי GPU סטנדרטיים, שצריכים ״להעביר״ את המשקלים (weights) של המודל בין זיכרון על-שבבי לזיכרון חיצוני, מה שיוצר צוואר בקבוק, ה-Wafer-Scale Engine של Cerebras מכיל את כל המשקלים בזיכרון SRAM בנפח 44 ג״ב, על שבב הענק עצמו. זה מבטל את מגבלת רוחב הפס של הזיכרון שקיימת בחומרה קונבנציונלית.
Andrew Feldman, מנכ״ל Cerebras, אמר ש״GPT-5.6 Sol במצב Ultrafast מוכיח שמהירות ואינטליגנציה כבר לא צריכות לבוא זו על חשבון זו״.
מספרים, לצורך ההשוואה
OpenAI, באמצעות Cerebras, מפרסמת גם השוואות מהירות למודלים אחרים:
- Ultrafast מהיר פי 5 מ-Claude Opus 4.8 במצב Fast, ופי 11 מ-Claude Fable 5, בהתבסס על דיווחים מ-Artificial Analysis.
- במבחן Humanity's Last Exam (שאלון של 2,500 שאלות ברמת בוגר), Ultrafast סיים את כל השאלות בקצת יותר מ-11 שעות. לשם השוואה, Claude Fable 5 לקח יותר משלושה ימי מחשוב רצופים כדי להגיע לדיוק דומה.
- במבחן GDP-Val (העוסק במשימות ידע ״כלכליות״ כמו כתיבה משפטית), הביצוע היה מהיר פי 5.6 ללא ירידה באיכות.
מה זה אומר עלינו, אנשי ההיי-טק?
כרגע, Ultrafast נמצא בתצוגה מקדימה מוגבלת (limited preview) עבור קבוצה נבחרת של לקוחות. כולם יכולים להירשם כדי לקבל עדכונים כאשר הגישה תורחב. המשמעות המיידית היא שפרויקטים שמשתמשים ב-API של OpenAI צריכים לחשוב מחדש על הארכיטקטורה: משימות שנדחו ל-״background״ בגלל שהמודל איטי, פתאום יכולות להפוך לסינכרוניות.
השילוב עם Cerebras מראה ש-OpenAI מסתכלת מעבר ל-GPU ומחפשת שותפויות חומרה כדי להתמודד עם אתגרי ה-inference. עבור חברות ישראליות שמפתחות יישומי AI הדורשים תגובה בזמן אמת, זו בשורה: תקרת המהירות עולה.
אז בפעם הבאה שאתם ממתינים למודל, אולי התשובה תהיה ״עוד רגע״ — בקצב של 750 טוקנים לשנייה. מנה כפולה של קפאין, מישהו?