OpenAI מחדשת: GPT-Live-1 משוחח טבעית ומקשיב בו-זמנית
OpenAI משיקה את GPT-Live-1 ו-GPT-Live-1 mini, מודלים קוליים חדשים ל-ChatGPT שמאפשרים שיחה בו-זמנית ומקשיבים ומדברים יחד. הדגמים מציעים שלוש רמות אינטליגנציה ומשתמשים ב-GPT-5.5 לעיבוד ברקע, כשהם מתבססים על ארכיטקטורת full-duplex שמשפרת את הטבעיות.

אז מה בעצם קרה כאן? OpenAI מכריזה על מהלך שיכול לשנות את האופן שבו אנחנו מדברים עם AI. החברה השיקה את GPT-Live-1 ו-GPT-Live-1 mini, שני מודלים קוליים חדשים ל-ChatGPT, עם הבטחה אחת מרכזית: שיחה שמרגישה כמו עם בן אדם, בלי העיכובים המעצבנים ובלי ההפרעות. זה לא עוד עדכון קוסמטי – זה שינוי ארכיטקטוני ששם דגש על דיבור והקשבה בו-זמניים.
השיחה שמשתנה: ממודל מבוסס תורות לדיבור רציף
עד היום, שירותי AI קוליים כמו ChatGPT Advanced Voice Mode פעלו במודל של תורות. המשתמש מדבר, המודל ממתין לשקט, מעבד את האודיו, מייצר תגובה ומקריא אותה חזרה. זה יצר שיחה מרובדת, עם פאוזות טכניות ונטייה להפריע ברגעים לא מתאימים – למשל, הפסקה קצרה למחשבה עלולה הייתה להתפרש כסיום המשפט.
GPT-Live-1 בונה על ארכיטקטורה אחרת לחלוטין: full-duplex. המשמעות? המודל יכול להקשיב ולדבר במקביל, ממש כמו בשיחה אנושית אמיתית. הוא מסוגל להגיב להמהומי ביניים, כמו 'מ'המ' או 'כן', ואפילו להשהות את עצמו אם הוא מזהה שאתם עדיין מדברים. ב-OpenAI טוענים שזה מפחית את תחושת הרובוטיות ומעלה את הטבעיות של האינטראקציה.
מנהלים שיחה, חושבים ברקע
עוד חידוש מרכזי הוא הניתוק בין שכבת הדיבור לשכבת החשיבה. GPT-Live-1 מטפל בשטף השיחה – הניסוח, הטון, הטיימינג – אבל כשיש שאלה שדורשת חיפוש ברשת, ניתוח מורכב או משימה אינטנסיבית יותר, הוא מפנה את העבודה ל-GPT-5.5, מודל הדגל האחרון של OpenAI. כך השיחה לא נתקעת בזמן שה-AI 'חושב'; הוא ממשיך לתקשר, והמידע מוחזר לחלון הדיאלוג כשהוא מוכן.
ב-OpenAI מציעים שלוש רמות אינטליגנציה לבחירה:
- Instant: תגובה מהירה וספונטנית, מבוססת GPT-5.5 Instant.
- Medium: רמה מאוזנת עם זמן עיבוד מעט ארוך יותר.
- High: מאמץ חשיבה מוגבר למשימות מורכבות, באמצעות GPT-5.5 Thinking.
למה זה חשוב לנו?
עבור מי שעובד בתעשיית ההייטק, השינוי הזה משמעותי מכמה זוויות. קודם כל, פרודוקטיביות. אם עד היום השימוש בקול היה מוגבל לפקודות פשוטות או שיחות בסיסיות, עכשיו אפשר לנהל איתו דיונים מורכבים יותר – למשל, להתייעץ על בעיה טכנית תוך כדי עבודה, או לבקש ממנו לחפש נתונים ספציפיים במקביל. שנית, לוקליזציה. ב-OpenAI אומרים שהמודל החדש מצטיין בתרגום חי, מה שיכול להקל על שיתופי פעולה בינלאומיים. שלישית, עלות. החברה טוענת שהשיפורים בטכנולוגיה הפחיתו את עלויות ה-inference, מה שמאפשר לה להציע את השירות הזה למשתמשי ChatGPT בחינם.
לא הכל ורוד: אתגרים וקווים אדומים
כמובן, יש גם מגבלות. ה-Audio נשמר ל-30 ימים לצורך הקשר וזיכרון, אם כי אפשר למחוק או לייצא נתונים. השימוש בנתוני משתמשים לאימון מודלים מוגדר ככבוי כברירת מחדל, ורק אם תבחרו להצטרף, הם ישותפו. מעבר לכך, ב-OpenAI מדגישים שהמודל לא מחקה קולות של אנשים אמיתיים; הוא עובד עם סט קולות מוגדר מראש. יש גם מנגנוני בטיחות שנועדו לזהות תכנים מסוכנים, כמו נטיות אובדניות, ולהגיב בהתאם – למשל, על ידי ניתוב שיחה למודל חשיבה מתמחה או הצגת משאבי תמיכה.
עתיד הקול כממשק
מנכ"ל OpenAI, סם אלטמן, וצוותו רואים בצעד הזה שלב ראשון לקראת עולם שבו קול הוא הממשק הראשי ל-AI. זה מסתדר עם דיווחים קודמים על תוכניות החברה לפתח חומרה, כמו רמקול חכם נטול מסך. אם הקול יהפוך לערוץ התקשורת הדומיננטי, זה יכול להשפיע על הכל – ממכשירי בית חכם ועד לשירותי תמיכה אוטומטיים.
לגבי זמינות: GPT-Live-1 יהיה הסטנדרט למשתמשי Plus ו-Pro, ו-GPT-Live-1 mini יגיע למשתמשים בחינם. השירות כבר עולה לאוויר גלובלית ב-iOS, Android וב-chatgpt.com. ב-OpenAI אומרים שהם עובדים על תמיכה טובה יותר בשפות שונות, כולל עברית, אבל בינתיים ייתכנו פה ושם מבטאים לא מקומיים.
אז בפעם הבאה שאתם מדברים עם ChatGPT, ייתכן שהשיחה תרגיש קצת יותר אנושית – וקצת פחות כמו דיבור עם מכונה.