עוזר ה-AI Muse נכשל במשימות המורכבות באמת
Meta הרחיבה את עוזר ה-AI Muse ל-macOS, מה שמאפשר לו לפעול באפליקציות מקומיות כמו דואר אלקטרוני וקבצים. בדיקות מוקדמות מראות הצלחה במשימות פשוטות, אבל כישלון במטלות מורכבות, כגון טיפול באפליקציות הקשורות לבית הספר של הילדים — מה שמדגיש את הפער בין הפוטנציאל לבין המציאות בעולם האמיתי.

אז מה בעצם קרה כאן?
Meta מרחיבה את עוזר ה-AI שלה, Muse, ל-macOS — וזהו צעד נוסף במרוץ הצמוד על שוק עוזרי ה-AI הצרכניים. הגרסה החדשה מאפשרת ל-Muse לקיים אינטראקציה עם קבצים, הודעות, דואר אלקטרוני, לוח שנה ופתקים באפליקציות המובנות ב-Mac. המשתמשים שולטים בגישה, ו-Muse תמיד מבקש אישור לפני ביצוע פעולות רגישות.
השקת גרסת macOS מגיעה לאחר ש-Muse כבר עלה למובייל ול-web מוקדם יותר החודש, וצבר פופולריות במהירות בארה"ב. אבל הסיפור האמיתי כאן הוא לא ההשקה, אלא מה שקורה כשעוזר AI חזק פוגש את הבלגן של העולם האמיתי.
איך Muse עובד?
בניגוד למודלי AI כמו ChatGPT, שמתמקדים בטקסט או בחיפוש, Muse פועל כעוזר אישי שמבצע משימות. אתם יכולים לבקש ממנו למשל: "ארגן את תיבת הדואר שלי" או "חפש לי טיולון לנסיעה הקרובה". הוא חוקר, מציע אפשרויות, ואף יכול לבצע רכישות — כמובן, באישורכם.
Meta מדגישה שהשליטה בידיים שלכם. ב-macOS, אתם מגדירים לאילו אפליקציות Muse ניגש, ולפני כל פעולה רגישה הוא מבקש אישור. ג'ימי ריימו, דובר Meta, הסביר שהחיכוך הזה הוא מכוון: "אם עמלה גבוהה או התחברות שנראית חשודה, Muse נועד לעצור ולבדוק במקום להתקדם. אנחנו מעדיפים שישאל מאשר יטעה."
הבטחות מול מציאות: בדיקה אישית
בדיקות מוקדמות מראות של-Muse יש פוטנציאל, אבל גם מגבלות ברורות. בצד החיובי, הוא מצליח במשימות יומיומיות פשוטות. לדוגמה, ביקשתי ממנו לסכם דואר אלקטרוני "חשוב" מדי יום — והוא עשה זאת היטב. גם בקשה לבטל מינויים מיותרים, כמו של Flickr, התקבלה יפה.
אבל כשמנסים לרתום אותו למשימות מורכבות יותר, הבעיות צצות. ניקח, למשל, תכנון יום הולדת לילד בפארק טרמפולינות. Muse ניסה, אבל המשימה דרשה החלטות אנושיות, שיחות טלפון לאולם והסתמכה על אפליקציות מסורבלות. בסופו של דבר, היה צורך לבצע אותה ידנית.
דוגמה נוספת: טיפול בהתראות בית הספר. Muse הצליח לזהות פריטים בדוא"ל, אבל כשמדובר במערכות מורכבות כמו ParentSquare, עם התחברות דרך Google, הוא נתקע. גם מעקב אחר התוכניות של Girl Scouts בקבוצת WhatsApp לא צלח, כי הוא לא יכול לגשת להודעות.
בתחום הבריאות, ביקשתי מ-Muse לקבוע תור לרופא. הוא אסף פרטים כמו תאריך לידה וארבע הספרות האחרונות של מספר ביטוח לאומי, אבל נכשל בעדכון פרטי הביטוח, ובסופו של דבר הנחה אותי להתקשר למרפאה. ניסיון לעקוב אחר המחזור החודשי ולהזמין עוגיות מראש נכשל גם הוא — Muse לא הצליח להסתנכרן עם אפליקציית מעקב המחזור או לנהל משלוחים באופן חלק.
למה זה חשוב לתעשיית הטק?
הסיפור של Muse מדגיש פער מרכזי בפיתוח עוזרי AI: הם יכולים להיות יעילים במשימות מוגדרות היטב, אבל מתקשים עם העולם האמיתי, שמאופיין באפליקציות מבולגנות, מערכות התחברות מסורבלות וצורך באינטליגנציה מעשית מעבר לעיבוד שפה.
עבור מפתחים ועובדי טק בישראל, זה שיעור חשוב. הדבר מראה שהאתגר אינו רק בבניית מודל AI מתקדם, אלא בתכנון ממשקים ותהליכים שמתמודדים עם אי-סדר אנושי. חברות ישראליות שעובדות על מוצרים דומים צריכות ללמוד מהמקרים הללו — איך לגרום ל-AI להתמודד עם אפליקציות בית ספר או מערכות רפואיות מורכבות.
התחרות בשוק
Meta אינה לבד. שחקנים כמו Instinct מגייסים כספים לפי שווי של 10 מיליארד דולר, ו-Poke, שהיה בין הראשונים בתחום, נרכש לאחרונה על ידי Cognition. גם Meta וגם Instinct ממהרים להשיק תכונות חדשות, כמו שיחות קוליות שהושקו השבוע.
השאלה הגדולה היא מי יתפוס במהירות את נתח השוק הצרכני. התחרות הזו דוחפת חדשנות, אבל גם חושפת אתגרים — למשל, הצורך ב-AI שיכול להתמודד עם מערכות בריאות או חינוך, שבהן שגיאות יכולות להיות משמעותיות.
סיכום: פוטנציאל שלא מומש
Muse של Meta מציע הבטחה גדולה, אבל הבדיקות מראות שהוא עדיין לא מוכן "לתקן את החיים". כישלונותיו במשימות מורכבות מצביעים על כך שעוזרי AI צריכים חידוד נוסף, במיוחד בהתמודדות עם תרחישים בעולם האמיתי.
בסופו של דבר, אולי מה שצריך זה muse אחר — כזה שיעזור לנו לחשוב על רעיונות יצירתיים למשימות ש-AI באמת יכול לבצע.