אפל בוחנת רכישת סטארטאפ לדחיסת מודלי AI
אפל מנהלת מגעים עם PrismML, סטארטאפ שמכווץ מודלי AI כך שירוצו על אייפון – מ-54 ג'יגה לפחות מ-4. במקביל, החברה מחפשת לרכוש חברות שבבים כדי לחזק את תשתית השרתים, על רקע עלייה של 190% במחירי הזיכרון ותחרות גוברת מול OpenAI ו-Anthropic.

אפל מנסה כבר חודשים לשדרג את סירי לרמה שמתחרה בעוזרות של OpenAI ו-Anthropic, אבל יש לה בעיה טכנולוגית עקשנית: המודלים החזקים ביותר דורשים יותר מדי זיכרון ועיבוד כדי לרוץ על אייפון. השבוע נחשף שהיא מנהלת מגעים עם סטארטאפ קטן שטוען שהוא מצא פתרון – ושהיא גם מחפשת לרכוש חברות שבבים כדי לחזק את הצד של השרתים.
54 ג'יגה הופכים ל-4
PrismML, ספין-אוף מ-Caltech שגויס בחסות Khosla Ventures, פרסם השבוע גרסאות דחוסות של מודל Qwen של עליבאבא. החברה הצליחה, לטענתה, לכווץ את המודל מ-54 ג'יגה-בייט לפחות מ-4 ג'יגה-בייט – מה שמאפשר לכל 27 מיליארד הפרמטרים לרוץ על אייפון 15 ומעלה.
ה-CEO, Babak Hassibi, אמר שאפל וחברות אחרות "באמת בודקות את הטכנולוגיה שלנו כרגע" וכי "הדברים מתקדמים יפה". הוא תיאר את השיחות כמוקדמות מאוד.
לפי PrismML, הגישה שלהם מבוססת על פישוט דרמטי של האופן שבו המידע הפנימי במודל מאוחסן – הפחתת כל ערך מ-16 ביט לעד שלושה ערכים אפשריים בלבד. התוצאות, לטענתם: צריכת זיכרון נמוכה פי 10-15, מהירות תגובה גבוהה פי 6-8, וצריכת אנרגיה נמוכה פי 3-6 לעומת גרסאות רגילות.
אבל יש פשרה. Hassibi הודה שהמודלים הדחוסים מאבדים כמה אחוזים בביצועים – הזיכרון העובדתי נחלש לפני מיומנויות כמו חשיבה, מתמטיקה וקוד.
החברה שחררה שתי גרסאות דחוסות בחינם, שמיועדות לרוץ על מכשירים יומיומיים – אייפון, MacBook ומחשבים עם Nvidia. הטכנולוגיה הגיעה מקבוצת המחקר של Hassibi ב-Caltech, והאוניברסיטה מחזיקה בפטנטים ומעניקה רישיון בלעדי ל-PrismML. במרץ האחרון גייסה החברה 16.25 מיליון דולר בסבב Seed.
למה זה חשוב לאפל
נכון לעכשיו, אפל מריצה חלק ממערכת ה-AI שלה מקומית – תרגום, סיכום חלקי ותכונות שקשורות למידע אישי. בקשות מורכבות יותר עוברות לתשתית הענן הפרטית שלה או למודלים חיצוניים – כולל מודל Gemini שמריץ את סירי AI דרך Google Cloud.
Horace Dediu, מייסד Asymco, אמר שאפל מנסה לשמור את רוב האינטראקציות הרגילות עם סירי על המכשיר, ולהשאיר את המשימות הכבדות לענן. "הם מנסים להבין איזה מודל גדול ואיזה מודל חכם הם יכולים להכניס למכשיר," הוא הסביר.
Carolina Milanesi מ-Creative Strategies הוסיפה שמודלים קטנים יכולים לאפשר לאפל להעביר פונקציות תובעניות לאייפון – כולל צילום computational, יצירת וידאו, וכלי בריאות שמתבססים על מידע אישי רגיש. "ככל שאתה יכול לעשות יותר על המכשיר, זה יותר טוב," היא אמרה.
טכנולוגיה כזו גם עוזרת לאפל לשמור על קו הפרטיות שלה – פחות נתונים נשלחים לשרתים חיצוניים. ואם אפשר להריץ מודל גם בלי חיבור לאינטרנט, אז בכלל.
אפל, נזכיר, כבר מייצרת את השבבים והתוכנה של האייפון ביחד, מה שנותן לה שליטה הדוקה יותר על איך AI רץ על המכשיר. Hassibi אמר שהטכנולוגיה יכולה להשתלב לא רק בטלפונים ומחשבים, אלא גם ברובוטיקה ומערכות אוטונומיות שצריכות לקבל החלטות מהר בלי להסתמך על ענן.
מהצד השני: השרתים
אבל לאפל יש גם בעיה בצד השרתים. לפי דיווחים, החברה מנהלת שיחות עם יצרניות מוליכים למחצה ובנקאי השקעות לגבי רכישות שיחזקו את התשתית הזו.
אפל התמודדה עם בעיות ביצועים בשרתים שרצים על שבבי M2 Ultra שלה. שבב שרתים מבוסס M7 Ultra לא יהיה מוכן עד 2029, וגם פרויקט בקוד "Baltra" שתוכנן להשקה השנה – נדחה. ב-Bloomberg ציינו שאפל תשדרג בקרוב לשבבי M5 Ultra.
אפל חתמה לאחרונה על עסקת ענק עם Broadcom לרכישת שבבים ב-30 מיליארד דולר, המיוצרים בארה"ב. וכבר השנה הראתה שהיא מוכנה לשלם בגדול על AI – רכישת הסטארטאפ Q.ai תמורת כמעט 2 מיליארד דולר הייתה הרכישה השנייה בגודלה בתולדותיה, אחרי Beats ב-2014 תמורת 3 מיליארד דולר. לצורך השוואה, ב-2008 אפל קנתה את PA Semi תמורת 278 מיליון דולר – הרכישה שהתחילה את מהפכת השבבים העצמאיים שלה.
בקופת אפל 45.6 מיליארד דולר במזומן, כך שיש לה מרחב תמרון משמעותי.
מחירי הזיכרון וההשפעה על השוק
למה כל זה רלוונטי? מחירי הזיכרון עולים בקצב מטורף. Morgan Stanley מעריך שעלות ה-DRAM הממוצעת של אפל תזנק בכ-190% בשנת הכספים 2027, ומחירי ה-NAND יעלו בכ-180%. ההערכה: מחיר האייפון 18 יעלה בכ-200 דולר כדי לשמור על שולי רווח. אפל כבר העלתה השנה מחירי מחשבים מאותה סיבה.
טכנולוגיה כמו של PrismML יכולה לעזור: אם אפשר להריץ מודל שדורש שמונה GPUs על GPU אחד, או להעביר מודל משרת לאייפון – העלויות משתנות דרמטית. PrismML טוענת שהטכנולוגיה שלה יכולה להרחיב AI מעבר לטלפונים ומחשבים – לרובוטיקה, מערכות אוטונומיות ומוצרים שצריכים לקבל החלטות מהר בלי חיבור לענן.
אבל אל תמהרו להספיד את שוק הזיכרון. אנליסט ב-D.A. Davidson ציין שהשבבים לא נעלמים – הם פשוט עוברים ממרכזי נתונים למכשירים אישיים. "עדיין תצטרכו GPU, ועדיין תצטרכו זיכרון," הוא אמר. ריצה של AI על מכשירים אישיים יכולה להיות פחות יעילה משימוש בתשתיות מרכז נתונים משותפות, כי השבבים בטלפונים יושבים לפעמים idle.
Micron, שנהנית מזינוק של יותר מ-1,200% ברווח למניה, מעריכה ששוק הזיכרון יגיע ליותר מ-1 טריליון דולר בשנה הבאה – בין היתר בזכות רכב אוטונומי ורובוטיקה. מניית Micron אמנם צנחה במרץ אחרי ש-Google פרסמה מאפיין על צמצום שימוש בזיכרון, אבל התאוששה מאז.
מה הלאה
אפל מנסה לפתור שתי בעיות בו-זמנית: להריץ AI חכם יותר על האייפון בלי לפגוע בפרטיות, ולחזק את תשתית השרתים שהיא מפגרת מאחור. PrismML, מצדה, מתכננת לשחרר גרסה דחוסה של מודל Gemma של Google בקרוב, ואחריה מודלים גדולים הרבה יותר שכיום דורשים חומרת מרכז נתונים.
Counterpoint Research סיכמו את זה יפה: "השילוב של AI בענן ועל המכשיר יכול לספק חוויה מלאה, יעילה ומרכזת פרטיות. משימות מורכבות יעברו לענן, ומשימות רגישות מבחינת פרטיות, זמן תגובה ומידע אישי – יתבצעו על המכשיר."
PrismML שחררה את הגרסאות הדחוסות בחינם. אז אם יש לכם אייפון 15 וזמן פנוי – אתם יכולים לבדוק בעצמכם אם 54 ג'יגה באמת מרגישים כמו 4.