AI + BENCHMARK

    ידיעות בינה מלאכותית בנושא BENCHMARK

    גיוס ענק ל-Instinct: 350 מיליון דולר לפי שווי של 2.5 מיליארד דולר

    Instinct, סטארטאפ לעוזר AI אישי שהוקם על ידי יזם בן 23, גייס 350 מיליון דולר לפי שווי של 2.5 מיליארד דולר. המוצר עדיין בבטא פרטית ומעורר חששות לפרטיות בגלל תנאי שימוש שמאפשרים גישה תמידית לנתוני המשתמשים.

    גיוס ענק ל-Instinct: 350 מיליון דולר לפי שווי של 2.5 מיליארד דולר

    OpenAI טוענת: שבב ה-AI שלה יעיל יותר ב-Inference

    OpenAI פרסמה את תוצאות הבנצ'מרק הראשונות של Jalapeño, שבב ה-Inference הראשון שפיתחה בעצמה. השבב מציג פי 1.5–1.9 יותר עבודה ליחידת חשמל ופי 1.7–3.6 פחות Latency ממערכות קיימות — כולל ה-GB300 של Nvidia. Jalapeño יוטמע בתשתית החברה עד סוף השנה, ו-OpenAI כבר עובדת על הדור השני והשלישי.

    OpenAI טוענת: שבב ה-AI שלה יעיל יותר ב-Inference

    Manus AI חוזרת לעצמאות אחרי חסימת סין

    Meta מבטלת את עסקת הרכישה של Manus AI בשווי 2 מיליארד דולר לאחר שבייג'ינג חסמה אותה. החברה תחזור לפעול עצמאית מסינגפור, עם Tencent כבעלת מניות מרכזית והכנסות שנתיות של מעל 300 מיליון דולר. הסיפור חושף את המאבק הגיאופוליטי על שליטה ב-AI.

    Manus AI חוזרת לעצמאות אחרי חסימת סין

    מחקר: אף מודל AI לא עובר רבע ממשימות העבודה

    מחקר מקיף של אוניברסיטת ברקלי בחן למעלה מ-1,500 משימות מקצועיות אמיתיות מ-55 תחומים שונים. הממצאים מראים ששום מודל AI, כולל המתקדמים ביותר, לא הצליח לבצע אפילו רבע מהן. במשימות המורכבות ביותר כל המודלים נכשלו לחלוטין, מה שמוכיח שה-AI הנוכחי עדיין רחוק מלהחליף עובדים אנושיים בתפקידים שדורשים קבלת החלטות גמישה בעולם האמיתי.

    מחקר: אף מודל AI לא עובר רבע ממשימות העבודה

    Ollama גייסה 65 מיליון דולר: מהפך בפיתוח AI פתוח

    Ollama, כלי פיתוח AI פופולארי, גייסה 65 מיליון דולר בסיבוב B בהובלת Theory Ventures, ובסך הכול 88 מיליון דולר. עם 8.9 מיליון מפתחים חודשיים ונוכחות ב-85% מ-Fortune 500, החברה מובילה את המעבר למודלים פתוחים – ומראה איך open source יכול להפוך לעסק מצליח.

    Ollama גייסה 65 מיליון דולר: מהפך בפיתוח AI פתוח

    SageMaker AI: תוצאות Benchmark זורמות ל-MLflow

    AWS מרחיבה את SageMaker AI עם אינטגרציה מקורית ל-MLflow לזרימת תוצאות benchmark בזמן אמת, ותמיכה חדשה בניטור מודלים דיסקרימינטיביים עם ספריית Evidently. שתי ההכרזות מאפשרות לצוותי ML לעקוב אוטומטית אחרי ניסויים, לזהות סטיות בייצור ולחסוך עבודת איחוד ידנית — הכול דרך ממשק אחוד.

    SageMaker AI: תוצאות Benchmark זורמות ל-MLflow

    מודלים מתוסכלים: AI מתקשה בחישובים מתמטיים

    מחקר ORCA בחן 5 מודלי AI מובילים ב-500 שאלות מתמטיות. ג'מיני של גוגל ו-Grok-4 (xAI) מובילים עם כ-63% דיוק, אך שיעור הטעויות הממוצע עומד על 40%. רוב הכשלים נובעים מ'חישובים מרושלים' וכשלי לוגיקה. מומלץ לאמת תוצאות קריטיות בכלים מקצועיים.

    מודלים מתוסכלים: AI מתקשה בחישובים מתמטיים

    אקסה מגייסה 85 מיליון דולר ומציבה עצמה כ"גוגל של עידן ה-AI"

    סטארטאפ החיפוש לאקסה (Exa Labs) גייס 85 מיליון דולר בשווי של 700 מיליון דולר, בהובלת Benchmark ובהשתתפות Nvidia. החברה מפתחת מנוע חיפוש ייעודי ל-AI עם ביצועים גבוהים משל גוגל, כולל התאמה אישית של נתונים וסיכום אוטומטי. המימון ישמש להרחבת התשתית החומרתית והגדלת הצוות.

    אקסה מגייסה 85 מיליון דולר ומציבה עצמה כ"גוגל של עידן ה-AI"