AI + RED TEAM

    ידיעות בינה מלאכותית בנושא RED TEAM

    מחקר Anthropic: סוכני AI מחבלים זה בזה

    מחקר חדש של Anthropic מראה שסוכני AI עם מטרות סותרות מנהלים מלחמת שליטה אגרסיבית, כולל שימוש ב-malware. הממצאים מדגישים סיכונים בטיחותיים כאשר סוכנים הופכים אוטונומיים יותר, במיוחד לאחר תקריות כמו פריצה למערכות של Hugging Face. דגמים מסוימים, כמו Mythos 5, מצליחים לפתור סכסוכים בדרכי שלום, בעוד אחרים מעדיפים כוח.

    מחקר Anthropic: סוכני AI מחבלים זה בזה

    OpenAI ו-Anthropic דורשות פיקוח על מודלי AI פתוחים

    OpenAI ו-Anthropic מצאו מכנה משותף נדיר: שתיהן דורשות מהממשל האמריקני להטיל פיקוח על מודלי AI עם משקולות פתוחות, בטענה שהם מסוכנים מדי בלי בדיקות בטיחות. היוזמה מגיעה ברקע הופעת Kimi K3 הסיני — ומעוררת גל ביקורת מצד חברות כמו Nvidia ו-Meta, שטוענות שמדובר בניסיון ללכוד את הרגולציה לטובת מודלים סגורים. מנכ"ל Anthropic הבהיר שהוא לא קורא לאיסור גורף, אלא להתמקד ב-distillation ובשבבים.

    OpenAI ו-Anthropic דורשות פיקוח על מודלי AI פתוחים

    OpenAI בנתה AI שתוקף מודלים — ומוצא פי 6 יותר פרצות מאנשים

    OpenAI חשפה את GPT-Red, מערכת AI פנימית שתוקפת את המודלים שלה כדי למצוא פגיעויות של prompt injection. היא מצליחה ב-84% מהתרחישים לעומת 13% של צוותים אנושיים, וכבר מוטמעת באימון מאז GPT-5.3. המערכת לא תשוחרר — הידע נשאר פנימי ומחזק את המודלים הבאים.

    OpenAI בנתה AI שתוקף מודלים — ומוצא פי 6 יותר פרצות מאנשים