Z.ai מצאה 2,400 פרצות עם מודל AI — ומעכבת את שחרורו
Z.ai הסינית שחררה את GLM-5.3, מודל AI בעל משקלים פתוחים שכבר מצא 2,400 פרצות אבטחה — כולל באגים בקוד שנכתב לפני 40 שנה, בפרויקטים של Linux, VMware ו-Apache. החברה תשחרר את המשקלים רק בעוד שבועיים מסיבות בטיחות, ומודה שלא תוכל לשלוט בשימוש בהם לאחר מכן. הממשל האמריקאי שוקל רגולציה.

מודל שמוצא באגים בקוד בן 40 שנה
Z.ai, חברת AI סינית, שחררה אתמול את GLM-5.3 — מודל בינה מלאכותית בעל משקלים פתוחים (open-weight) שמציג ביצועים מרשימים במיוחד בתחום הסייבר. לפי הנתונים שהחברה פרסמה, המודל כבר הצליח למצוא יותר מ-2,400 פרצות אבטחה ב-269 פרויקטי תוכנה — כולל חלקים מליבת Linux ופרויקטים של VMware ושל Apache. כמחצית מהפרצות דורגו ברמת חומרה בינונית ומעלה, ואחת מהן נמצאה בקוד שנכתב לפני 40 שנה.
אז מה בעצם קרה כאן?
ארכיטקטורה זהה, אימון משודרג
GLM-5.3 מבוסס על אותה ארכיטקטורת Mixture of Experts של קודמו, GLM-5.2, עם 753 מיליארד פרמטרים וחלון קונטקסט של מיליון טוקנים. ההבדל המרכזי הוא בתהליך פוסט-האימון (post-training) — Z.ai לקחה את המודל והכניסה אותו לסביבות סאנדבוקס שמדמות תחנות עבודה של מפתחים אמיתיים. המודל קיבל משימות כתיבת קוד מורכבות, שחלקן דרשו ימים שלמים. המטרה: לשפר את היכולת להתמודד עם "long-horizon tasks" — אותן משימות פיתוח ארוכות שמפתחים מכירים מהחיים האמיתיים.
בשביל לייצר את הסאנדבוקס, Z.ai השתמשה בסוכני AI ייעודיים שהעריכו את סביבות העבודה על בסיס פרויקטים אמיתיים, ויצרו תרגילים מותאמים אישית. סוכן נפרד שימש כשופט, ווידא שהאתגרים פתירים לפני שהועברו למודל.
תוצאות מרשימות, אבל לא לגמרי מרגיעות
GLM-5.3 קבע שיאים במספר בנצ'מרקים:
- Terminal Bench 3.0 (יכולות סקריפטים ב-command line): הציון הגבוה ביותר מבין מודלי AI במשקל פתוח.
- CyberGym (מציאת פרצות אבטחה ידועות): 84.5% — עקף את Claude Mythos 5 של Anthropic.
- ExploitBench (בניית אקספלואיטים לפרצות אמיתיות): מקום שלישי, אחרי Fable 5 ו-GPT-5.6 Sol של OpenAI.
- שיפור של 50% לעומת GLM-5.2 בבנצ'מרק הפנימי של Z.ai לסוכני קוד.
"עולם פתוח לא יכול להשאיר שטחי תקיפה פתוחים"
Z.ai מציגה את המודל ככלי להגנה, לא לתקיפה. החברה הודיעה על תוכנית חדשה שבה מפתחי פרויקטים של קוד פתוח יכולים לבקש מהמודל לסרוק את הריפוזיטורים שלהם כדי לחפש באגים. Hugging Face, למשל, כבר השתמשה ב-GLM-5.2 כדי לחקור פריצה לאחרונה שקשורה למודלים של OpenAI — אחרי שמודלים אמריקאיים סירבו לסייע.
אבל יש בעיה: החברה הודיעה שתשחרר את המשקלים רק בעוד שבועיים, כדי "לבדוק ולחזק בקרות בטיחות ואבטחה". בשלב הראשון תהיה גישה מדורגת (tiered access) רק לשותפים נבחרים בתחום האבטחה. Z.ai מודה בפה מלא: ברגע שהמשקלים יהיו פומביים, היא לא תוכל לשלוט במי שישנה או ישתמש במודל.
מי מפחד מ-open source?
הסיפור הזה מגיע על רקע מתיחות גוברת בין ארה"ב לסין בתחום ה-AI. בעוד חברות אמריקאיות כמו Anthropic ו-OpenAI מאטות את קצב השחרורים מסיבות ביטחוניות, מעבדות סיניות דוחפות קדימה עם מודלי open-weight שמשתפרים במשימות סייבר. חוקרים מ-Dream גילו לאחרונה שסוכני AI בקוד פתוח שימשו לביצוע מתקפת סייבר אוטומטית נגד ממשלת טייוואן.
גם הממשל האמריקאי שוקל דרכים לרגולציה על מודלי open-source כשהיכולות שלהם מתחילות להתחרות במודלים סגורים.
Z.ai בנתה את מערך האימון שלה על טכנולוגיות קוד פתוח — slime (להעברת מודל מסביבת האימון לתשתיות inference) ו-SAO (יישום של למידת חיזוק אסינכרונית שמאיץ את האימון). המודל זמין כרגע דרך שירות המנויים GLM Coding Plan.
בסופו של דבר, GLM-5.3 הוא דוגמה קלאסית לחרב פיפיות: אותו מודל שמוצא באגים בקוד של Linux יכול, בתיאוריה, למצוא אותם גם כדי לנצל אותם. השאלה הגדולה היא אם שבועיים של בדיקות בטיחות באמת עושים הבדל.