ב-14 באוגוסט 2026, Z.ai (לשעבר Zhipu AI) שחררה את GLM-5.3. היא טענה שזה "אותו base של GLM-5.2, רק post-training". צנוע, אולי. ואז היא פרסמה את המספרים: 84.5% ב-CyberGym (SOTA), 54.4% ב-ExploitBench, 2,436 vulnerabilities אמיתיות שנמצאו ב-269 פרויקטים.
ואז היא עשתה משהו לא צפוי: היא לא שחררה את ה-weights.
ב-26 באוגוסט יצא GLM-5.3-Flash תחת MIT — מודל קטן יותר (320B MoE, 18B active) עם vision ווידאו. אבל ה-flagship, ה-5.3 האמיתי, נשאר סגור ב-API. הסיבה? אותם 2,436 חורי אבטחה.
מה שחשוב לדעת
- GLM-5.3 שוחרר ב-14 באוגוסט — אותו base של GLM-5.2, post-training בלבד על cyber focus
- CyberGym: 84.5% — SOTA בקטגוריה, מעל GLM-5.2 (77.2%)
- ExploitBench: 54.4% — כמעט פי 2 מ-GLM-5.2 (24.4%)
- 2,436 vulnerabilities ב-269 פרויקטים אמיתיים; 1,097 medium/high severity; 53 CVEs פומביים
- Weights של ה-flagship לא שוחררו — Z.ai מתעקשת על safety evaluation לפני
- מקרה Cursor: architectural flaw "potentially serious" נמסר לפני חשיפה
- GLM-5.3-Flash (26 באוגוסט): 320B MoE, 18B active, MIT, vision+video, $0.15/$0.50 למיליון
מה הופך את GLM-5.3 למיוחד
כדי להבין למה ה-weights לא שוחררו, צריך להבין מה הוא עושה. GLM-5.3 לא "חדש" בארכיטקטורה — זה אותו ~750B MoE של GLM-5.2, 40B active per token, 1M context. מה שהשתנה זה post-training.
ארכיטקטורה
| פרמטר | ערך |
|---|---|
| ארכיטקטורה | MoE |
| Total params | ~743-753B |
| Active per token | ~40B |
| Context | 1M tokens |
| Max output | 128K |
| Modalities | text-only (אין vision!) |
| Thinking | חובה (enabled, low/high/max) |
ההחלטה להשאיר text-only היא לא טעות — היא אסטרטגיה. Z.ai לא רצתה לבזבז capacity על modalities שלא תורמים ל-cyber capability. כל פרמטר שלא משפר vulnerability discovery הוא פרמטר מבוזבז. בעולם שבו Kimi K3 גאה במודל multimodal שלה, GLM-5.3 מתמקדת בעומק אחד ועושה אותו טוב יותר מכל אחד אחר.
מחיר
| Token | מחיר למיליון |
|---|---|
| Input | $1.40 |
| Output | $4.40 |
| Cached input | $0.26 |
זהה ל-GLM-5.2 — בלי עליית מחיר. Z.ai מציגה את ה-Intelligence Index cost ב-$0.68 per task — הזול ב-frontier cluster. החיסכון לעומת Claude Opus 5 ($5/$25) הוא 72%, ולעומת GPT-5.6 Sol ($3.50/$14) הוא 60%. זה לא שולי — זה ההבדל בין סטארטאפ שמריץ את המודל ב-production לבין סטארטאפ שעוצר ב-POC.
ה-Benchmarks — המספרים שמפחידים את הקהילה
Coding/agentic
| Benchmark | GLM-5.2 | GLM-5.3 | Kimi K3 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | 17.4 | 33.7 | 34.6 |
| DeepSWE v1.1 | 46.2 | 66.9 | 67.5 | 69.7 | 72.7 |
| SWE-Marathon v1.1 | 19.4 | 42.5 | 48.1 | — | — |
| Terminal-Bench 2.1 | 81.0 | 88.2 | 88.3 | — | 88.8 |
| AutomationBench | 26.2% | 48.2% | 46.7% | 46.2% | 45.8% |
| HLE (with tools) | 54.7% | 62.5% | 59.8% | 63.9% | 64.5% |
הקפיצה ב-Terminal-Bench 3.0 מ-4.6 ל-28.3 היא מטורפת. זה פי 6. הקפיצה ב-SWE-Marathon מ-19.4 ל-42.5 היא יותר מפי 2. אלה לא שיפורים הדרגתיים — זה קפיצת מדרגה. מה שהשתנה ב-post-training הוא לא "כוונון עדין", זה שינוי פרדיגמה: המודל עכשיו רואה את ה-IDE כמו agent מקצועי שמבין context engineering, לא רק כמו chatbot שמחזיר קטעי קוד.
Cyber (הסיפור האמיתי)
| Cyber benchmark | GLM-5.2 | GLM-5.3 | הערות |
|---|---|---|---|
| CyberGym | 77.2% | 84.5% | SOTA |
| ExploitBench | 24.4% | 54.4% | יותר מפי 2 |
| ExploitGym solves (2hr budget) | 29 | 105 | +362% |
Intelligence Index (Artificial Analysis): 60 — מתחת ל-Grok 4.6 ו-GPT-5.6 Sol Max (61), ברמה של Kimi K3.
Output speed: 84.7 tokens/sec — מעל 74 t/s median, יותר מכפול מ-Kimi K3 (38.2 t/s).
הקפיצה ב-ExploitGym solves מ-29 ל-105 היא המספר שצריך להדאיג את הקהילה. זה לא רק "הצליח יותר מבחנים" — זה "הצליח 105 exploits שונים בתוך שעתיים budget". כל אחד מה-105 האלה הוא exploit עובד. הכלי הזה יכול לרוץ על codebase חדש ולמצוא דרך לפרוץ אותו תוך שעתיים. זו בדיוק הסיבה ש-Z.ai לא משחררת את ה-weights.
הסיפור של 2,436 חורי האבטחה
Z.ai פרסמה נתון יוצא דופן: במהלך ה-red team testing של GLM-5.3, המודל מצא 2,436 vulnerabilities ב-269 פרויקטים אמיתיים. מתוכם:
- 1,097 דורגו medium/high severity
- 53 CVEs שוחררו ב-launch
- השאר תחת embargo (תיקון פנימי לפני חשיפה)
המשמעות: המודל הוא לא רק "טוב ב-cyber benchmarks" במבחני בית — הוא מוצא בעיות אמיתיות בקוד production. ההבדל בין benchmark לבין real-world הוא ההבדל בין "לעבור את המבחן בנהיגה" לבין "לנהוג בפועל בתל אביב בשעת עומס". GLM-5.3 עובר את שניהם. זה הנדיר.
מקרה Cursor
Z.ai טענה ש-GLM-5.3 מצא architectural flaw "potentially serious" ב-Cursor (ה-coding IDE הפופולרי). הם:
- יצרו קשר עם הצוות של Cursor לפני חשיפה
- שיתפו את הפרטים ב-private disclosure
- לא פרסמו CVE פומבי עד שיצא patch
- אין אימות עצמאי — רק טענה של Z.ai
למה זה חשוב: זו הפעם הראשונה שספקית סינית מדווחת על vulnerability לחברה אמריקאית בקוד פתוח לפני חשיפה. זה precedence. חיובי? כנראה. מפחיד? גם.
הצד החיובי: Z.ai בחרה לעקוב אחרי responsible disclosure. היא יכלה לפרסם את הפלא הציבורי, לקבל marketing מטורף, ולהשאיר את Cursor חשופים. היא בחרה אחרת. זה ראוי להערכה.
הצד המפחיד: ספקית AI סינית יכולה למצוא architectural flaws במוצרי AI אמריקאיים. עד 2026, הקונצנזוס בתעשייה היה שספקיות סיניות "מאחרות בקילומטרים" ביכולת cyber. GLM-5.3 מפרק את ההנחה הזו. אם Z.ai יכולה למצוא architectural flaw ב-Cursor, מה היא יכולה למצוא ב-VSCode, ב-GitHub Copilot, או בכלי פנימי של חברה גדולה יותר? התשובה הצנועה: כנראה הרבה.
למה 87% מה-CVEs פתוחים
הנתון ש-Z.ai חושפת 87% מה-CVEs שהמודל מצא (53 מתוך 61 potential public CVEs) הוא חשוב משתי סיבות.
ראשית, זה שקיפות אמיתית. הרוב המוחלט של הספקיות AI מעדיפות לדווח רק על CVEs שאושרו על ידי המוצר. Z.ai בחרה לפרסם גם CVEs שהם בטוחים שקיימים, גם אם המוצר לא אישר אותם רשמית. זה דורש אומץ.
שנית, זה benchmark לתעשייה. אם הציפייה ב-2027 היא שכל ספקית AI תפרסם 80%+ מה-CVEs שהמודלים שלה מוצאים, אז Z.ai הציבה את הסטנדרט. אם הציפייה תישאר "תפרסם רק CVEs שאושרו", אז Z.ai תיחשב כחריגה.
למה ה-weights לא שוחררו
הצהרת Z.ai
"Z.ai delayed the open-weight release by about two weeks — targeted for late August 2026 — explicitly to complete safety evaluation and hardening first" — Axios
הסיבה הרשמית: safety. Z.ai אמרה שהיא רוצה לוודא שהמודל לא ישמש לכתיבת exploits.
הסיבה הלא-רשמית: המתחרים. כל מי שיש לו את ה-weights של GLM-5.3 יוכל להריץ cyber red-teaming בעצמו. הסיכון למוניטין של Z.ai (ולסנקציות אמריקאיות) עולה.
והסיבה השלישית, שאף אחד לא אומר בקול: revenue protection. ה-API של GLM-5.3 מייצר הכנסות ישירות. כל לקוח שמוריד את ה-weights הוא לקוח שמפסיק לשלם על ה-API. עם 105 exploit solves לשעה, כלי חינמי הופך לתחרות ישירה ל-Shodan, ל-Burp, ל-Nuclei. Z.ai לא רוצה ליצור את התחרות הזו.
המקבילה: GPT-5.6-Cyber
ב-10 באוגוסט, ארבעה ימים לפני GLM-5.3, OpenAI שחררה את GPT-5.6-Cyber — גישה approval-only. רק חברות שעוברות סינון יכולות להשתמש.
שתי חברות באותו שבוע, אותה החלטה: "cyber capability זה process, לא price list".
זה לא coincidence. שתי הספקיות ראו את אותו דאטה: ככל שהמודל טוב יותר ב-cyber, כך הוא מסוכן יותר בידיים הלא נכונות. הן בחרו להגביל גישה. השאלה אם זה יחזיק לאורך זמן היא שאלה אחרת — אבל הקונצנזוס בקרב הספקיות הגדולות הוא ש-cyber capability דורשת gatekeeping.
מה שיצא במקום
GLM-5.3-Flash (26 באוגוסט, MIT):
- 320B MoE, 18B active per token
- Vision + video + text
- $0.15 / $0.50 למיליון tokens
- Native 1M context
זה לא flagship. זה ה-fallback הזול והפתוח. Z.ai משחררת את מה שהיא יכולה להרשות לעצמה. ה-Flash לא מצטיין ב-cyber (benchmark מוערך ב-60% CyberGym, נתון שלא פורסם רשמית), אבל הוא כן multimodal, מהיר, וזול. זה מספיק טוב ל-95% מהשימושים — לא ל-cyber capability רצינית.
השוואה מול Kimi K3
Kimi K3 הוא המתחרה הכי קרוב. שניהם סיניים, שניהם open-ish, שניהם סביב ה-40B active:
| מאפיין | GLM-5.3 | Kimi K3 |
|---|---|---|
| Total params | ~750B | ~700B (הערכה) |
| Active | 40B | ~38B |
| License | API-only | Open |
| Vision | ❌ | ✅ |
| Cyber focus | חזק מאוד | בינוני |
| Coding (DeepSWE) | 66.9 | 67.5 |
| Terminal-Bench 2.1 | 88.2 | 88.3 |
| Output speed | 84.7 t/s | 38.2 t/s |
| Intelligence Index cost | $0.68 | (higher) |
המסקנה: GLM-5.3 טוב יותר ב-cyber, מהיר יותר, זול יותר. Kimi K3 טוב יותר ב-coding agents (במעט), ויש לו weights.
ההבדל המהותי הוא לא בביצועים — הוא במודל העסקי. Kimi K3 משחררת weights, מה שמאפשר self-hosting מלא, fine-tuning, ושליטה ב-data residency. GLM-5.3 דורש API, מה שמגביל את השימוש ל-data שאתה מוכן לשלוח לסין. עבור סטארטאפ ישראלי שמטפל ב-PII של לקוחות, זה לא trade-off — זו דרישת סף.
מה זה אומר למי שעובד ב-dev/security
אם אתה באפליקציית SaaS רגילה
GLM-5.3 זה API סיני. כמה דברים שכדאי לחשוב עליהם:
- data residency — ה-requests עוברים דרך API של Z.ai; אם אתה באירופה או בישראל, זה יכול להיות בעייתי לפי GDPR
- pricing — $1.40/$4.40 זול ב-70% מ-Claude Opus 5 ($5/$25)
- availability — אין SLA שווה לאמריקאי; uptime יכול להיות נמוך יותר
- output speed — 84.7 t/s (מהיר!) מתאים ל-real-time applications
אם אתה ב-security/red-team
GLM-5.3 הוא הכלי הכי טוב ב-2026 לאיתור vulnerabilities אוטומטי. השאלה היא האם אתה יכול לגשת אליו:
- כן: אם אתה חברה רשומה או אם אתה עובד דרך API-approved partner
- לא: אם אתה יחיד; ה-onboarding דורש KYC
ה-KYC דורש בדרך כלל רישום עסקי, תעודת זהות של הנציג, ו-use case description. זמן האישור: 3-7 ימי עסקים. אם אתה צריך POC דחוף, זה לא הכלי בשבילך. שקול DeepSeek Cyber או Qwen3.8-Max במקום.
אם אתה רוצה open-source
לא GLM-5.3 — weights לא שוחררו. כן GLM-5.3-Flash — MIT, אבל לא אותה ביצועים. כן Kimi K3 — Open, agentic, multimodal. כן DeepSeek V4-Pro — MIT, frontier.
המסקנה המעשית: אם אתה רוצה cyber capability ב-open weights, האפשרות היחידה ב-2026 היא DeepSeek Cyber (אם יצא) או fine-tune של Kimi K3 על cyber data. שתי האפשרויות עולות לך במאמץ engineering משמעותי, אבל מקנות לך שליטה מלאה.
למי זה משנה — הזווית של הסטארטאפ הישראלי
הנה החלק שלא תמצאו במסמך הרשמי של Z.ai: GLM-5.3 הוא לא רק "עוד מודל סיני". הוא מאותת שלושה דברים שצריכים לעניין כל מי שבונה מוצר AI בישראל.
ראשית, סוף עידן ה-API-only dominance. עד 2026, רוב הסטארטאפים בתל אביב בנו על Claude API או OpenAI API. GLM-5.3 מראה שהספקיות הסיניות יכולות להציע איכות זהה ב-cyber ב-30% מהמחיר. עבור סטארטאפ בשלב seed שמשלם $20K לחודש ל-Claude Opus, המעבר ל-GLM-5.3 חוסך $14K — משכורת שלמה של senior engineer.
שנית, ה-KYC הוא barrier אמיתי. Z.ai לא מוכרת לכל אחד. היא דורשת KYC, היא בודקת use case, היא רוצה לדעת מי אתה. עבור סטארטאפ ישראלי שרוצה POC בן שבוע, זה friction רציני. אם אתה לא נרשם היום, אתה לא תהיה ב-production בעוד חודש.
שלישית, ה-cyber capability הזה הופך ל-commodity. היום זה GLM-5.3, מחר זה DeepSeek Cyber, מחרתיים זה משהו אחר. החברות שמתעקשות לבנות vulnerability scanning על GPT-4 ישלמו פי 5 תוך שנה. הזמן לעבור הוא עכשיו.
בנוסף, יש כאן עניין של strategic positioning. אם אתה בונה SaaS ל-appsec, אתה צריך להחליט: אתה מציג "AI-powered vulnerability scanning" או "AI-powered vulnerability scanning עם GLM-5.3"? הראשון הוא marketing. השני הוא הצהרת אמון בספקית סינית. בעולם ה-enterprise, במיוחד בפיננסים וב-healthcare, ההבדל הזה קובע אם ה-customer יקנה או ילך ל-Checkmarx.
ולבסוף, רגולציה. רשות הסייבר הישראלית לא פרסמה עמדה רשמית על מודלים סיניים, אבל היא עוקבת. בעולם שבו CISA בארה"ב כבר פרסמה guidance נגד שימוש במודלים מסוימים, השאלה אם ישראל תלך בעקבותיהן היא לא "אם" אלא "מתי". הסטארטאפים שבונים היום על GLM-5.3 צריכים לחשוב על exit strategy: מה עושים כש-Z.ai תחסם?
מה הלאה — ספטמבר-אוקטובר 2026
הציר של החודשיים הקרובים ברור:
- סוף ספטמבר: אם Z.ai תשחרר את ה-weights, זה יהיה עם custom license, לא Apache. הקהילה תגיב. רוב התגובות צפויות להיות שליליות — "זה לא באמת open".
- תחילת אוקטובר: Z.ai צפויה להכריז על GLM-5.4 training run. ה-budget מוערך ב-$200M+. השאלה האם הם יחזרו על האסטרטגיה של "post-training בלבד" או יאמנו מחדש.
- אמצע אוקטובר: OpenAI צפויה להרחיב את GPT-5.6-Cyber לשווקים נוספים. ה-approval process ישתנה.
- סוף אוקטובר: Llama 5 של Meta צפוי. אם הוא יהיה ב-MIT (ספקולציה), הוא יהפוך את GLM-5.3 לפחות רלוונטי לקוד פתוח.
מה אני עוקב אחריו: אם Z.ai תשחרר weights עם custom license דומה ל-Qwen, זה יהיה הסימן ש-"conditional open source" הופך לנורמה. אם לא — זה יהיה anomaly.
עוד נקודה: הקרב על ה-cyber benchmark הולך להחריף. עד אוקטובר 2026, אני מצפה לראות לפחות שני מודלים נוספים שיפרסמו CyberGym scores מעל 80%. ה-cyber capability הופך ל-frontier metric חדש, במקביל ל-coding ו-reasoning. מי שלא יהיה שם, יישאר מאחור.
הטבלה המסכמת
| מאפיין | GLM-5.3 | GLM-5.3-Flash |
|---|---|---|
| שחרור | 14 באוג' | 26 באוג' |
| Params | ~750B | 320B |
| Active | 40B | 18B |
| License | API-only | MIT |
| Modalities | text | text + image + video |
| Context | 1M | 1M |
| מחיר (input) | $1.40 | $0.15 |
| מחיר (output) | $4.40 | $0.50 |
| Cyber focus | חזק מאוד | בינוני |
שאלות נפוצות
למה Z.ai לא שחררה את ה-weights של GLM-5.3? שילוב של סיבות: (1) cyber capability גבוה, רגולטורים יכולים להגיב; (2) תחרות עם OpenAI שגם הגבילה את GPT-5.6-Cyber; (3) Z.ai רוצה למקסם הכנסות API לפני commoditization.
האם ה-weights ישוחררו בסוף? Z.ai אמרה "late August 2026". נכון לסוף אוגוסט, לא יצאו. סביר שיצאו (אולי) בספטמבר-אוקטובר, אבל הם לא יהיו ברישיון Apache.
האם אני יכול לסמוך על ה-2,436 vulnerabilities? באופן עקרוני כן — Z.ai שיתפה את ה-CVE list וגם חלק מה-architectural flaws ה-private. אבל אין אימות עצמאי מלא. קח את המספר עם 10% skepticism.
מה ההבדל בין GLM-5.3 ל-GLM-5.2 בפועל? ה-base זהה. ההבדל הוא post-training: כוונון מחודש על cyber data, RL על exploit generation, ו-fine-tuning על vulnerability discovery. כל השאר זהה.
האם GLM-5.3-Cyber יותר מסוכן מ-GPT-5.6-Cyber? שניהם מוגבלים בגישה. GLM-5.3 יותר זמין לאימות אבטחה (87% מה-CVEs פתוחים), אבל ה-weights שלו לא — מה שאומר שה-attack surface נשלט. GPT-5.6-Cyber דורש approval, מה שאומר פחות שקיפות.
למה Z.ai לא הוציאה את GLM-5.4 במקום לחכות ל-weights של 5.3? משאבים. אימון GLM-5.4 עולה $200M+. הם בחרו לחזק את ה-5.3 במקום להתחיל training run חדש.
האם כדאי להעביר את ה-vulnerability scanning שלי ל-GLM-5.3? תלוי בסקטור. אם אתה ב-finance, healthcare, או government — לא, בגלל data residency וספק סיני. אם אתה ב-SaaS B2B כללי, ואתה מוכן לעבור KYC — כן, החיסכון מצדיק את המעבר. עשה POC של שבועיים לפני שאתה מחליט.
מה הסיכון הרגולטורי בשימוש ב-API של Z.ai בישראל? נמוך כרגע, אבל לא אפס. רשות הסייבר הישראלית לא פרסמה הנחיה רשמית נגד שימוש ב-API סיני, אבל היא עוקבת. בקטגוריות רגישות (ביטחון, פיננסים, תשתיות), ההמלצה היא להימנע או להריץ locally את GLM-5.3-Flash תחת MIT.
מה ההבדל בין fine-tuning של GLM-5.3-Flash על cyber data לעומת שימוש ב-API של GLM-5.3? GLM-5.3-Flash אינו אותו מודל. ה-Flash הוא 18B active מול 40B active ב-flagship. גם אם תעשה לו fine-tuning על cyber data, לא תגיע לביצועים של ה-flagship. ההבדל בניהם הוא בסדר גודל של 50%+. עבור סטארטאפ שרוצה cyber capability רצינית, אין תחליף ל-flagship.
האם Z.ai תשחרר את GLM-5.3 תחת Apache אחרי תקופת safety evaluation? ספקני. הדפוס בתעשייה הוא "safety evaluation" שהופך ל-"safety evaluation extension", שהופך ל-"commercial license required". Z.ai כנראה תשחרר את ה-weights תחת רישיון דומה ל-Qwen (commercial floor), לא Apache מלא.
סיכום
GLM-5.3 הוא הסיפור שמוכיח שב-2026, "open weights" ו-"cyber capability" הם לא באותו סקטור. ככל שמודל טוב יותר ב-cyber, כך גדל הסיכוי שיישאר סגור. Z.ai עשתה את הבחירה הזו. OpenAI עשתה אותה. Anthropic לא צריכה — Claude Cowork Cyber הוא enterprise-only.
לטווח ארוך, השאלה לא תהיה "האם ה-weights של GLM-5.3 ישוחררו". השאלה תהיה "האם ה-weights של GLM-5.4, 6.0, ו-7.0 ישוחררו". אם התשובה היא "לא", הקוד הפתוח לא ימות — הוא פשוט יעבור לרמה שמתחת ל-flagship. וזה מצב שבו ה-corporate AI נשאר בעליונים.
מקורות
- BenchGen Model Card: https://benchgen.com/models/zhipu-ai/glm-5-3
- AI Rankings: https://theairankings.com/zhipu/glm-5-3/
- Artificial Intelligence News: https://www.artificialintelligence-news.com/news/zhipu-glm-5-3-benchmarks-explained/
- Z.ai Subscribe: https://z.ai/subscribe
- Z.ai Docs: https://docs.bigmodel.cn/cn/guide/models/text/glm-5.2
- Axios: https://www.axios.com/
- AI Apps: https://www.aiapps.com/blog/ai-news-august-breakthroughs-launches-trends-cant-miss/
- Prompt AI Learning: https://promptailearning.com/ai-news/monthly/ai-news-recap-august-2026-every-story-that-mattered
- Yotta Labs: https://yottalabs.ai/
- MindStudio: https://mindstudio.ai/
`
מאמרים קשורים
מהקריאה לבנייה
יש לכם מערכת שצריכה לעבוד עם AI?
אני עוזר לעסקים להפוך מודלים, אוטומציות ותשתיות מאובטחות למערכות שאפשר להפעיל בפרודקשן.
בואו נדבר על הפרויקט