ב-12 באוגוסט 2026 Alibaba פתחה לראשונה מודל Max-class. שלושה ימים לאחר מכן Meta חזרה לקוד פתוח אחרי שנה של הפסקה. שלושה ימים אחרי זה DeepSeek שחררה את V4-Pro תחת MIT. עשרה ימים, שלוש מעבדות, שלוש קטגוריות חדשות של "קוד פתוח".
אם אתם חושבים שזה סיפור של "עוד גרסאות חינם", תחשבו שוב. מה שקרה באוגוסט 2026 זה הסטה של כוח מה-frontier closed (OpenAI, Anthropic) אל ה-frontier open (Alibaba, Meta, DeepSeek). והסטה הזו לא תחזור אחורה.
מה שחשוב לדעת
- 3 באוגוסט: Alibaba מכריזה על Qwen3.8-Max (2.4T params, MoE); weights ב-12-14 באוגוסט
- 10 באוגוסט: Meta משחררת את Muse Glimmer (30B Apache 2.0); ~121K הורדות תוך ימים
- 13 באוגוסט: DeepSeek משחררת את V4-Pro (1.6T, MIT); מיד #3 ב-Artificial Analysis Intelligence Index
- שלוש קטגוריות שונות של רישיון: Apache 2.0 (Meta + Qwen3.8-27B), MIT (DeepSeek V4-Pro + GLM-5.3-Flash), Custom Qwen (Qwen3.8-Max flagship)
- מסקנה: 60-90% מהביצועים של closed frontier, ב-10-30% מהמחיר
- משמעות לסטארטאפים ישראליים: יותר אפשרויות, פחות תלות ב-API של ארה"ב
למה 10 ימים אלה חשובים כל כך
עד אוגוסט 2026, "קוד פתוח" ב-AI היה תחבולה שיווקית. היו:
- Llama 3 (Meta) — Apache-style license אבל עם סעיפים מגבילים
- Mistral 7B (Mistral) — Apache 2.0 אבל קטן, לא frontier
- Qwen2.5 (Alibaba) — Apache 2.0 אבל בגודל בינוני
- DeepSeek V3 — MIT אבל לא ברמה של GPT-5.6
במשך 18 חודשים, כל מי שרצה ביצועי frontier היה חייב לשלם ל-OpenAI או Anthropic. מודלים פתוחים היו "close enough" — טובים לפרויקטים קטנים, אבל לא ל-product.
אוגוסט 2026 שינה את זה. כל אחת מהשלוש יצרה קטגוריה חדשה:
- Alibaba: פתחה את ה-Max tier (הדגל) — משהו שאף אחד לא עשה
- Meta: חזרה לקוד פתוח אחרי הפסקה של שנה אחרי Llama 4 המאכזב
- DeepSeek: הביאה MIT ל-frontier — משהו שלא היה קיים
התוצאה: מה שהיה "קוד פתוח" עד אוגוסט 2026 הוגדר על ידי היעדר ה-choice של המשתמש. היום ה-choice קיים, וזה מה שמשנה את המשוואה. הקטגוריה עצמה זזה: מ-utility open (Llama 3) → small open (Mistral) → medium open (Qwen2.5) → ועכשיו → frontier open עם רישיון permissive מלא.
טבלת ההשוואה הגדולה — שלושת הדגלים
| מאפיין | Qwen3.8-Max | Meta Muse Glimmer | DeepSeek V4-Pro |
|---|---|---|---|
| תאריך weights | 12-14 באוג' | 10 באוג' | 13 באוג' |
| Total params | 2.4T (MoE) | 30B (dense) | 1.6T (MoE) |
| Active params | 95B | 30B | 49B |
| Context | 1M (API), reduced (weights) | 128K | 1M |
| רישיון | Custom Qwen License | Apache 2.0 | MIT |
| מחיר API | $2 / $6 למיליון | closed (?) | up after 16/8 |
| Multimodal | text + image + video | text + image + audio | text |
| שפות | 100+ | 100+ | 100+ |
| חומרה מינימית | H100 cluster | 24GB consumer GPU | H100 cluster |
| Terminal-Bench 2.1 | 86.6 | ~72 (הערכה) | 87.9 |
| OSWorld-Verified | 86.1 | — | — |
Qwen3.8-Max — הפתיחה של ה-Max tier
מה חדש: זה המודל הראשון בקטגוריית Max ש-Alibaba משחררת בקוד פתוח. עד עכשיו, Max-class (Qwen3-Max, Qwen3.7-Max) היו API-only.
מה הוא מציג:
- RecreationBench — המודל הצליח לעבוד 16 ימים אוטונומית, יצר 265 commits, 127 PRs, 151 issues — בלי שום human commit
- Terminal-Bench 2.1: 86.6 (מול 74.5 ב-Qwen3.7-Max)
- SWE-bench Pro: 67.7 (Fable 5 מוביל ב-80)
- PaperBench: 93.0 (מוביל מול GPT-5.6 Sol ב-90.5)
הבעיה: הרישיון. "Custom Qwen License" הוא לא Apache ולא MIT. הוא כולל סעיף commercial floor שמחייב רישיון נפרד אם אתה מפעיל "model-as-a-service" עם מעל $50M TTM revenue.
למי זה טוב: חברות ענק שיכולות לחתום חוזה. לא לסטארטאפים. למי זה לא טוב: סטארטאפים שרוצים לבנות מוצר מסחרי על המודל הזה.
הקטן שכן פתוח: Qwen3.8-27B תחת Apache 2.0 מלא — 24GB consumer GPU, native vision, 262K context. זה המודל שהרוב המוחלט שלכם צריך.
משמעות לסטארטאפים בתל אביב: ה-Max tier הוא הוכחה-קונספט של "open weights ברמה גבוהה ביותר". גם אם הרישיון לא מתאים ל-MVP שלכם, הוא קובע baseline שכל השוק יישר אליו. סביר להניח שב-Q1 2027 נראה וריאציות community (forks תחת Apache) שיורידו את המגבלות.
Meta Muse Glimmer — החזרה של מטא
מה חדש: מטא לא שחררה שום דגם פתוח מאז Llama 4 ב-2025. Muse Glimmer (10 באוגוסט) הוא הסימן שהם חזרו.
למה זה מפתיע: הצוות של מטא (FAIR) כבר היה מתוסכל מ-Llama 4. עם Muse Glimmer, מטא מנסה משהו אחר:
- 30B dense (לא MoE) — קל להריץ על GPU אחד
- Apache 2.0 אמיתי, בלי סעיפים חבויים
- Multimodal — text, image, audio
- 128K context
- 100+ שפות
ביצועים: לא ברמה של frontier, אבל טוב מספיק ל-90% מה-use cases. בתוך ימים ספורים — 121,000 הורדות ב-Hugging Face.
החשוב: זה לא מודל "flagship". זה מודל "כלי עבודה". וזה בדיוק מה שצריך ל-90% מהפרויקטים ב-AI כיום.
Muse Spark 1.2 (הדגל הגדול יותר) צפוי לצאת תחת Llama Community License. הרישיון הזה כבר הוכח כבעייתי — Llama Community License הוא "Open" במובן מסוים, אבל לא Apache.
טיפ לסטארטאפים: Muse Glimmer הוא ה-Apache 2.0 multimodal הראשון מ-Meta שעובד על 24GB consumer GPU (Apple Silicon, RTX 4090). זה שינוי של משחק ל-internal tools — ניתן להריץ local לכל הצוות בלי לשלוח data החוצה.
DeepSeek V4-Pro — ה-MIT הראשון בקצה
מה חדש: רישיון MIT מלא. אין סעיפים. אין תקרת הכנסה. אין carve-outs. תורידו, תריצו, תמכרו — תעשו מה שאתם רוצים.
המספרים:
- 1.6T params, 49B active per token
- 1M context
- Terminal-Bench 2.1: 87.9 (מול 88.8 של GPT-5.6 Sol — 1 נקודה מתחת!)
- Artificial Analysis Intelligence Index: #3 globally
למה זה חשוב: DeepSeek היא החברה שפתחה את "מלחמת המחירים" של 2025. אחרי שנה של חיתוך, באוגוסט 2026 היא העלתה מחירים (16 באוגוסט, peak/off-peak billing). זה הסימן הכי ברור שהמלחמה נגמרה.
אבל ה-MIT license שלה נשאר. וזה מה שמשנה לעצמאים: יש לכם גישה ל-frontier performance, עם רישיון שמאפשר כל שימוש מסחרי, בלי לשלם לסינגפור, לאמריקאים או ל-API gateway.
למי זה משנה בעולם הישראלי: כל חברה שמתמודדת עם רגולציית data residency (פיננסים, healthcare, gov/defense) צריכה לבחון V4-Pro היום. ה-MIT מאפשר self-host בענן פרטי (AWS GovCloud, Azure IL4) בלי חובת דיווח לספק זר.
ההשפעה על השוק הישראלי
אם אתם בונים product ב-AI ב-2026, יש לכם יותר אפשרויות מתמיד:
לפרויקט קטן/בינוני (MVP, prototype, internal tool):
- Meta Muse Glimmer — Apache 2.0, 30B, 24GB GPU. רץ על M3 Max שלכם.
- Qwen3.8-27B — Apache 2.0, multimodal, 262K context.
לפרויקט בינוני-גדול (product, SaaS, multi-tenant):
- DeepSeek V4-Pro — MIT, 1.6T params. צריך GPU cluster אבל אין תלות בספק.
- GLM-5.3-Flash — MIT, 320B MoE, 18B active, vision+video. $0.15/$0.50 למיליון tokens — כמעט חינם.
לפרויקט enterprise (B2B, regulated):
- Qwen3.8-Max API — תשלמו $2/$6 אבל תקבלו 1.6T performance עם SLA.
- Anthropic / OpenAI API — אם הלקוח דורש אמריקאי.
ההבדל הגדול: עד אוגוסט 2026, רוב הסטארטאפים הישראליים השתמשו ב-OpenAI API בגלל שאין חלופה. היום יש. זה שינוי גיאופוליטי: פחות תלות ב-cloud אמריקאי, יותר אופציה להריץ on-prem.
החלטות תשתית לסטארטאפ ישראלי טיפוסי
ה-flow הסביר לסטארטאפ בשלב Series A שבונה product B2B:
- MVP (חודש 1-3) — Meta Muse Glimmer self-host. עלות = חומרה. אין צורך ב-SLA.
- Product-market fit (חודש 4-9) — GLM-5.3-Flash API ($0.15/$0.50). הכי זול ל-traffic גבוה, רישיון MIT מאפשר fallback עצמאי.
- Scale (חודש 10+) — DeepSeek V4-Pro self-host אם ה-traffic מצדיק GPU cluster (~$30K-$100K לחודש), או OpenAI API אם הלקוח דורש אמריקאי.
המסקנה: בכל שלב יש חלופה יציבה. זה ההבדל מ-2024, שבו החלופה היחידה הייתה OpenAI או Anthropic.
השוואת מחירים — סגור מול פתוח
| מודל | Input $/M | Output $/M | רישיון |
|---|---|---|---|
| GLM-5.3-Flash | 0.15 | 0.50 | MIT |
| Qwen3.8-27B (self-host) | free* | free* | Apache 2.0 |
| Meta Muse Glimmer (self-host) | free* | free* | Apache 2.0 |
| DeepSeek V4-Pro (API) | ~0.50 peak | ~1.50 peak | MIT |
| Qwen3.8-Max (API) | 2.00 | 6.00 | Custom |
| Grok 4.6 | 2.00 | 6.00 | Closed |
| Kimi K3 | 3.00 | 15.00 | Open |
| GPT-5.6 Sol | 4.00 | 20.00 | Closed |
| Claude Opus 5 | 5.00 | 25.00 | Closed |
*\** self-host = עלות חומרה בלבד*
למה המחיר חשוב לא פחות מהמספרים: בטווח של 1B tokens לחודש, ההפרש בין GLM-5.3-Flash ($0.50 output) ל-Claude Opus 5 ($25) הוא פקטור של 50x. לסטארטאפ שמוציא $200K לחודש על inference, זה $3.8M לשנה. זה המשכורות של חצי צוות.
השוואת קטגוריות — מי המנצח בכל נישה
| קריטריון | מנצח | הסיבה | תרחיש מומלץ |
|---|---|---|---|
| ביצועים גולמיים (TB2.1) | GPT-5.6 Sol | 88.8 | כשצריך ביצוע מקסימלי, ללא פשרות |
| ביצועים פתוחים | DeepSeek V4-Pro | 87.9 MIT | כשרוצה performance + freedom |
| רישיון permissive | DeepSeek V4-Pro | MIT מלא | product מסחרי בלי carve-outs |
| נגישות consumer GPU | Meta Muse Glimmer | 30B, 24GB | prototype + internal tools |
| מחיר נמוך | GLM-5.3-Flash | $0.15 / $0.50 | high-volume, cost-sensitive |
| Multimodal רחב | Qwen3.8-Max | image+video native | vision/video pipelines |
| Latency output | Qwen3.8-27B | dense 27B | chatbots, real-time agents |
| Multilingual (עברית) | Qwen3.8-Max | 100+ שפות | כשצריך עברית בצורה רצינית |
| Long context | Qwen3.8-Max / V4-Pro | 1M | legal/finance doc analysis |
שורה תחתונה: אין מנצח אחד. יש סט של מנצחים לפי תרחיש. הסטארטאפ שמבין את הסט הזה — מקבל החלטות מהירות יותר וחוסך כסף.
מה הלאה — ספטמבר עד אוקטובר 2026
אנחנו צפויים לראות עד סוף אוקטובר 2026:
- Kimi K3 יוצא כ-flagship פתוח. MoE עם 100+ "sub-agents" שיוצרים routing דינמי per-request. סיכון: רישיון Moonshot עדיין לא ברור.
- Meta Muse Spark 1.2 weights ב-Llama Community License (כנראה סוף ספטמבר). תגובה למתחרים; פחות permissive מ-Muse Glimmer.
- Alibaba כבר רמזה על Qwen3.9 — focus ב-"better agentic tool use". כלומר, מ-MLP ל-cognition loops.
- DeepSeek Harness — כלי coding agent חדש, תחרותי ל-Claude Code ו-Codex CLI. צפוי להיות MIT גם כן.
- GLM-5.3-Flash Hebrew fine-tune — קהילת ה-AI הישראלית כבר מתארגנת ל-fine-tune לעברית תחת license MIT.
- Enterprise fork ראשון של V4-Pro — כנראה על ידי סטארטאפ גרמני או ישראלי.
סיכון אמיתי: רגולטורים (EU AI Act, ועדות אמריקאיות) עשויים להגביל שימוש ב-Chinese-origin weights בסקטורים מסוימים. עד אוקטובר נדע אם זו רעש או מדיניות.
טבלת סיכום — מי ניצח את מי
| קטגוריה | מנצח | סיבה |
|---|---|---|
| ביצועים גולמיים | Qwen3.8-Max | 86.6 ב-Terminal-Bench 2.1 |
| חופש רישיון | DeepSeek V4-Pro | MIT מלא + frontier performance |
| נגישות | Meta Muse Glimmer | 30B, 24GB GPU, Apache 2.0 |
| מחיר נמוך | GLM-5.3-Flash | $0.15/$0.50 למיליון tokens |
| Multimodal קל | Qwen3.8-Max | native image+video |
playbook פרקטי — מה עושים מחר בבוקר
אחרי כל הטבלאות, הנה ה-flow המעשי לסטארטאפים שמתלבטים בין המודלים. אני מניח שלרוב הקוראים יש צוות של 3-10 מפתחים, תקציב חודשי של $5K-$50K ל-inference, ורוצים לסגור product-market fit תוך 6 חודשים.
שלב ה-prototype (חודש 1-2)
בחירה: Meta Muse Glimmer (self-host) או Qwen3.8-27B (self-host).
למה: שניהם Apache 2.0, רצים על 24GB consumer GPU, אין צורך ב-approval תקציב לענן. עלות חודשית: כמה מאות דולרים לחשמל + שכירות GPU אחת.
מלכודות: אל תתחילו עם closed API רק בגלל שזה קל. הפיתוי להשתמש ב-GPT-5.6 ב-MVP הוא גדול, אבל אתם תקועים איתו עד הסוף. שני המודלים הפתוחים מספיקים ל-MVP.
שלב ה-traffic growth (חודש 3-8)
בחירה: GLM-5.3-Flash API ($0.15/$0.50) או DeepSeek V4-Pro off-peak.
למה: כשה-traffic עולה, עלות ה-inference היא הקו הראשון ב-P&L שמתפוצץ. GLM-5.3-Flash נותן תוצאות mid-tier ב-2% מהמחיר של GPT-5.6. זה מספיק לרוב ה-queries.
טריק מתקדם: נתבו queries בין GLM-5.3-Flash (זול) ל-DeepSeek V4-Pro (חזק). 80% מה-queries ילכו לזול, 20% (הקשים) ליקר.
שלב ה-scale (חודש 9+)
בחירה: DeepSeek V4-Pro self-host, אם ה-traffic מצדיק זאת. אחרת — OpenAI או Anthropic API.
מתמטיקה של החלטה: אם אתם מוציאים יותר מ-$30K לחודש על DeepSeek API, כדאי לבחון self-host. תקציב startup של H100 cluster (8x H100) הוא $25K-$40K לחודש ב-AWS או Lambda. ה-break-even קרוב, ואחרי 3-4 חודשים אתם חוסכים.
שיקול נוסף: latency. Self-host נותן latency קבועה (~75 t/s). API תלוי בעומס. ל-product real-time (chatbots, agents), self-host עדיף.
תרחישים רגולטוריים בישראל
| סקטור | רישיון מועדף | סיבה |
|---|---|---|
| פיננסים | MIT (V4-Pro) או Apache 2.0 | נדרש data residency; closed API סיכון |
| בריאות | Apache 2.0 (Muse Glimmer / Qwen3.8-27B) | HIPAA-friendly self-host |
| רשויות ממשלתיות | MIT עם data on-prem | חוק סייבר 2017 ותקנות שב"כ |
| B2B אמריקאי | Closed (OpenAI) | הלקוח דורש אמריקאי |
| Consumer apps | MIT / Apache (הכי זול) | עלות inference היא ה-P&L |
מה לא לעשות
- לא לקנות Claude Opus 5 לפרויקט internals — זה בזבוז.
- לא לעשות fine-tuning לפני שהבנתם את ה-compute cost.
- לא לבנות על Qwen3.8-Max אם ה-MRR נמוך מ-$1M. הרישיון יחנק אתכם.
- לא להתעלם מ-GLM-5.3-Flash. הוא לא מפורסם, אבל הוא 1/40 מהמחיר של GPT-5.6.
- לא לחכות. המתחרים שלכם כבר מחליפים.
הזדמנות אמיתית ל-Israel AI
עשרת הימים האלה פתחו חלון. לראשונה, יש ארבע דרכים יציבות להריץ frontier AI: OpenAI, Anthropic, Alibaba, DeepSeek. שלוש מהארבע זולות ב-50-90% מהראשונה. זה שווה ערך ל-$2-5 מיליארד חיסכון שנתי בתקציב inference של סקטור ה-tech הישראלי. הסטארטאפים שיזהו את זה ברבעון הקרוב יקבלו margin תחרותי שאחרים לא יוכלו להשיג.
ההשפעה תהיה לא רק טכנית. היא תשנה את המשא ומתן מול enterprise customers: כשאתה יכול להציע "אנחנו מריצים Apache 2.0 על השרתים שלנו", זה פתאום propositions חזק יותר מ-"אנחנו קוראים ל-OpenAI". בנוסף, קהילת ה-AI הישראלית צריכה להשקיע ב-community fine-tunes לעברית על בסיס GLM-5.3-Flash. זו ההזדמנות הטובה ביותר שלנו לעשות משהו בלתי תלוי בארה"ב.
שאלות נפוצות
האם אני צריך לעבור למודל פתוח? לא בהכרח. אם אתה מרוצה מ-GPT-5.6 ומשלם עבור ה-API, אין סיבה לזוז. אבל אם ה-cost sensitivity שלך גבוהה או שאתה רוצה on-prem — זה הזמן.
מה ההבדל בין MIT ל-Apache 2.0? שניהם permissive מאוד. Apache 2.0 כולל סעיף patent grant ש-MIT לא כולל. בפועל, ההבדל לרוב המשתמשים הוא זניח. שניהם מתירים שימוש מסחרי בלי תנאים.
Custom Qwen License — מתי זה רלוונטי לי? רק אם אתה מתכנן לעשות למעלה מ-$50M TTM revenue מ-model-as-a-service או AI work assistant. אם אתה מתחת לסף הזה, הרישיון "נחמד" כמו Apache — אבל ברגע שתחצה אותו, תצטרך חוזה נפרד.
האם אני יכול להריץ V4-Pro על הלפטופ שלי? לא. זה 893GB weights. אתה צריך GPU cluster (תקציב של כמה עשרות אלפי דולרים לחודש).
למה Meta חזרה לקוד פתוח עכשיו? ההפסד של Llama 4 ב-2025 אילץ את מטא להחזיר את הקהילה. הם צריכים traction של מפתחים, וזה לא קורה עם closed models.
האם Muse Glimmer מספיק ל-product production, או רק לפרויקטים קטנים? מספיק ל-90% מהמקרים. אם ה-use case שלך דורש 1M context, או reasoning עמוק במיוחד — לא. אם זה chatbot, summarization, classification, RAG על docs קצרים, agents פשוטים — כן, זה מספיק ויותר.
למה DeepSeek העלתה מחירים במקביל ל-MIT release? זה נראה סותר אבל לא. ה-weights חינם לכולם; ה-API עולה יותר כי המודל שווה יותר. המסר של DeepSeek: "weights חופשיים, API premium". חכם מבחינת unit economics.
האם כדאי לעשות fine-tuning ל-Qwen3.8-Max או רק למודלים הקטנים יותר? Fine-tune ל-Qwen3.8-Max דורש ~$200K-$500K compute לריצה אחת. עבור רוב הסטארטאפים עדיף fine-tune ל-27B variant או ל-GLM-5.3-Flash. ה-max tier שמור למקרים שבהם אתם באמת צריכים את הביצועים.
איזה מודל הכי טוב לעברית ב-2026? עד אוגוסט 2026, עברית הייתה נחלתם של closed models. Muse Glimmer (Apache) ו-Qwen3.8-27B שניהם תומכים בעברית ברמה טובה; קהילת ה-AI הישראלית כבר מתארגנת ל-community fine-tunes על בסיס GLM-5.3-Flash ו-V4-Pro. עד סוף 2026 סביר שיהיו Hebrew-specialized checkpoints תחת MIT.
סיכום
עשרת הימים של אוגוסט 2026 לא היו אירוע. הם היו מגמה. Alibaba + Meta + DeepSeek עשו את אותו דבר בו-זמנית: פתחו קטגוריות חדשות של "open weights". השוק הגיב — הורדות, benchmarks, ו-fork מהירים של הקוד.
בעוד שנה, "קוד פתוח" יהיה ברירת המחדל. "Closed frontier" יהיה האקזוטי. זה לא סוף הסיפור של OpenAI ו-Anthropic — אבל זה סוף הסיפור של ההגמוניה שלהם.
מקורות
- Qwen blog: https://qwen.ai/blog?id=qwen3.8
- OpenLM Qwen: https://openlm.ai/qwen3.8/
- AI Tools Recap: https://aitoolsrecap.com/Blog/qwen38-max-open-weights-license-explained-2026
- DeepSeek: https://deepseek.com/
- Yotta Labs: https://yottalabs.ai/
- Digital Applied: https://digitalapplied.com/
- Meta AI blog: https://ai.meta.com/
- Hugging Face: https://huggingface.co/
- MindStudio: https://mindstudio.ai/
- Prompt AI Learning: https://promptailearning.com/ai-news/monthly/ai-news-recap-august-2026-every-story-that-mattered
- Hugging Face Qwen3.8: https://huggingface.co/Qwen
`
מאמרים קשורים
מהקריאה לבנייה
יש לכם מערכת שצריכה לעבוד עם AI?
אני עוזר לעסקים להפוך מודלים, אוטומציות ותשתיות מאובטחות למערכות שאפשר להפעיל בפרודקשן.
בואו נדבר על הפרויקט