GLM 5.3 Flash
Z.ai’s multimodale model voor code en agents met een context van 1M tokens
gratis toegang beschikbaar

- Context
- 1,000,000 tokens
- Output
- tot 131,072 tokens
- Input
- Tekst, afbeeldingen, video
- Architectuur
- MoE, 320B / 18B actief
- Provider
- Z.ai (via OpenRouter)
- Toegang
- ChatPlus PRO
GLM 5.3 Flash is een redenerend multimodaal model van Z.ai, afgestemd op programmeren, lang agentic werk en productie-workloads. Het is het eerste native multimodale model in de GLM-5-serie: een MoE met 320 miljard parameters (18 miljard actief), context tot 1M tokens en input van tekst, afbeeldingen en video. In augustus 2026 debuteerde het anoniem op OpenRouter als Ox Alpha. Op benchmarks voor code en agentic werk kan het mee met Claude Opus 4.8. In ChatPlus is het beschikbaar met het PRO-abonnement.
Het verhaal van GLM 5.3 Flash is opvallend: een sterk model werd eerst anoniem uitgebracht onder de codenaam Ox Alpha — zonder labnaam en zonder aankondiging, simpelweg op OpenRouter gezet om eerlijke feedback te verzamelen vóór de officiële lancering. Zulke “stealth”-releases gebeuren wanneer de maker een model in het wild wil testen zonder de aandacht op het merk te vestigen.
De community begon meteen te raden wie erachter zat, en op basis van de tokenizer en de herkenbare foutcodes wees alles richting de GLM-familie. Op 26 augustus 2026 bevestigde Z.ai de vermoedens: Ox Alpha was GLM 5.3 Flash, het eerste native multimodale model in de GLM-5-serie. De weights staan op Hugging Face onder de MIT-licentie.
Qua taken is dit een engineeringmodel: code, lange agentic scenario’s, context tot een miljoen tokens. Op programmeerbenchmarks kan het mee met Claude Opus 4.8. De provider bewaart verzoeken aan zijn kant, dus in ChatPlus hebben we het alleen beschikbaar gemaakt in het PRO-abonnement en uit de automatische selectie gehaald — dat is privacyvriendelijker.
Waar het goed in is
Programmeren
Afgestemd op engineeringtaken: schrijft en bewerkt code, werkt met grote repositories.
Lange agentic taken
Houdt context vast over de volledige looptijd van scenario’s met meerdere stappen en toolaanroepen.
Enorme context
Tot 1M tokens — complete projecten en grote documenten in één keer.
Multimodaliteit
Begrijpt niet alleen tekst, maar ook afbeeldingen en video als onderdeel van een verzoek.

GLM 5.3 Flash en elk ander model — één abonnement, één venster.
Waar het het sterkst is
GLM 5.3 Flash naast de rest
Zo zien GLM 5.3 Flash en de topmodellen van andere labs er naast elkaar uit. Ze zitten allemaal in één ChatPlus-abonnement.
| Claude | DeepSeek | GPT | Gemini | Grok | GLM | Kimi | Qwen | Muse | GLM 5.3 Flash | |
|---|---|---|---|---|---|---|---|---|---|---|
| Developer | Anthropic | DeepSeek | OpenAI | xAI | Z.ai | Moonshot | Alibaba | Meta | Z.ai | |
| Model | Sonnet 4.6 | DeepSeek V4.1 Reasoner | GPT-6 Astra | Gemini 3 Pro | Grok 4 | GLM 5 | Kimi K3 | Qwen 3.8 Max | Muse Spark 1.3 | GLM 5.3 Flash |
| Context | 200K | 128K | 1M | 1M | 256K | 1M | 256K | 256K | 1M | 1M |
| Begrijpt beelden | — | — | ||||||||
| Live webdata | — | — | — | — | — | — | — | |||
| Open source | — | — | — | — | — | |||||
| Belangrijkste kracht | Tekst en code | Redeneren | Computergebruik | Multimodaliteit | Actualiteit | Code en agents | Lange context | Complexe taken | Agents en code | Code |
| Op ChatPlus |