GLM 5.3 Flash
Z.ai-Multimodalmodell für Code und Agents mit 1M-Token-Kontext
kostenloser Zugang verfügbar

- Kontext
- 1,000,000 Tokens
- Ausgabe
- bis zu 131,072 Tokens
- Eingabe
- Text, Bilder, Video
- Architektur
- MoE, 320B / 18B aktiv
- Anbieter
- Z.ai (via OpenRouter)
- Zugang
- ChatPlus PRO
GLM 5.3 Flash ist ein reasoningfähiges multimodales Modell von Z.ai, optimiert für Programmierung, lange agentische Workflows und Produktions-Workloads. Es ist das erste nativ multimodale Modell der GLM-5-Serie: ein MoE mit 320 Milliarden Parametern (18 Milliarden aktiv), Kontext bis zu 1M Tokens sowie Eingabe von Text, Bildern und Video. Im August 2026 erschien es anonym auf OpenRouter als Ox Alpha. In Code- und Agent-Benchmarks hält es mit Claude Opus 4.8 mit. Auf ChatPlus ist es im PRO-Tarif verfügbar.
Die Geschichte von GLM 5.3 Flash ist ungewöhnlich: Ein starkes Modell wurde zuerst anonym unter dem Codenamen Ox Alpha veröffentlicht — ohne Lab-Namen und ohne Ankündigungen, einfach auf OpenRouter, um vor dem offiziellen Launch ehrliches Feedback zu sammeln. Solche „Stealth“-Releases gibt es, wenn ein Anbieter ein Modell in der Praxis testen will, ohne die Marke in den Vordergrund zu stellen.
Die Community rätselte sofort, wer dahintersteckt, und tippte wegen des Tokenizers und charakteristischer Fehlercodes auf die GLM-Familie. Am 26. August 2026 bestätigte Z.ai die Vermutungen: Ox Alpha war GLM 5.3 Flash, das erste nativ multimodale Modell der GLM-5-Serie. Die Gewichte liegen auf Hugging Face unter der MIT-Lizenz.
Für Aufgaben ist das ein Engineering-Modell: Code, lange agentische Szenarien, Kontext bis zu einer Million Tokens. In Programmier-Benchmarks hält es mit Claude Opus 4.8 mit. Der Anbieter speichert Anfragen auf seiner Seite, deshalb haben wir es bei ChatPlus nur im PRO-Tarif verfügbar gemacht und aus der automatischen Auswahl entfernt — das ist privater.
Worin es gut ist
Programmieren
Für Engineering-Aufgaben optimiert: schreibt und bearbeitet Code, arbeitet mit großen Repositories.
Lange agentische Aufgaben
Behält den Kontext über die gesamte Dauer mehrstufiger Szenarien mit Tool-Aufrufen.
Riesiger Kontext
Bis zu 1M Tokens — ganze Projekte und große Dokumente in einem Durchlauf.
Multimodalität
Versteht nicht nur Text, sondern auch Bilder und Video als Teil einer Anfrage.

GLM 5.3 Flash und jedes andere Modell – ein Plan, ein Fenster.
Wo es am stärksten ist
GLM 5.3 Flash neben den anderen
So sieht GLM 5.3 Flash neben den Flaggschiffen anderer Labs aus. Alle sind in einem ChatPlus Abo enthalten.
| Claude | DeepSeek | GPT | Gemini | Grok | GLM | Kimi | Qwen | Muse | GLM 5.3 Flash | |
|---|---|---|---|---|---|---|---|---|---|---|
| Developer | Anthropic | DeepSeek | OpenAI | xAI | Z.ai | Moonshot | Alibaba | Meta | Z.ai | |
| Modell | Sonnet 4.6 | DeepSeek V4.1 Reasoner | GPT-6 Astra | Gemini 3 Pro | Grok 4 | GLM 5 | Kimi K3 | Qwen 3.8 Max | Muse Spark 1.3 | GLM 5.3 Flash |
| Kontext | 200K | 128K | 1M | 1M | 256K | 1M | 256K | 256K | 1M | 1M |
| Versteht Bilder | — | — | ||||||||
| Live-Webdaten | — | — | — | — | — | — | — | |||
| Open Source | — | — | — | — | — | |||||
| Stärke | Text und Code | Reasoning | Computer-Nutzung | Multimodalität | Aktualität | Code und Agents | Langer Kontext | Komplexe Aufgaben | Agents und Code | Code |
| Auf ChatPlus |