GLM 5.3 Flash
Le modèle multimodal de Z.ai pour le code et les agents, avec 1M de tokens de contexte
accès gratuit disponible

- Contexte
- 1,000,000 tokens
- Sortie
- jusqu’à 131,072 tokens
- Entrée
- Texte, images, vidéo
- Architecture
- MoE, 320B / 18B actifs
- Fournisseur
- Z.ai (via OpenRouter)
- Accès
- ChatPlus PRO
GLM 5.3 Flash est un modèle multimodal de raisonnement signé Z.ai, optimisé pour la programmation, les longues tâches agentiques et les charges de production. C’est le premier modèle nativement multimodal de la série GLM-5 : un MoE de 320 milliards de paramètres (18 milliards actifs), avec jusqu’à 1M de tokens de contexte et une entrée texte, images et vidéo. En août 2026, il a fait ses débuts anonymement sur OpenRouter sous le nom Ox Alpha. Sur les benchmarks de code et de tâches agentiques, il tient tête à Claude Opus 4.8. Sur ChatPlus, il est disponible avec le plan PRO.
L’histoire de GLM 5.3 Flash est atypique : un modèle puissant a d’abord été publié anonymement sous le nom de code Ox Alpha — sans nom de laboratoire ni annonce, simplement mis en ligne sur OpenRouter pour recueillir des retours sincères avant le lancement officiel. Ce type de sortie « furtive » permet à l’auteur de tester un modèle en conditions réelles sans attirer l’attention sur la marque.
La communauté a aussitôt cherché à deviner qui se cachait derrière, et le tokenizer ainsi que ses codes d’erreur caractéristiques ont rapidement fait pencher les soupçons vers la famille GLM. Le 26 août 2026, Z.ai a confirmé les hypothèses : Ox Alpha était GLM 5.3 Flash, le premier modèle nativement multimodal de la série GLM-5. Les poids sont disponibles sur Hugging Face sous licence MIT.
Côté usage, c’est un modèle d’ingénierie : code, longs scénarios agentiques, contexte jusqu’à un million de tokens. Sur les benchmarks de programmation, il tient tête à Claude Opus 4.8. Le fournisseur conserve les requêtes de son côté ; sur ChatPlus, nous l’avons donc réservé au plan PRO et retiré de la sélection automatique — un choix plus respectueux de la confidentialité.
Ses points forts
Programmation
Optimisé pour les tâches d’ingénierie : écrit et modifie du code, travaille sur de grands dépôts.
Longues tâches agentiques
Conserve le contexte sur toute la durée des scénarios en plusieurs étapes avec appels d’outils.
Contexte immense
Jusqu’à 1M de tokens — projets entiers et grands documents traités d’un seul bloc.
Multimodalité
Comprend non seulement le texte, mais aussi les images et la vidéo dans une demande.

GLM 5.3 Flash et tous les autres modèles — un seul abonnement, une seule fenêtre.
Là où il est le plus fort
GLM 5.3 Flash face aux autres
Comparez GLM 5.3 Flash aux modèles phares des autres labs, côte à côte. Ils sont tous réunis dans un seul abonnement ChatPlus.
| Claude | DeepSeek | GPT | Gemini | Grok | GLM | Kimi | Qwen | Muse | GLM 5.3 Flash | |
|---|---|---|---|---|---|---|---|---|---|---|
| Développeur | Anthropic | DeepSeek | OpenAI | xAI | Z.ai | Moonshot | Alibaba | Meta | Z.ai | |
| Modèle | Sonnet 4.6 | DeepSeek V4.1 Reasoner | GPT-6 Astra | Gemini 3 Pro | Grok 4 | GLM 5 | Kimi K3 | Qwen 3.8 Max | Muse Spark 1.3 | GLM 5.3 Flash |
| Contexte | 200K | 128K | 1M | 1M | 256K | 1M | 256K | 256K | 1M | 1M |
| Comprend les images | — | — | ||||||||
| Données web en direct | — | — | — | — | — | — | — | |||
| Open source | — | — | — | — | — | |||||
| Point fort | Texte et code | Raisonnement | Usage de l’ordinateur | Multimodalité | Actualité | Code et agents | Long contexte | Tâches complexes | Agents et code | Code |
| Sur ChatPlus |