GLM 5.3 Flash
Modelo multimodal da Z.ai para código e agents, com contexto de 1M tokens
acesso gratuito disponível

- Contexto
- 1,000,000 tokens
- Saída
- até 131,072 tokens
- Entrada
- Texto, imagens, vídeo
- Arquitetura
- MoE, 320B / 18B ativos
- Provedor
- Z.ai (via OpenRouter)
- Acesso
- ChatPlus PRO
GLM 5.3 Flash é um modelo multimodal com raciocínio da Z.ai, ajustado para programação, trabalho agentic longo e cargas de produção. É o primeiro modelo nativamente multimodal da série GLM-5: um MoE com 320 bilhões de parâmetros (18 bilhões ativos), contexto de até 1M tokens e entrada de texto, imagens e vídeo. Em agosto de 2026, estreou anonimamente no OpenRouter como Ox Alpha. Em benchmarks de código e agents, fica no mesmo nível do Claude Opus 4.8. No ChatPlus, está disponível no plano PRO.
A história do GLM 5.3 Flash é incomum: um modelo forte foi lançado primeiro anonimamente com o codinome Ox Alpha — sem nome de laboratório e sem anúncios, apenas publicado no OpenRouter para coletar feedback sincero antes do lançamento oficial. Esses lançamentos “stealth” acontecem quando o autor quer testar um modelo em uso real sem chamar atenção para a marca.
A comunidade logo começou a tentar adivinhar quem estava por trás e, pelo tokenizer e pelos códigos de erro característicos, passou a apostar na família GLM. Em 26 de agosto de 2026, a Z.ai confirmou os palpites: Ox Alpha era o GLM 5.3 Flash, o primeiro modelo nativamente multimodal da série GLM-5. Os weights estão no Hugging Face sob licença MIT.
Pelo tipo de tarefa, este é um modelo de engenharia: código, cenários agentic longos, contexto de até 1 milhão de tokens. Em benchmarks de programação, fica no mesmo nível do Claude Opus 4.8. O provedor mantém as solicitações do lado dele, então no ChatPlus deixamos o modelo disponível apenas no plano PRO e o removemos da seleção automática — o que é mais privado.
No que ele é bom
Programação
Ajustado para tarefas de engenharia: escreve e edita código, trabalha com repositórios grandes.
Tarefas agentic longas
Mantém o contexto ao longo de cenários com várias etapas e chamadas de ferramentas.
Contexto enorme
Até 1M tokens — projetos inteiros e documentos grandes de uma só vez.
Multimodalidade
Entende não só texto, mas também imagens e vídeo como parte do pedido.

GLM 5.3 Flash e todos os outros modelos — um plano, uma janela.
Onde ele é mais forte
GLM 5.3 Flash ao lado dos outros
Veja GLM 5.3 Flash e os flagships de outros labs lado a lado. Todos em uma única assinatura ChatPlus.
| Claude | DeepSeek | GPT | Gemini | Grok | GLM | Kimi | Qwen | Muse | GLM 5.3 Flash | |
|---|---|---|---|---|---|---|---|---|---|---|
| Desenvolvedor | Anthropic | DeepSeek | OpenAI | xAI | Z.ai | Moonshot | Alibaba | Meta | Z.ai | |
| Modelo | Sonnet 4.6 | DeepSeek V4.1 Reasoner | GPT-6 Astra | Gemini 3 Pro | Grok 4 | GLM 5 | Kimi K3 | Qwen 3.8 Max | Muse Spark 1.3 | GLM 5.3 Flash |
| Contexto | 200K | 128K | 1M | 1M | 256K | 1M | 256K | 256K | 1M | 1M |
| Entende imagens | — | — | ||||||||
| Dados da web em tempo real | — | — | — | — | — | — | — | |||
| Open source | — | — | — | — | — | |||||
| Ponto forte | Texto e código | Raciocínio | Uso do computador | Multimodalidade | Atualidade | Código e agentes | Contexto longo | Tarefas complexas | Agentes e código | Código |
| No ChatPlus |