live
10 labs · 30 models
Todos os artigos
8 min de leituraChatPlus Team

GLM 5.3 Flash: como o modelo “stealth” Ox Alpha acabou se revelando a nova rede da Z.ai

Por algumas semanas, desenvolvedores tentaram adivinhar que modelo poderoso e sem nome havia aparecido no OpenRouter sob o codinome Ox Alpha. Em 26 de agosto, a chinesa Z.ai mostrou as cartas: é o GLM 5.3 Flash — o primeiro modelo nativamente multimodal da série GLM-5. Vamos entender o que ele faz, de onde veio e se você deve confiar seus dados a ele.

ModelosZ.aiGLMNotícias
Um cristal GLM roxo brilhante sobre fundo preto — arte de capa do artigo sobre o GLM 5.3 Flash
Ouvir o artigo00:00

Por algumas semanas, os chats de desenvolvedores voltavam sempre à mesma pergunta: que bicho é esse tal de Ox Alpha? O modelo apareceu no catálogo do OpenRouter e no agente open-source OpenCode sem aviso nenhum — sem nome de equipe, sem model card, nem uma linha de documentação. Uma rede forte simplesmente surgiu do nada e, além disso, estava sendo distribuída de graça. As pessoas rodavam o modelo em suas próprias tarefas, trocavam capturas de tela, discutiam quem poderia tê-lo criado. Em 26 de agosto de 2026, o mistério acabou: o laboratório chinês Z.ai veio a público e disse — sim, somos nós, e o modelo se chama GLM 5.3 Flash.

A história já é curiosa por si só, mas por trás dela há algo mais interessante do que fofoca sobre um lançamento anônimo. Vamos por partes: o que são esses lançamentos "stealth", como a comunidade identificou o autor antes do anúncio, o que o GLM 5.3 Flash realmente consegue fazer e — o mais importante — se vale a pena migrar para ele no trabalho do dia a dia.

Por que lançar um modelo anonimamente?

A tática é chamada de lançamento "stealth", e ao longo do último ano os laboratórios chineses, em especial, passaram a gostar bastante dela. O esquema é simples: você publica o modelo em alguma plataforma compartilhada como o OpenRouter, mas sem nenhuma marca — usando um codinome neutro. Você libera o acesso, muitas vezes de graça, e simplesmente observa o que acontece.

A ideia é obter feedback honesto. Quando o model card diz "um novo modelo de um grande laboratório famoso", metade da reação vem de expectativas e reputação, não do modelo em si. Mas ninguém tem medo de um "Ox Alpha" sem nome, e ninguém lhe deve nada: desenvolvedores simplesmente colocam o modelo para trabalhar, quebram-no em tarefas reais e, nesses mesmos chats, registram onde ele vai bem e onde desanda. Para uma equipe, é uma forma barata de extrair métricas de uso real antes de ligar a máquina de PR.

Outro sinal merecia destaque à parte. O OpenCode mencionou um orçamento na casa de cem trilhões de tokens por dia — e tudo isso estava sendo oferecido de graça. Ninguém queima tudo isso "só para testar". Parece que alguém estava deliberadamente empurrando um volume enorme de requisições reais pelo modelo, não meia dúzia de exemplos de demonstração para um anúncio bonito.

Como o autor foi descoberto antes do anúncio

A parte mais interessante é que a Z.ai mal teve chance de surpreender alguém. A comunidade descobriu a linhagem do Ox Alpha bem antes do reconhecimento oficial — e não por palpites brilhantes, mas por pequenas pistas técnicas.

Primeiro, o tokenizer. A maneira como um modelo quebra texto em pedaços é quase uma impressão digital de família. O do Ox Alpha batia de forma suspeitamente próxima com o que as pessoas já tinham visto no GLM. Segundo, seu comportamento em assuntos sensíveis: o modelo desviava caracteristicamente de perguntas sobre política chinesa — exatamente como fazem modelos treinados dentro da China. Some a isso certos códigos de erro da API que também lembravam famílias conhecidas. Isoladamente, cada pista poderia ser coincidência; juntas, elas formavam um "isto é de um dos laboratórios chineses de fronteira, muito provavelmente da linha GLM" bastante convincente.

E foi exatamente isso que aconteceu. Em 26 de agosto, a Z.ai confirmou que Ox Alpha e GLM 5.3 Flash são o mesmo modelo e liberou também seus pesos e benchmarks.

O que é o GLM 5.3 Flash

Agora, ao que interessa. O GLM 5.3 Flash é, nas palavras da própria Z.ai, o primeiro modelo nativamente multimodal da série GLM-5. "Nativamente" é a palavra-chave aqui: o modelo não recebeu depois um reconhecedor de imagens acoplado — ele foi treinado desde o início para lidar com diferentes tipos de dados como um fluxo único.

Por baixo do capô há uma arquitetura Mixture-of-Experts (MoE). Em termos bem simples: em vez de uma rede gigante que se esforça inteira a cada requisição, o modelo é dividido em muitos "especialistas", e apenas um pequeno subconjunto deles é acionado para cada token. Formalmente, o GLM 5.3 Flash tem 320 bilhões de parâmetros, mas só cerca de 18 bilhões ficam ativos a qualquer momento. Graças a isso, o modelo se comporta como algo grande e inteligente, mas custa mais perto de algo pequeno. Além disso, ele usa atenção híbrida esparsa-linear — um mecanismo que ajuda a manter a precisão em contextos muito longos sem inflar a conta de computação.

As principais características, resumidas em uma lista:

  • Contexto — até 1 milhão de tokens. Isso significa literalmente codebases inteiras ou documentos volumosos carregados de uma vez.
  • Saída máxima — até 131.072 tokens de uma só vez.
  • Entrada — texto, imagens e vídeo.
  • Especialização — código e cenários agênticos: tarefas de várias etapas em que o modelo chama ferramentas por conta própria e leva o trabalho até um resultado.
  • Pesos — publicados no HuggingFace sob a licença MIT. Ou seja, o modelo é genuinamente aberto: você pode baixá-lo e rodá-lo por conta própria.

Vale reforçar o último ponto. Uma licença MIT aberta não é "olhe e admire" — é permissão para usar o modelo nos seus próprios produtos com quase nenhuma restrição. Para um modelo de fronteira desse calibre, isso ainda é raro.

Quão bom ele é

A Z.ai divulga seus números em seu benchmark interno, o Code Bench v1.0. Segundo ele, o GLM 5.3 Flash "supera claramente" o GLM-5.2 anterior em todos os níveis de dificuldade e "tem desempenho equivalente" ao Claude Opus 4.8 em programação e tarefas agênticas. É sempre bom encarar benchmarks internos com uma boa dose de ceticismo — eles são avaliados pela mesma equipe que treinou o modelo —, mas, mesmo descontando isso, a alegação é séria. Acompanhar o Opus 4.8 em código é nível dos principais modelos ocidentais, não de um "intermediário competente".

E aí entra a segunda metade da história — o preço. No provedor, o GLM 5.3 Flash é francamente barato para sua categoria:

Tipo de tokenPreço por 1M
Entrada$0.15
Saída$0.50
Entrada em cache$0.03

Para comparar: modelos ocidentais de força parecida costumam ser várias vezes mais caros, às vezes uma ordem de grandeza acima. Essa combinação — "quase como o Opus em código, mas pelo preço de um modelo leve" — é a principal razão de ter havido tanto barulho em torno do Ox Alpha antes que alguém soubesse de quem ele era.

Qual é a pegadinha

Ele não vem totalmente sem ressalvas, e o mais honesto é colocá-las na mesa de início.

Primeiro — privacidade. O provedor que disponibilizou o modelo mantém seus prompts e respostas. Formalmente, não para treinamento, mas o fato permanece: suas requisições ficam armazenadas em algum lugar. Para tarefas públicas isso não é problema, mas segredos de trabalho, correspondência comercial ou dados pessoais ficam melhor longe de um modelo como este.

Segundo — ainda é um lançamento recente. Os benchmarks internos são bonitos, mas só execuções independentes e meses de uso real vão dar o quadro completo. Por enquanto, trate o modelo como muito promissor, mas ainda não amadurecido pelo tempo.

GLM 5.3 Flash no ChatPlus

Adicionamos este modelo ainda na fase "stealth", com o nome Ox Alpha, e o atualizamos para o lançamento oficial — mudamos para o endpoint atual, corrigimos o nome e os preços. Você pode testá-lo agora mesmo: abrir um chat com o GLM 5.3 Flash. Duas coisas vale saber:

  • O modelo está disponível na assinatura PRO. Sem burocracia.
  • Nós deliberadamente o deixamos fora da seleção automática. Por causa dessa mesma história de as requisições ficarem armazenadas do lado do provedor, não queremos que o modelo vire o padrão silenciosamente. Que o GLM 5.3 Flash seja uma escolha consciente: você o ativa quando sabe por quê.

Ele parece uma excelente opção para código e cenários agênticos longos, especialmente quando você precisa de um contexto grande e não se importa de gastar uma codebase inteira em uma tarefa. Também é uma boa desculpa para comparar o modelo recém-lançado da Z.ai com os já conhecidos GPT, Claude e Gemini em uma só janela — no ChatPlus, basta trocar o modelo no chat.

Em resumo

Ox Alpha acabou se revelando não um estreante misterioso, mas o GLM 5.3 Flash — o novo modelo multimodal da Z.ai. Ele é forte em código, sustenta um contexto de um milhão de tokens, custa centavos pelos padrões da sua categoria e vem sob uma licença aberta. Do lado negativo — o provedor armazena suas requisições, e o modelo ainda é recente demais para um julgamento definitivo. Sem dúvida vale experimentar: no ChatPlus, ele já está disponível na assinatura PRO.

Experimente os melhores modelos de IA no ChatPlus

GPT, Claude, Gemini, GLM e outros modelos de IA em uma só janela.