GLM 5.3 Flash: come il modello “stealth” Ox Alpha si è rivelato essere la nuova rete di Z.ai
Per un paio di settimane, gli sviluppatori si sono chiesti quale potente modello senza nome fosse comparso su OpenRouter con il nome in codice Ox Alpha. Il 26 agosto, la cinese Z.ai ha scoperto le carte: è GLM 5.3 Flash — il primo modello nativamente multimodale della serie GLM-5. Vediamo cosa sa fare, da dove arriva e se conviene affidargli i tuoi dati.

Per un paio di settimane, nelle chat degli sviluppatori girava sempre la stessa domanda: che razza di bestia è questo Ox Alpha? Il modello era comparso nel catalogo di OpenRouter e nell’agente open source OpenCode senza alcun preavviso — niente nome del team, niente model card, nemmeno una riga di documentazione. Una rete potente spuntata dal nulla e, per di più, distribuita gratis. Le persone la provavano sui propri task, si scambiavano screenshot, discutevano su chi l’avesse creata. Il 26 agosto 2026, il mistero si è chiuso: il laboratorio cinese Z.ai si è fatto avanti e ha detto — sì, siamo noi, e il modello si chiama GLM 5.3 Flash.
La storia è già curiosa di per sé, ma dietro c’è qualcosa di più interessante del semplice gossip su un lancio anonimo. Andiamo con ordine: cosa sono questi rilasci "stealth", come la community ha identificato l’autore prima dell’annuncio, cosa sa fare davvero GLM 5.3 Flash e — soprattutto — se vale la pena usarlo al posto di altri modelli nel lavoro di tutti i giorni.
Perché rilasciare un modello in forma anonima
La tattica si chiama rilascio "stealth" e nell’ultimo anno è diventata particolarmente popolare tra i laboratori cinesi. Lo schema è semplice: pubblichi il modello su una piattaforma condivisa come OpenRouter, ma senza alcun branding — con un nome in codice neutro. Dai accesso, spesso gratis, e stai a vedere cosa succede.
L’obiettivo è ottenere feedback sinceri. Quando sulla model card c’è scritto "un nuovo modello di un grande laboratorio", metà della reazione dipende dalle aspettative e dalla reputazione, non dal modello in sé. Ma nessuno ha soggezione di un "Ox Alpha" senza nome e nessuno gli deve nulla: gli sviluppatori lo mettono semplicemente al lavoro, lo rompono sui loro task reali e nelle stesse chat scrivono dove funziona bene e dove crolla. Per un team è un modo economico per raccogliere metriche dall’uso reale prima di accendere la macchina delle PR.
C’era poi un altro segnale che meritava una nota a parte. OpenCode parlava di un budget nell’ordine di cento trilioni di token al giorno — tutti distribuiti gratis. Nessuno brucia così tanto "solo per fare test". Sembra piuttosto che qualcuno stesse spingendo deliberatamente un flusso enorme di richieste reali attraverso il modello, non una manciata di esempi demo per un annuncio patinato.
Come è stato scoperto l’autore prima dell’annuncio
La parte più interessante è che Z.ai ha avuto a malapena il tempo di sorprendere qualcuno. La community aveva capito la provenienza di Ox Alpha ben prima della conferma ufficiale — e non grazie a intuizioni geniali, ma a piccoli indizi tecnici.
Prima di tutto, il tokenizer. Il modo in cui un modello spezza il testo in pezzi è quasi un’impronta di famiglia. Quello di Ox Alpha coincideva in modo sospetto con quanto si era già visto in GLM. Poi il suo comportamento sui temi delicati: il modello evitava in modo caratteristico le domande sulla politica cinese — esattamente come fanno i modelli addestrati in Cina. A questo si aggiungevano certi codici di errore dell’API, che richiamavano anch’essi famiglie note. Preso singolarmente, ogni indizio poteva essere una coincidenza; insieme, però, portavano a un "questo viene da uno dei laboratori frontier cinesi, molto probabilmente dalla linea GLM" piuttosto convincente.
Ed è andata proprio così. Il 26 agosto, Z.ai ha confermato che Ox Alpha e GLM 5.3 Flash sono lo stesso modello, pubblicando insieme anche pesi e benchmark.
Che cos’è GLM 5.3 Flash
Ora veniamo alla sostanza. GLM 5.3 Flash è, nelle parole di Z.ai, il primo modello nativamente multimodale della serie GLM-5. "Nativamente" è la parola chiave: il modello non è stato collegato a posteriori a un riconoscitore di immagini separato — è stato addestrato fin dall’inizio per gestire tipi di dati diversi come un unico flusso.
Sotto il cofano c’è un’architettura Mixture-of-Experts (MoE). Detto in modo molto semplice: invece di avere un’unica rete gigantesca che si attiva per intero a ogni richiesta, il modello è diviso in molti "esperti" e, per ogni token, se ne accende solo un piccolo sottoinsieme. Formalmente GLM 5.3 Flash ha 320 miliardi di parametri, ma in ogni momento ne sono attivi solo circa 18 miliardi. Grazie a questo, il modello si comporta come qualcosa di grande e intelligente, con costi più vicini a quelli di qualcosa di piccolo. In più usa una hybrid sparse-linear attention — un meccanismo che aiuta a mantenere l’accuratezza su contesti molto lunghi senza far esplodere il costo computazionale.
Le caratteristiche principali, riassunte in un elenco:
- Contesto — fino a 1 milione di token. Letteralmente interi codebase o documenti corposi caricati in un solo passaggio.
- Output massimo — fino a 131.072 token in una volta.
- Input — testo, immagini e video.
- Specializzazione — codice e scenari agentic: task multi-step in cui il modello chiama da solo gli strumenti e porta il lavoro fino a un risultato.
- Pesi — pubblicati su HuggingFace con licenza MIT. In altre parole, il modello è davvero aperto: puoi scaricarlo ed eseguirlo per conto tuo.
L’ultimo punto merita di essere sottolineato. Una licenza MIT aperta non significa "guarda e ammira" — significa permesso di usare il modello nei tuoi prodotti con pochissime restrizioni. Per un modello frontier di questo calibro, è ancora una rarità.
Quanto è valido
Z.ai riporta i suoi risultati sul benchmark interno Code Bench v1.0. Secondo questi numeri, GLM 5.3 Flash "supera nettamente" il precedente GLM-5.2 a ogni livello di difficoltà e "si comporta alla pari" con Claude Opus 4.8 nella programmazione e nei task agentic. I benchmark interni vanno sempre presi con una sana dose di scetticismo — a valutarli è lo stesso team che ha addestrato il modello — ma anche facendo la tara, l’affermazione è importante. Tenere il passo di Opus 4.8 nel codice è un livello da migliori modelli occidentali, non da "buon modello di fascia media".
E qui entra in gioco la seconda metà della storia — il prezzo. Presso il provider, GLM 5.3 Flash è francamente economico per la sua categoria:
| Tipo di token | Prezzo per 1M |
|---|---|
| Input | $0.15 |
| Output | $0.50 |
| Input in cache | $0.03 |
Per confronto: i modelli occidentali di forza simile di solito costano diverse volte di più, a volte anche un ordine di grandezza in più. Questa combinazione — "quasi come Opus nel codice, ma al prezzo di un modello leggero" — è il motivo principale per cui intorno a Ox Alpha c’è stato tanto rumore prima ancora che si sapesse di chi fosse.
Dov’è il trucco
Non è tutto privo di caveat, ed è più onesto dirlo subito.
Primo — privacy. Il provider che ha distribuito il modello conserva prompt e risposte. Formalmente non per l’addestramento, ma il dato resta: le tue richieste vengono archiviate da qualche parte. Per task pubblici non è un problema, ma segreti di lavoro, corrispondenza commerciale o dati personali è meglio tenerli lontani da un modello come questo.
Secondo — è comunque un rilascio fresco. I benchmark interni sono belli da vedere, ma solo test indipendenti e mesi di uso reale daranno il quadro completo. Per ora, considera il modello molto promettente, ma non ancora collaudato dal tempo.
GLM 5.3 Flash su ChatPlus
Abbiamo aggiunto questo modello già nella sua fase "stealth", con il nome Ox Alpha, e lo abbiamo aggiornato per il rilascio ufficiale — passando all’endpoint attuale, correggendo nome e prezzi. Puoi provarlo subito: apri una chat con GLM 5.3 Flash. Due cose da sapere:
- Il modello è disponibile con l’abbonamento PRO. Senza passaggi complicati.
- Lo abbiamo volutamente escluso dalla selezione automatica. Proprio per quella storia delle richieste archiviate lato provider, non vogliamo che il modello diventi silenziosamente quello predefinito. GLM 5.3 Flash deve essere una scelta consapevole: lo attivi quando sai perché.
Sembra un’ottima opzione per il codice e per lunghi scenari agentic, soprattutto quando ti serve un contesto ampio e non ti pesa dare in pasto a un task un intero codebase. È anche una buona occasione per confrontare il nuovo modello di Z.ai con i più familiari GPT, Claude e Gemini nella stessa finestra — su ChatPlus ti basta cambiare modello nella chat.
In breve
Ox Alpha non era un misterioso nuovo arrivato, ma GLM 5.3 Flash — il nuovo modello multimodale di Z.ai. È forte sul codice, regge un milione di token di contesto, costa pochissimo per gli standard della sua categoria ed è distribuito con una licenza aperta. Sul lato negativo — il provider conserva le tue richieste e il modello è ancora troppo recente per un giudizio definitivo. Vale sicuramente la pena provarlo: su ChatPlus è già disponibile con l’abbonamento PRO.
Prova i migliori modelli AI su ChatPlus
GPT, Claude, Gemini, GLM e altri modelli AI in un’unica finestra.