GLM 5.3 Flash: hoe het “stealth”-model Ox Alpha de nieuwe netwerk van Z.ai bleek te zijn
Een paar weken lang vroegen developers zich af welk krachtige, naamloze model onder de codenaam Ox Alpha op OpenRouter was opgedoken. Op 26 augustus liet het Chinese Z.ai zijn kaarten zien: het is GLM 5.3 Flash — het eerste native multimodale model in de GLM-5-serie. Laten we bekijken wat het kan, waar het vandaan komt en of je het je data moet toevertrouwen.

Een paar weken lang draaiden developerchats steeds om dezelfde vraag: wat voor beest is die Ox Alpha eigenlijk? Het model verscheen in de catalogus van OpenRouter en in de open-source agent OpenCode zonder enige waarschuwing — geen teamnaam, geen model card, geen regel documentatie. Ineens was er een sterk netwerk, uit het niets, en bovendien werd het gratis uitgedeeld. Mensen draaiden het op hun eigen taken, deelden screenshots, discussieerden over wie het had gemaakt. Op 26 augustus 2026 was het mysterie opgelost: het Chinese lab Z.ai stapte naar voren en zei — ja, wij zijn het, en het model heet GLM 5.3 Flash.
Het verhaal is op zichzelf al vermakelijk, maar er zit iets interessanters achter dan geroddel over een anonieme release. Laten we het op volgorde bekijken: wat zulke "stealth"-lanceringen zijn, hoe de community de maker al vóór de aankondiging wist te achterhalen, wat GLM 5.3 Flash daadwerkelijk kan, en — het belangrijkst — of het de moeite waard is om er in je dagelijkse werk naar over te stappen.
Waarom überhaupt een model anoniem uitbrengen
De tactiek heet een "stealth"-release, en vooral Chinese labs zijn er het afgelopen jaar dol op geworden. Het principe is simpel: je zet het model op een gedeeld platform als OpenRouter, maar zonder branding — onder een neutrale codenaam. Je geeft toegang, vaak gratis, en kijkt gewoon wat er gebeurt.
Het doel is eerlijke feedback krijgen. Als er op de model card staat "een nieuw model van een bekend lab", wordt de helft van de reactie bepaald door verwachtingen en reputatie, niet door het model zelf. Maar niemand is bang voor een naamloze "Ox Alpha" en niemand is het iets verschuldigd: developers zetten het gewoon aan het werk, laten het stuklopen op hun echte taken, en schrijven in diezelfde chats op waar het goed is en waar het uit elkaar valt. Voor een team is dat een goedkope manier om metrics uit livegebruik te halen voordat de PR-machine wordt aangezet.
Nog één signaal was het waard om apart te noemen. OpenCode noemde een budget in de orde van honderd biljoen tokens per dag — en dat werd allemaal gratis weggegeven. Niemand verbrandt zoveel "gewoon om te testen". Het lijkt erop dat iemand bewust een enorme stroom echte requests door het model duwde, niet een handvol demo-voorbeelden voor een gelikte aankondiging.
Hoe de maker vóór de aankondiging werd ontmaskerd
Het interessantste is dat Z.ai nauwelijks de kans kreeg om iemand te verrassen. De community had de afkomst van Ox Alpha ruim vóór de officiële bevestiging al door — en niet dankzij slimme gokjes, maar door kleine technische aanwijzingen.
Eerst de tokenizer. De manier waarop een model tekst in stukjes hakt, is bijna een familiefingerprint. Die van Ox Alpha kwam verdacht goed overeen met wat mensen al bij GLM hadden gezien. Ten tweede het gedrag bij gevoelige onderwerpen: het model ontweek vragen over Chinese politiek op karakteristieke wijze — precies zoals modellen doen die in China zijn getraind. Tel daarbij bepaalde API-foutcodes op die ook aan bekende families deden denken. Los van elkaar kan elke aanwijzing toeval zijn, maar samen leverden ze een vrij overtuigend "dit is een van de Chinese frontierlabs, waarschijnlijk de GLM-lijn" op.
En zo bleek het ook te zijn. Op 26 augustus bevestigde Z.ai dat Ox Alpha en GLM 5.3 Flash één en hetzelfde model zijn, en publiceerde het meteen de gewichten en benchmarks.
Wat GLM 5.3 Flash is
Dan de inhoud. GLM 5.3 Flash is, in Z.ai's eigen woorden, het eerste native multimodale model in de GLM-5-serie. "Native" is hier het sleutelwoord: het model is niet achteraf aan een aparte beeldherkenner vastgeschroefd — het is vanaf het begin getraind om verschillende datatypes als één enkele stroom te verwerken.
Onder de motorkap zit een Mixture-of-Experts-architectuur (MoE). Heel simpel gezegd: in plaats van één gigantisch netwerk dat bij elke request in zijn geheel aan het zwoegen is, is het model opgesplitst in veel "experts", waarvan er per token maar een kleine subset actief wordt. Formeel heeft GLM 5.3 Flash 320 miljard parameters, maar op elk moment zijn er maar ongeveer 18 miljard actief. Daardoor gedraagt het model zich als iets groots en slims, terwijl de kosten dichter bij iets kleins liggen. Daarbovenop gebruikt het hybrid sparse-linear attention — een mechanisme dat helpt de nauwkeurigheid bij zeer lange context vast te houden zonder de rekenrekening te laten ontploffen.
De belangrijkste kenmerken, samengevat in één lijst:
- Context — tot 1 miljoen tokens. Dat zijn letterlijk complete codebases of dikke documenten die je in één keer laadt.
- Maximale output — tot 131.072 tokens tegelijk.
- Input — tekst, afbeeldingen en video.
- Specialisatie — code en agentic scenario's: taken in meerdere stappen waarbij het model zelf tools aanroept en het werk tot een resultaat brengt.
- Gewichten — gepubliceerd op HuggingFace onder de MIT-licentie. Met andere woorden: het model is echt open; je kunt het downloaden en zelf draaien.
Dat laatste punt verdient nadruk. Een open MIT-licentie betekent niet "kijk ernaar en bewonder het" — het is toestemming om het model in je eigen producten te gebruiken, met bijna geen beperkingen. Voor een frontiermodel van dit kaliber is dat nog steeds zeldzaam.
Hoe goed is het
Z.ai rapporteert zijn cijfers op zijn interne benchmark, Code Bench v1.0. Volgens die benchmark "overtreft" GLM 5.3 Flash de vorige GLM-5.2 duidelijk op elk moeilijkheidsniveau en "presteert het op hetzelfde niveau" als Claude Opus 4.8 in programmeer- en agentic taken. Interne benchmarks moet je altijd met een gezonde dosis scepsis bekijken — ze worden beoordeeld door hetzelfde team dat het model heeft getraind — maar zelfs als je daarvoor corrigeert, is de claim serieus. Meekomen met Opus 4.8 in code is het niveau van de beste westerse modellen, niet van een "solide middenklasser".
En hier komt de tweede helft van het verhaal om de hoek kijken: de prijs. Bij de provider is GLM 5.3 Flash ronduit goedkoop voor zijn klasse:
| Tokentype | Prijs per 1M |
|---|---|
| Input | $0.15 |
| Output | $0.50 |
| Gecachte input | $0.03 |
Ter vergelijking: vergelijkbaar sterke westerse modellen zijn meestal meerdere keren duurder, soms zelfs een orde van grootte. Deze combinatie — "bijna als Opus in code, maar voor de prijs van een lichtgewicht model" — is de belangrijkste reden dat er al zoveel rumoer rond Ox Alpha was voordat iemand wist van wie het was.
Wat is de adder onder het gras
Helemaal zonder kanttekeningen komt het niet, en het is eerlijker om die meteen te noemen.
Ten eerste — privacy. De provider die het model uitdeelde, bewaart je prompts en responses. Formeel niet voor training, maar het blijft een feit: je requests worden ergens opgeslagen. Voor publieke taken is dat geen probleem, maar werkgeheimen, commerciële correspondentie of persoonlijke data kun je beter uit de buurt van zo'n model houden.
Ten tweede — het is nog steeds een verse release. De interne benchmarks zien er mooi uit, maar alleen onafhankelijke runs en maanden livegebruik geven het volledige beeld. Behandel het model voorlopig als zeer veelbelovend, maar nog niet door de tijd gehard.
GLM 5.3 Flash op ChatPlus
We hebben dit model al in de "stealth"-fase toegevoegd, onder de naam Ox Alpha, en het bijgewerkt voor de officiële release — overgezet naar de huidige endpoint, naam en prijzen rechtgezet. Je kunt het nu meteen proberen: open een chat met GLM 5.3 Flash. Twee dingen die goed zijn om te weten:
- Het model is beschikbaar met het PRO-abonnement. Zonder gedoe.
- We hebben het bewust uit auto-selection gehouden. Vanwege datzelfde verhaal over requests die bij de provider worden opgeslagen, willen we niet dat het model stilletjes de standaard wordt. Laat GLM 5.3 Flash een bewuste keuze zijn: je zet het aan als je weet waarom.
Het voelt als een uitstekende optie voor code en lange agentic scenario's, zeker wanneer je een grote context nodig hebt en er geen probleem mee hebt om een hele codebase op een taak los te laten. Het is ook een goede aanleiding om het verse model van Z.ai in één venster naast de vertrouwde GPT, Claude en Gemini te leggen — op ChatPlus hoef je alleen maar het model in de chat te wisselen.
In het kort
Ox Alpha bleek geen mysterieuze nieuwkomer, maar GLM 5.3 Flash — het nieuwe multimodale model van Z.ai. Het is sterk in code, houdt een context van een miljoen tokens vast, kost naar de maatstaven van zijn klasse bijna niets en wordt geleverd onder een open licentie. Aan de andere kant: de provider bewaart je requests, en het model is nog te nieuw om er definitief over te oordelen. Het is absoluut het proberen waard: op ChatPlus is het al beschikbaar met het PRO-abonnement.
Probeer de beste AI-modellen op ChatPlus
GPT, Claude, Gemini, GLM en andere AI-modellen in één venster.