live
10 labs · 30 models
Lahat ng article
8 min na basaChatPlus Team

GLM 5.3 Flash: paano naging bagong network ng Z.ai ang “stealth” model na Ox Alpha

Sa loob ng ilang linggo, hinulaan ng developers kung anong makapangyarihang model na walang pangalan ang lumitaw sa OpenRouter sa code name na Ox Alpha. Noong August 26, ipinakita ng Z.ai ng China ang baraha nito: ito ang GLM 5.3 Flash — ang unang natively multimodal model sa GLM-5 series. Silipin natin kung ano ang kaya nito, saan ito nagmula, at kung dapat mo bang ipagkatiwala rito ang data mo.

Mga ModelZ.aiGLMBalita
Isang kumikinang na purple na GLM crystal sa itim na background — cover art para sa artikulo tungkol sa GLM 5.3 Flash
Pakinggan ang article00:00

Sa loob ng ilang linggo, iisang tanong ang paulit-ulit na umiikot sa developer chats: anong klaseng hayop ba itong Ox Alpha? Lumitaw ang model sa catalog ng OpenRouter at sa open-source agent na OpenCode nang walang kahit anong babala — walang team name, walang model card, ni isang linya ng documentation. Bigla na lang may sumulpot na malakas na network, at bukod pa roon, libre pa itong ipinapagamit. Sinubukan ito ng mga tao sa sarili nilang tasks, nagpalitan ng screenshots, at nagtalo kung sino ang gumawa nito. Noong August 26, 2026, natapos ang misteryo: lumantad ang Chinese lab na Z.ai at sinabi — oo, kami iyon, at ang model ay tinatawag na GLM 5.3 Flash.

Nakakatuwa na ang kuwento sa sarili nito, pero may mas interesante sa likod nito kaysa tsismis tungkol sa anonymous release. Isa-isahin natin: ano ang mga "stealth" launch na ito, paano natukoy ng community ang gumawa bago pa ang announcement, ano talaga ang kaya ng GLM 5.3 Flash, at — pinakamahalaga — sulit ba itong lipatan para sa araw-araw na trabaho.

Bakit magre-release ng model nang anonymous

Tinatawag ang taktika na "stealth" release, at nitong nakaraang taon, partikular na nahilig dito ang Chinese labs. Simple ang galaw: ipo-post mo ang model sa isang shared platform gaya ng OpenRouter, pero walang kahit anong branding — sa ilalim ng neutral na code name. Magbibigay ka ng access, madalas libre, at manonood ka lang kung ano ang mangyayari.

Ang punto ay makakuha ng tapat na feedback. Kapag nakasulat sa model card na "bagong model mula sa isang kilalang lab," kalahati ng reaksyon ay tungkol na sa expectations at reputasyon, hindi sa mismong model. Pero walang natatakot sa walang-pangalang "Ox Alpha" at wala rin itong utang na loob kaninuman: ginagamit lang ito ng developers sa tunay nilang trabaho, binabasag ito sa real tasks nila, at sa parehong chats nila isinusulat kung saan ito magaling at saan ito bumibigay. Para sa isang team, murang paraan iyon para humugot ng metrics mula sa live usage bago pa paandarin ang PR machine.

May isa pang signal na dapat banggitin nang hiwalay. Binanggit ng OpenCode ang budget na nasa antas ng isang daang trilyong tokens kada araw — at lahat iyon ay ipinamimigay nang libre. Walang nagsusunog ng ganoon kalaki "para lang sa testing." Mukhang may sadyang nagpapadaan ng napakalaking agos ng tunay na requests sa model, hindi lang ilang demo examples para sa magandang announcement.

Paano natukoy ang gumawa bago ang announcement

Ang pinakainteresanteng bahagi ay halos hindi na nagkaroon ng pagkakataon ang Z.ai na gulatin ang sinuman. Natukoy ng community ang pinagmulan ng Ox Alpha bago pa ang opisyal na pag-amin — at hindi dahil sa matatalinong hula, kundi dahil sa maliliit na technical clues.

Una, ang tokenizer. Ang paraan ng isang model sa paghihiwa-hiwa ng text ay halos parang fingerprint ng pamilya nito. Kahina-hinalang tugma ang sa Ox Alpha sa nakita na ng mga tao sa GLM. Pangalawa, ang behavior nito sa sensitibong paksa: tipikal na umiiwas ang model sa mga tanong tungkol sa Chinese politics — eksaktong gaya ng models na tinrain sa loob ng China. Idagdag pa rito ang ilang API error codes na kahawig din ng mga kilalang pamilya. Mag-isa, maaaring coincidence ang bawat clue, pero pagsama-samahin, sapat ang bigat nito para masabing "isa ito sa Chinese frontier labs, malamang mula sa GLM line."

At ganoon nga ang nangyari. Noong August 26, kinumpirma ng Z.ai na iisang model ang Ox Alpha at GLM 5.3 Flash, at kasabay nitong inilabas ang weights at benchmarks nito.

Ano ang GLM 5.3 Flash

Punta na tayo sa laman. Sa mismong salita ng Z.ai, ang GLM 5.3 Flash ay ang unang natively multimodal model sa GLM-5 series. "Natively" ang mahalagang salita rito: hindi ito model na pagkatapos lang ay kinabitan ng hiwalay na image recognizer — mula sa simula, tinrain na ito para hawakan ang iba’t ibang uri ng data bilang iisang stream.

Sa ilalim nito ay Mixture-of-Experts (MoE) architecture. Sa pinakasimpleng paliwanag: imbes na isang higanteng network na buong-buong pinapagana sa bawat request, hinahati ang model sa maraming "experts," at maliit na subset lang ng mga ito ang umaandar para sa bawat token. Sa pormal na bilang, may 320 billion parameters ang GLM 5.3 Flash, pero mga 18 billion lang ang active sa anumang sandali. Dahil dito, kumikilos ang model na parang malaki at matalino, habang ang gastos ay mas malapit sa maliit na model. Bukod pa roon, gumagamit ito ng hybrid sparse-linear attention — isang mechanism na tumutulong panatilihin ang accuracy sa napakahabang context nang hindi pinalolobo ang compute bill.

Ang mahahalagang katangian, pinasimple sa isang listahan:

  • Context — hanggang 1 million tokens. Literal na buong codebases o makakapal na documents ang kayang i-load sa isang pasada.
  • Max output — hanggang 131,072 tokens nang sabay.
  • Input — text, images, at video.
  • Specialization — code at agentic scenarios: multi-step tasks kung saan ang model mismo ang tumatawag ng tools at dinadala ang trabaho hanggang sa resulta.
  • Weights — inilathala sa HuggingFace sa ilalim ng MIT license. Ibig sabihin, tunay na open ang model: puwede mo itong i-download at patakbuhin nang ikaw mismo.

Mahalagang idiin ang huling punto. Ang open MIT license ay hindi "tingnan at hangaan" — permiso itong gamitin ang model sa sarili mong products na halos walang restrictions. Para sa frontier model na ganito ang caliber, bihira pa rin iyon.

Gaano ito kagaling

Iniuulat ng Z.ai ang numbers nito sa internal benchmark nito, ang Code Bench v1.0. Ayon dito, "malinaw na nalalampasan" ng GLM 5.3 Flash ang nakaraang GLM-5.2 sa bawat difficulty level at "kapantay" nito ang Claude Opus 4.8 sa programming at agentic tasks. Dapat laging may healthy dose of skepticism sa internal benchmarks — ang nag-score ay ang parehong team na nag-train ng model — pero kahit i-adjust mo iyon, mabigat ang claim. Ang makasabay sa Opus 4.8 sa code ay antas ng top Western models, hindi ng "solid mid-tier."

At dito pumapasok ang ikalawang kalahati ng kuwento — presyo. Sa provider, prangkahang mura ang GLM 5.3 Flash para sa klase nito:

Uri ng tokenPresyo kada 1M
Input$0.15
Output$0.50
Cached input$0.03

Para sa paghahambing: ang Western models na katulad ang lakas ay karaniwang ilang ulit na mas mahal, minsan umaabot pa sa isang order of magnitude. Ang kombinasyong ito — "halos parang Opus sa code, pero presyong lightweight model" — ang pangunahing dahilan kung bakit sobrang ingay ang Ox Alpha bago pa nalaman ng sinuman kung kanino ito.

Ano ang kapalit

Hindi ito lubusang walang caveats, at mas tapat na pangalanan agad ang mga ito.

Una — privacy. Iniimbak ng provider na nagbigay ng model ang prompts at responses mo. Pormal na hindi para sa training, pero nananatili ang katotohanan: naka-store ang requests mo sa kung saan. Para sa public tasks, hindi iyon problema, pero mas mabuting ilayo sa model na ganito ang work secrets, commercial correspondence, o personal data.

Pangalawa — bagong release pa rin ito. Maganda ang internal benchmarks, pero independent runs at ilang buwang live use lang ang magbibigay ng buong larawan. Sa ngayon, ituring ang model bilang napaka-promising, pero hindi pa subok ng panahon.

GLM 5.3 Flash sa ChatPlus

Idinagdag namin ang model na ito noong nasa "stealth" phase pa ito, sa pangalang Ox Alpha, at in-update namin ito para sa official release — lumipat sa kasalukuyang endpoint, inayos ang pangalan at presyo. Puwede mo na itong subukan ngayon: magbukas ng chat gamit ang GLM 5.3 Flash. Dalawang bagay ang dapat malaman:

  • Available ang model sa PRO subscription. Walang kailangang lusutan.
  • Sinadya naming hindi ito isama sa auto-selection. Dahil sa parehong kuwento tungkol sa requests na naka-store sa panig ng provider, ayaw naming tahimik na maging default ang model. Hayaan nating maging sinasadyang choice ang GLM 5.3 Flash: io-on mo ito kapag alam mo kung bakit.

Pakiramdam namin, mahusay itong option para sa code at mahahabang agentic scenarios, lalo na kapag kailangan mo ng malaking context at hindi ka nag-aalangan na ipagamit ang buong codebase sa isang task. Magandang dahilan din ito para ikumpara ang sariwang model ng Z.ai sa pamilyar na GPT, Claude, at Gemini sa iisang window — sa ChatPlus, kailangan mo lang palitan ang model sa chat.

Sa madaling sabi

Ang Ox Alpha pala ay hindi misteryosong newcomer kundi GLM 5.3 Flash — ang bagong multimodal model ng Z.ai. Malakas ito sa code, kayang humawak ng isang milyong tokens ng context, halos barya ang gastos ayon sa standards ng klase nito, at inilalabas sa ilalim ng open license. Sa downside — iniimbak ng provider ang requests mo, at masyado pang bago ang model para hatulan nang pinal. Talagang sulit itong subukan: sa ChatPlus, available na ito sa PRO subscription.

Subukan ang pinakamahusay na AI models sa ChatPlus

GPT, Claude, Gemini, GLM, at iba pang AI models sa iisang window.