GLM 5.3 Flash: bagaimana model “stealth” Ox Alpha ternyata jaringan baru dari Z.ai
Selama beberapa pekan, para developer menebak-nebak model kuat tanpa nama apa yang muncul di OpenRouter dengan nama kode Ox Alpha. Pada 26 Agustus, Z.ai dari Tiongkok membuka kartunya: itu adalah GLM 5.3 Flash — model multimodal native pertama dalam seri GLM-5. Mari kita bedah kemampuannya, asal-usulnya, dan apakah Anda layak memercayakan data Anda kepadanya.

Selama beberapa pekan, obrolan para developer terus berputar di pertanyaan yang sama: makhluk macam apa sebenarnya Ox Alpha ini? Model itu muncul di katalog OpenRouter dan di agent open-source OpenCode tanpa pengumuman apa pun — tanpa nama tim, tanpa model card, tanpa satu baris dokumentasi. Sebuah jaringan yang kuat tiba-tiba muncul begitu saja, dan lebih dari itu, aksesnya dibagikan gratis. Orang-orang menjalankannya untuk tugas mereka sendiri, saling bertukar tangkapan layar, dan berdebat siapa pembuatnya. Pada 26 Agustus 2026, misteri itu terjawab: lab Tiongkok Z.ai maju dan berkata — ya, ini buatan kami, dan modelnya bernama GLM 5.3 Flash.
Ceritanya sendiri cukup menarik, tetapi di baliknya ada sesuatu yang lebih penting daripada gosip soal rilis anonim. Mari kita urutkan: apa itu peluncuran "stealth", bagaimana komunitas mengidentifikasi pembuatnya sebelum pengumuman resmi, apa saja yang sebenarnya bisa dilakukan GLM 5.3 Flash, dan — yang paling penting — apakah model ini layak Anda pakai untuk pekerjaan sehari-hari.
Mengapa merilis model secara anonim
Taktik ini disebut rilis "stealth", dan selama setahun terakhir lab-lab Tiongkok khususnya makin gemar memakainya. Skemanya sederhana: Anda menaruh model di platform bersama seperti OpenRouter, tetapi tanpa branding apa pun — hanya dengan nama kode netral. Anda memberi akses, sering kali gratis, lalu tinggal mengamati apa yang terjadi.
Tujuannya adalah mendapatkan masukan yang jujur. Ketika model card menyebut "model baru dari lab besar tertentu," separuh reaksi orang dipengaruhi ekspektasi dan reputasi, bukan model itu sendiri. Tetapi tidak ada yang gentar pada "Ox Alpha" tanpa nama, dan tidak ada yang merasa berutang apa pun kepadanya: developer tinggal memakainya untuk bekerja, menjebolnya dengan tugas nyata mereka, lalu di obrolan yang sama menulis bagian mana yang bagus dan bagian mana yang berantakan. Bagi sebuah tim, ini cara murah untuk menarik metrik dari penggunaan langsung sebelum mesin PR dinyalakan.
Ada satu sinyal lain yang layak dicatat terpisah. OpenCode menyebut anggaran di kisaran seratus triliun token per hari — dan semuanya diberikan gratis. Tidak ada yang membakar sebanyak itu "hanya untuk pengujian." Ini terlihat seperti ada pihak yang sengaja mendorong arus permintaan nyata dalam volume sangat besar melalui model tersebut, bukan sekadar segelintir contoh demo untuk pengumuman yang manis.
Bagaimana pembuatnya terbongkar sebelum pengumuman
Bagian paling menariknya adalah Z.ai nyaris tidak sempat mengejutkan siapa pun. Komunitas sudah menebak garis keturunan Ox Alpha jauh sebelum pengakuan resmi — bukan dari tebakan cerdas, melainkan dari petunjuk teknis kecil.
Pertama, tokenizer. Cara sebuah model memotong teks menjadi bagian-bagian kecil hampir seperti sidik jari keluarga. Tokenizer Ox Alpha sangat mencurigakan karena cocok dengan apa yang sebelumnya sudah dilihat orang pada GLM. Kedua, perilakunya pada topik sensitif: model ini secara khas menghindari pertanyaan tentang politik Tiongkok — persis seperti model yang dilatih di dalam Tiongkok. Tambahkan lagi beberapa kode error API yang juga mirip dengan keluarga model yang sudah dikenal. Masing-masing petunjuk mungkin kebetulan, tetapi jika digabungkan semuanya mengarah pada kesimpulan yang cukup kuat: "ini salah satu lab frontier Tiongkok, kemungkinan besar lini GLM."
Dan begitulah hasilnya. Pada 26 Agustus, Z.ai mengonfirmasi bahwa Ox Alpha dan GLM 5.3 Flash adalah model yang sama, sekaligus merilis weights dan benchmark-nya.
Apa itu GLM 5.3 Flash
Sekarang ke substansinya. GLM 5.3 Flash, menurut Z.ai sendiri, adalah model multimodal native pertama dalam seri GLM-5. Kata "native" di sini penting: model ini bukan ditempeli pengenal gambar terpisah belakangan — sejak awal ia dilatih untuk menangani berbagai jenis data sebagai satu aliran terpadu.
Di balik layar ada arsitektur Mixture-of-Experts (MoE). Sederhananya begini: alih-alih satu jaringan raksasa yang seluruhnya bekerja keras untuk setiap permintaan, model dipecah menjadi banyak "expert," dan hanya sebagian kecil dari mereka yang aktif untuk tiap token. Secara formal GLM 5.3 Flash memiliki 320 miliar parameter, tetapi hanya sekitar 18 miliar yang aktif pada satu waktu. Berkat ini, model terasa seperti sesuatu yang besar dan cerdas, tetapi biayanya lebih mendekati model kecil. Selain itu, ia memakai hybrid sparse-linear attention — mekanisme yang membantu menjaga akurasi pada konteks yang sangat panjang tanpa membuat biaya komputasi membengkak.
Karakteristik utamanya, diringkas dalam satu daftar:
- Konteks — hingga 1 juta token. Secara harfiah, ini berarti seluruh codebase atau dokumen tebal bisa dimuat dalam sekali jalan.
- Output maksimum — hingga 131.072 token sekaligus.
- Input — teks, gambar, dan video.
- Spesialisasi — kode dan skenario agentic: tugas multi-langkah ketika model memanggil tool sendiri dan membawa pekerjaan sampai ke hasil akhir.
- Weights — dipublikasikan di HuggingFace dengan lisensi MIT. Artinya, model ini benar-benar terbuka: Anda bisa mengunduh dan menjalankannya sendiri.
Poin terakhir layak ditekankan. Lisensi MIT yang terbuka bukan berarti "lihat dan kagumi" — melainkan izin untuk memakai model ini di produk Anda sendiri dengan nyaris tanpa batasan. Untuk model frontier sekelas ini, hal itu masih langka.
Seberapa bagus model ini
Z.ai melaporkan angkanya di benchmark internal mereka, Code Bench v1.0. Menurut benchmark itu, GLM 5.3 Flash "jelas melampaui" GLM-5.2 sebelumnya di setiap tingkat kesulitan dan "setara" dengan Claude Opus 4.8 dalam tugas pemrograman dan agentic. Benchmark internal harus selalu disikapi dengan skeptisisme yang sehat — penilainya adalah tim yang sama dengan yang melatih model — tetapi bahkan setelah memperhitungkan itu, klaimnya tetap serius. Mengimbangi Opus 4.8 dalam urusan kode adalah level model Barat papan atas, bukan sekadar "kelas menengah yang solid."
Di sinilah paruh kedua ceritanya masuk — harga. Di provider-nya, GLM 5.3 Flash terus terang murah untuk kelasnya:
| Jenis token | Harga per 1M |
|---|---|
| Input | $0.15 |
| Output | $0.50 |
| Input cache | $0.03 |
Sebagai perbandingan: model Barat dengan kekuatan sebanding biasanya beberapa kali lebih mahal, kadang sampai satu orde magnitudo. Kombinasi ini — "nyaris seperti Opus untuk kode, tetapi dengan harga model ringan" — adalah alasan utama mengapa Ox Alpha begitu ramai dibicarakan bahkan sebelum siapa pun tahu siapa pemiliknya.
Apa kekurangannya
Model ini tidak sepenuhnya bebas catatan, dan lebih jujur jika disebutkan di awal.
Pertama — privasi. Provider yang membagikan model ini menyimpan prompt dan respons Anda. Secara formal bukan untuk pelatihan, tetapi faktanya tetap sama: permintaan Anda disimpan di suatu tempat. Untuk tugas publik, ini bukan masalah, tetapi rahasia kerja, korespondensi komersial, atau data pribadi sebaiknya tidak dimasukkan ke model seperti ini.
Kedua — ini masih rilis baru. Benchmark internal tampak mengesankan, tetapi hanya pengujian independen dan penggunaan langsung selama berbulan-bulan yang akan memberi gambaran lengkap. Untuk saat ini, anggap model ini sangat menjanjikan, tetapi belum benar-benar teruji oleh waktu.
GLM 5.3 Flash di ChatPlus
Kami menambahkan model ini sejak fase "stealth"-nya, dengan nama Ox Alpha, lalu memperbaruinya untuk rilis resmi — berpindah ke endpoint saat ini, memperbaiki nama dan harga. Anda bisa mencobanya sekarang: buka chat dengan GLM 5.3 Flash. Ada dua hal yang perlu diketahui:
- Model ini tersedia di langganan PRO. Tanpa proses yang berbelit.
- Kami sengaja tidak memasukkannya ke auto-selection. Karena cerita yang sama soal permintaan yang disimpan di sisi provider, kami tidak ingin model ini diam-diam menjadi default. Biarkan GLM 5.3 Flash menjadi pilihan yang disengaja: Anda mengaktifkannya ketika tahu alasannya.
Model ini terasa seperti opsi yang sangat bagus untuk kode dan skenario agentic panjang, terutama ketika Anda membutuhkan konteks besar dan tidak keberatan memasukkan satu codebase penuh ke sebuah tugas. Ini juga alasan bagus untuk membandingkan model terbaru Z.ai dengan GPT, Claude, dan Gemini yang sudah akrab dalam satu jendela — di ChatPlus, Anda cukup mengganti model di chat.
Singkatnya
Ox Alpha ternyata bukan pendatang baru misterius, melainkan GLM 5.3 Flash — model multimodal baru dari Z.ai. Ia kuat untuk kode, menampung konteks sejuta token, biayanya sangat murah untuk standar kelasnya, dan dirilis dengan lisensi terbuka. Sisi kurangnya — provider menyimpan permintaan Anda, dan model ini masih terlalu baru untuk dinilai secara final. Jelas layak dicoba: di ChatPlus model ini sudah tersedia pada langganan PRO.