GLM 5.3 Flash: jak „ukryty” model Ox Alpha okazał się nową siecią Z.ai
Przez kilka tygodni deweloperzy zgadywali, jaki potężny, bezimienny model pojawił się na OpenRouter pod kryptonimem Ox Alpha. 26 sierpnia chińskie Z.ai odkryło karty: to GLM 5.3 Flash — pierwszy natywnie multimodalny model z serii GLM-5. Sprawdźmy, co potrafi, skąd się wziął i czy warto powierzać mu swoje dane.

Przez kilka tygodni czaty deweloperów kręciły się wokół jednego pytania: co to za bestia, ten Ox Alpha? Model pojawił się w katalogu OpenRouter i w open-source’owym agencie OpenCode bez żadnego uprzedzenia — bez nazwy zespołu, bez karty modelu, bez choćby linijki dokumentacji. Po prostu znikąd pojawiła się mocna sieć, a do tego rozdawano do niej dostęp za darmo. Ludzie odpalali ją na własnych zadaniach, wymieniali się screenshotami, kłócili się, kto mógł ją zrobić. 26 sierpnia 2026 roku zagadka się wyjaśniła: chińskie laboratorium Z.ai wyszło z cienia i powiedziało — tak, to my, a model nazywa się GLM 5.3 Flash.
Ta historia sama w sobie jest zabawna, ale kryje się za nią coś ciekawszego niż plotki o anonimowej premierze. Weźmy to po kolei: czym są takie „ukryte” starty, jak społeczność rozpoznała autora jeszcze przed ogłoszeniem, co GLM 5.3 Flash faktycznie potrafi i — co najważniejsze — czy warto przestawić się na niego w codziennej pracy.
Po co w ogóle wypuszczać model anonimowo
Ta taktyka nazywa się „stealth” release i w ostatnim roku szczególnie polubiły ją chińskie laboratoria. Schemat jest prosty: wrzucasz model na wspólną platformę typu OpenRouter, ale bez żadnego brandingu — pod neutralnym kryptonimem. Dajesz dostęp, często darmowy, i po prostu patrzysz, co się stanie.
Chodzi o szczery feedback. Gdy karta modelu mówi „nowy model od znanego laboratorium”, połowa reakcji wynika z oczekiwań i reputacji, a nie z samego modelu. Bezimiennego „Ox Alpha” nikt się jednak nie boi i nikt nie ma wobec niego zobowiązań: deweloperzy po prostu zaprzęgają go do pracy, łamią na prawdziwych zadaniach i na tych samych czatach opisują, gdzie jest dobry, a gdzie się sypie. Dla zespołu to tani sposób na wyciągnięcie metryk z realnego użycia, zanim odpali się machinę PR.
Jeszcze jeden sygnał zasługiwał na osobną uwagę. OpenCode wspominał o budżecie rzędu stu bilionów tokenów dziennie — i wszystko to rozdawano za darmo. Nikt nie przepala takich ilości „tylko do testów”. Wygląda to tak, jakby ktoś celowo przepuszczał przez model ogromny strumień prawdziwych zapytań, a nie garść demonstracyjnych przykładów pod ładne ogłoszenie.
Jak rozpracowano autora przed ogłoszeniem
Najciekawsze jest to, że Z.ai ledwo zdążyło kogokolwiek zaskoczyć. Społeczność ustaliła rodowód Ox Alpha na długo przed oficjalnym potwierdzeniem — i nie dzięki sprytnym zgadywankom, tylko na podstawie drobnych technicznych poszlak.
Po pierwsze, tokenizer. Sposób, w jaki model tnie tekst na kawałki, jest niemal jak rodzinny odcisk palca. U Ox Alpha podejrzanie dobrze pasował do tego, co ludzie widzieli już w GLM. Po drugie, zachowanie przy drażliwych tematach: model charakterystycznie wymijał pytania o chińską politykę — dokładnie tak, jak robią to modele trenowane w Chinach. Do tego doszły pewne kody błędów API, które również przypominały znane rodziny. Każda z tych wskazówek z osobna mogłaby być przypadkiem, ale razem składały się na dość pewne „to jedno z chińskich laboratoriów frontier, najpewniej linia GLM”.
I tak właśnie było. 26 sierpnia Z.ai potwierdziło, że Ox Alpha i GLM 5.3 Flash to ten sam model, a wraz z tym opublikowało jego wagi i benchmarki.
Czym jest GLM 5.3 Flash
Przejdźmy do konkretów. GLM 5.3 Flash to, według samego Z.ai, pierwszy natywnie multimodalny model w serii GLM-5. „Natywnie” jest tu słowem kluczem: do modelu nie doklejono po fakcie osobnego rozpoznawacza obrazów — od początku trenowano go tak, by obsługiwał różne typy danych jako jeden strumień.
Pod maską działa architektura Mixture-of-Experts (MoE). Mówiąc bardzo prosto: zamiast jednej gigantycznej sieci, która przy każdym zapytaniu pracuje cała naraz, model jest podzielony na wielu „ekspertów”, a dla każdego tokena uruchamia się tylko niewielka ich część. Formalnie GLM 5.3 Flash ma 320 miliardów parametrów, ale w danej chwili aktywnych jest tylko około 18 miliardów. Dzięki temu model zachowuje się jak coś dużego i inteligentnego, a kosztuje bardziej jak coś małego. Do tego używa hybrydowej sparse-linear attention — mechanizmu, który pomaga utrzymać dokładność przy bardzo długim kontekście bez pompowania rachunku za obliczenia.
Najważniejsze cechy, zebrane w jednej liście:
- Kontekst — do 1 miliona tokenów. To dosłownie całe codebase’y albo opasłe dokumenty wczytane za jednym razem.
- Maksymalna odpowiedź — do 131 072 tokenów naraz.
- Wejście — tekst, obrazy i wideo.
- Specjalizacja — kod i scenariusze agentowe: wieloetapowe zadania, w których model sam wywołuje narzędzia i doprowadza pracę do wyniku.
- Wagi — opublikowane na HuggingFace na licencji MIT. Czyli model jest naprawdę otwarty: możesz go pobrać i uruchomić samodzielnie.
Ostatni punkt warto podkreślić. Otwarta licencja MIT to nie „popatrz i podziwiaj” — to zgoda na używanie modelu we własnych produktach niemal bez ograniczeń. W przypadku modelu frontier tej klasy to wciąż rzadkość.
Jak dobry jest
Z.ai podaje wyniki na swoim wewnętrznym benchmarku, Code Bench v1.0. Według niego GLM 5.3 Flash „wyraźnie przewyższa” poprzedniego GLM-5.2 na każdym poziomie trudności i „wypada porównywalnie” z Claude Opus 4.8 w programowaniu oraz zadaniach agentowych. Do wewnętrznych benchmarków zawsze warto podchodzić ze zdrową dawką sceptycyzmu — ocenia je ten sam zespół, który trenował model — ale nawet po uwzględnieniu tego zastrzeżenia to mocna deklaracja. Trzymanie tempa Opus 4.8 w kodzie to poziom topowych zachodnich modeli, a nie „solidnej średniej półki”.
I tu wchodzi druga połowa historii — cena. U dostawcy GLM 5.3 Flash jest, szczerze mówiąc, tani jak na swoją klasę:
| Typ tokenów | Cena za 1M |
|---|---|
| Wejście | $0.15 |
| Wyjście | $0.50 |
| Wejście z cache | $0.03 |
Dla porównania: zachodnie modele o podobnej sile są zwykle kilka razy droższe, czasem nawet o rząd wielkości. To połączenie — „prawie jak Opus w kodzie, ale w cenie lekkiego modelu” — jest głównym powodem, dla którego wokół Ox Alpha było tyle szumu, zanim ktokolwiek wiedział, czyje to dzieło.
Gdzie jest haczyk
Nie obywa się bez zastrzeżeń i uczciwiej nazwać je od razu.
Po pierwsze — prywatność. Dostawca, który udostępniał model, przechowuje Twoje prompty i odpowiedzi. Formalnie nie do trenowania, ale fakt pozostaje faktem: Twoje zapytania są gdzieś zapisywane. Przy publicznych zadaniach to nie problem, ale sekrety zawodowe, korespondencję biznesową czy dane osobowe lepiej trzymać z dala od takiego modelu.
Po drugie — to wciąż świeża premiera. Wewnętrzne benchmarki wyglądają ładnie, ale pełny obraz dadzą dopiero niezależne testy i miesiące użycia w praktyce. Na razie traktuj ten model jako bardzo obiecujący, ale jeszcze niesprawdzony przez czas.
GLM 5.3 Flash w ChatPlus
Dodaliśmy ten model jeszcze w fazie „stealth”, pod nazwą Ox Alpha, a przy oficjalnej premierze go zaktualizowaliśmy — przełączyliśmy na aktualny endpoint, poprawiliśmy nazwę i ceny. Możesz wypróbować go już teraz: otwórz czat z GLM 5.3 Flash. Warto wiedzieć dwie rzeczy:
- Model jest dostępny w subskrypcji PRO. Bez żadnych dodatkowych kombinacji.
- Celowo nie dodaliśmy go do automatycznego wyboru. Właśnie przez tę historię z przechowywaniem zapytań po stronie dostawcy nie chcemy, żeby model po cichu stał się domyślny. Niech GLM 5.3 Flash będzie świadomym wyborem: włączasz go wtedy, kiedy wiesz po co.
Wygląda na świetną opcję do kodu i długich scenariuszy agentowych, zwłaszcza gdy potrzebujesz dużego kontekstu i nie masz oporów, żeby wrzucić w zadanie całe repozytorium. To też dobra okazja, żeby porównać świeży model Z.ai ze znajomymi GPT, Claude i Gemini w jednym oknie — w ChatPlus po prostu przełączasz model na czacie.
W skrócie
Ox Alpha okazał się nie tajemniczym debiutantem, lecz GLM 5.3 Flash — nowym multimodalnym modelem Z.ai. Jest mocny w kodzie, mieści milion tokenów kontekstu, kosztuje grosze jak na swoją klasę i wychodzi na otwartej licencji. Minusy: dostawca przechowuje Twoje zapytania, a model jest jeszcze zbyt świeży, by oceniać go ostatecznie. Zdecydowanie warto go sprawdzić: w ChatPlus jest już dostępny w subskrypcji PRO.
Wypróbuj najlepsze modele AI w ChatPlus
GPT, Claude, Gemini, GLM i inne modele AI w jednym oknie.