live
10 labs · 30 models
전체 글
8분 읽기ChatPlus Team

GLM 5.3 Flash: ‘스텔스’ 모델 Ox Alpha의 정체는 Z.ai의 새 네트워크였어요

몇 주 동안 개발자들은 OpenRouter에 Ox Alpha라는 코드명으로 등장한 강력한 무명 모델의 정체를 두고 추측을 이어갔어요. 8월 26일, 중국의 Z.ai가 카드를 공개했습니다. 바로 GLM 5.3 Flash — GLM-5 시리즈 최초의 네이티브 멀티모달 모델이었죠. 무엇을 할 수 있는지, 어디서 왔는지, 그리고 여러분의 데이터를 맡겨도 되는지 살펴볼게요.

모델Z.aiGLM뉴스
검은 배경 위에서 보라색으로 빛나는 GLM 크리스털 — GLM 5.3 Flash 글의 커버 아트
글 듣기00:00

몇 주 동안 개발자 커뮤니티에서는 같은 질문이 계속 맴돌았어요. 대체 이 Ox Alpha라는 녀석은 뭐지? 이 모델은 OpenRouter 카탈로그와 오픈소스 에이전트 OpenCode에 아무런 예고 없이 등장했습니다. 팀 이름도, 모델 카드도, 문서 한 줄도 없었죠. 갑자기 강력한 네트워크가 나타났고, 심지어 무료로 제공되고 있었어요. 사람들은 자기 작업에 돌려 보고, 스크린샷을 공유하고, 누가 만들었는지를 두고 논쟁했습니다. 2026년 8월 26일, 수수께끼는 풀렸어요. 중국 연구소 Z.ai가 나서서 말했습니다. 맞아요, 우리 모델이고, 이름은 GLM 5.3 Flash라고요.

이 이야기는 그 자체로도 흥미롭지만, 익명 출시를 둘러싼 소문보다 더 재미있는 지점이 뒤에 있습니다. 차례대로 보죠. 이런 "스텔스" 출시가 무엇인지, 커뮤니티가 공식 발표 전에 어떻게 제작자를 알아냈는지, GLM 5.3 Flash가 실제로 무엇을 할 수 있는지, 그리고 — 가장 중요하게 — 일상 업무에서 갈아탈 만한 가치가 있는지요.

왜 굳이 익명으로 모델을 출시할까요

이 전략은 "스텔스" 출시라고 불리며, 지난 1년 사이 특히 중국 연구소들이 즐겨 쓰기 시작했어요. 방식은 단순합니다. OpenRouter 같은 공유 플랫폼에 모델을 올리되, 브랜드를 모두 숨기고 중립적인 코드명만 붙이는 거예요. 접근 권한을 열어 주고, 대개 무료로 제공한 뒤, 무슨 일이 벌어지는지 지켜봅니다.

목표는 솔직한 피드백을 얻는 것입니다. 모델 카드에 "유명 대형 연구소의 새 모델"이라고 적혀 있으면, 반응의 절반은 모델 자체가 아니라 기대감과 평판에서 나와요. 하지만 이름 없는 "Ox Alpha"를 두려워할 사람은 없고, 그 모델에 빚진 사람도 없습니다. 개발자들은 그냥 실제 업무에 투입하고, 자기 작업에서 깨뜨려 보고, 같은 채팅방에 어디가 좋고 어디서 무너지는지 적어 둡니다. 팀 입장에서는 PR 기계를 돌리기 전에 실제 사용 환경의 지표를 값싸게 끌어모으는 방법인 셈이죠.

따로 주목할 만한 신호도 하나 더 있었습니다. OpenCode는 하루에 약 100조 토큰 규모의 예산을 언급했는데, 이 전부가 무료로 제공되고 있었어요. 누구도 "그냥 테스트용"으로 그 정도를 태우진 않습니다. 멋진 발표용 데모 몇 개가 아니라, 누군가 의도적으로 막대한 실제 요청 흐름을 모델에 밀어 넣고 있었던 것으로 보입니다.

발표 전에 제작자를 어떻게 알아냈을까요

가장 흥미로운 대목은 Z.ai가 사람들을 놀라게 할 기회를 거의 얻지 못했다는 점입니다. 커뮤니티는 공식 인정 훨씬 전부터 Ox Alpha의 계보를 파악했어요. 영리한 추측 때문이 아니라, 작은 기술적 단서들 때문이었습니다.

첫 번째는 토크나이저였습니다. 모델이 텍스트를 조각내는 방식은 거의 가족의 지문과 같아요. Ox Alpha의 방식은 사람들이 이미 GLM에서 봤던 것과 수상할 정도로 잘 맞았습니다. 두 번째는 민감한 주제에서의 행동이었어요. 이 모델은 중국 정치에 관한 질문을 특유의 방식으로 피해 갔는데, 중국 내부에서 학습된 모델들이 보이는 모습과 정확히 닮아 있었습니다. 여기에 알려진 계열과 비슷한 특정 API 오류 코드까지 더해졌죠. 단서 하나하나는 우연일 수 있지만, 합쳐 놓고 보면 "중국의 프런티어 랩 중 하나, 아마도 GLM 계열"이라는 꽤 확신 있는 결론이 나왔습니다.

그리고 실제로 그랬습니다. 8월 26일, Z.ai는 Ox Alpha와 GLM 5.3 Flash가 같은 모델이라고 확인했고, 함께 가중치와 벤치마크도 공개했습니다.

GLM 5.3 Flash는 무엇인가요

이제 본론으로 들어가 보죠. Z.ai의 표현을 빌리면 GLM 5.3 Flash는 GLM-5 시리즈 최초의 네이티브 멀티모달 모델입니다. 여기서 핵심은 "네이티브"예요. 나중에 별도 이미지 인식기를 덧붙인 모델이 아니라, 처음부터 서로 다른 데이터 유형을 하나의 흐름으로 다루도록 학습됐다는 뜻입니다.

내부 구조는 Mixture-of-Experts(MoE) 아키텍처입니다. 아주 쉽게 말하면, 모든 요청마다 거대한 네트워크 전체가 힘겹게 돌아가는 대신, 모델이 여러 "전문가"로 나뉘어 있고 각 토큰마다 그중 일부만 작동하는 방식이에요. 형식상 GLM 5.3 Flash는 3,200억 개의 파라미터를 갖고 있지만, 어느 순간 실제로 활성화되는 것은 약 180억 개뿐입니다. 덕분에 모델은 크고 똑똑한 시스템처럼 행동하면서도 비용은 작은 모델에 더 가깝게 유지됩니다. 여기에 하이브리드 sparse-linear attention도 사용합니다. 매우 긴 컨텍스트에서도 연산 비용을 폭발시키지 않고 정확도를 유지하도록 돕는 메커니즘이죠.

핵심 특징을 한 목록으로 정리하면 다음과 같습니다.

  • 컨텍스트 — 최대 100만 토큰. 말 그대로 전체 코드베이스나 두꺼운 문서를 한 번에 넣을 수 있는 수준입니다.
  • 최대 출력 — 한 번에 최대 131,072토큰.
  • 입력 — 텍스트, 이미지, 동영상.
  • 특화 분야 — 코드와 에이전트형 시나리오: 모델이 직접 도구를 호출하고 결과까지 작업을 끌고 가는 다단계 과제입니다.
  • 가중치 — MIT 라이선스로 HuggingFace에 공개됐습니다. 즉, 이 모델은 진짜로 오픈되어 있어요. 내려받아 직접 실행할 수 있습니다.

마지막 항목은 특히 강조할 만합니다. 오픈 MIT 라이선스는 "보고 감탄만 하세요"가 아닙니다. 거의 제한 없이 여러분의 제품에 모델을 사용할 수 있다는 허가예요. 이 정도 급의 프런티어 모델에서는 여전히 드문 일입니다.

성능은 어느 정도일까요

Z.ai는 자체 벤치마크인 Code Bench v1.0의 결과를 공개했습니다. 이에 따르면 GLM 5.3 Flash는 모든 난이도에서 이전 GLM-5.2를 "명확히 능가"하며, 프로그래밍과 에이전트형 작업에서는 Claude Opus 4.8과 "동급" 성능을 낸다고 합니다. 내부 벤치마크는 항상 적당한 의심을 갖고 봐야 합니다. 모델을 학습한 바로 그 팀이 채점한 결과니까요. 하지만 그 점을 감안하더라도 주장은 꽤 무겁습니다. 코드에서 Opus 4.8과 보조를 맞춘다는 건 "괜찮은 중간급"이 아니라 최상위 서구권 모델 수준이라는 뜻이니까요.

그리고 여기서 이야기의 두 번째 축, 가격이 등장합니다. 제공업체 기준으로 GLM 5.3 Flash는 동급 대비 솔직히 저렴합니다.

토큰 유형100만 개당 가격
입력$0.15
출력$0.50
캐시된 입력$0.03

비교하자면, 비슷하게 강력한 서구권 모델은 보통 몇 배, 때로는 한 자릿수 배수만큼 더 비쌉니다. "코드에서는 거의 Opus 같은데, 가격은 경량 모델 수준"이라는 이 조합이 바로 Ox Alpha의 정체가 알려지기 전부터 그토록 많은 이야기가 나온 핵심 이유입니다.

걸림돌은 없을까요

물론 주의할 점이 전혀 없는 것은 아니며, 처음부터 솔직히 짚고 가는 편이 낫습니다.

첫째는 프라이버시입니다. 이 모델을 제공한 업체는 여러분의 프롬프트와 응답을 보관합니다. 공식적으로는 학습용이 아니라고 하지만, 요청이 어딘가에 저장된다는 사실은 변하지 않습니다. 공개적인 작업이라면 문제가 아니겠지만, 업무상 비밀, 상업적 서신, 개인 데이터는 이런 모델에 넣지 않는 편이 좋습니다.

둘째는 아직 막 나온 릴리스라는 점입니다. 내부 벤치마크는 보기 좋지만, 전체 그림은 독립적인 테스트와 몇 달간의 실제 사용을 거쳐야 드러납니다. 지금은 매우 유망하지만 아직 시간의 검증을 충분히 거치지는 않은 모델로 보는 게 맞습니다.

ChatPlus의 GLM 5.3 Flash

저희는 이 모델을 "스텔스" 단계였을 때 Ox Alpha라는 이름으로 이미 추가했고, 공식 출시와 함께 업데이트했습니다. 현재 엔드포인트로 전환하고, 이름과 가격도 바로잡았어요. 지금 바로 사용해 볼 수 있습니다: GLM 5.3 Flash로 채팅 열기. 알아두면 좋은 점은 두 가지입니다.

  • 이 모델은 PRO 구독에서 사용할 수 있습니다. 복잡한 절차는 없습니다.
  • 저희는 일부러 자동 선택에서 제외했습니다. 요청이 제공업체 쪽에 저장된다는 바로 그 이유 때문에, 이 모델이 조용히 기본값이 되는 것을 원하지 않았습니다. GLM 5.3 Flash는 의식적인 선택으로 남겨 두려 합니다. 왜 켜는지 알고 있을 때 직접 켜는 모델로요.

코드와 긴 에이전트형 시나리오에 훌륭한 선택지처럼 느껴집니다. 특히 큰 컨텍스트가 필요하고, 전체 코드베이스를 한 작업에 투입해도 괜찮을 때 그렇죠. Z.ai의 새 모델을 익숙한 GPT, Claude, Gemini와 한 창에서 비교해 보기에도 좋습니다. ChatPlus에서는 그냥 채팅에서 모델을 전환하면 됩니다.

한마디로

Ox Alpha는 신비로운 신인이 아니라 Z.ai의 새 멀티모달 모델 GLM 5.3 Flash였습니다. 코드에 강하고, 100만 토큰 컨텍스트를 유지하며, 동급 기준으로는 거의 푼돈에 가깝고, 오픈 라이선스로 제공됩니다. 단점이라면 제공업체가 요청을 저장한다는 점, 그리고 아직 너무 신선한 모델이라 단정적인 판단은 이르다는 점입니다. 그래도 분명 시도해 볼 가치는 있습니다. ChatPlus에서는 이미 PRO 구독에서 사용할 수 있어요.

ChatPlus에서 최고의 AI 모델을 사용해 보세요

GPT, Claude, Gemini, GLM 등 다양한 AI 모델을 한 창에서 만나보세요.