GLM 5.3 Flash:神秘“隐身”模型 Ox Alpha,原来是 Z.ai 的新网络
过去几周,开发者们一直在猜:OpenRouter 上代号为 Ox Alpha 的那个强大无名模型到底是谁家的。8 月 26 日,中国的 Z.ai 摊牌了:它就是 GLM 5.3 Flash——GLM-5 系列首个原生多模态模型。我们来看看它能做什么、从何而来,以及你是否该放心把数据交给它。

过去几周,开发者群聊里总绕不开同一个问题:这个 Ox Alpha 到底是个什么怪物?它毫无预告地出现在 OpenRouter 目录和开源 agent OpenCode 里——没有团队名称,没有模型卡,连一行文档都没有。一个实力很强的网络就这么凭空冒了出来,而且还免费开放。大家拿它跑自己的任务、互相发截图、争论到底是谁做的。2026 年 8 月 26 日,谜底揭晓:中国实验室 Z.ai 站出来说——没错,是我们,这个模型叫 GLM 5.3 Flash。
这个故事本身就挺有意思,但比起匿名发布带来的八卦,它背后还有更值得看的东西。我们按顺序来:这类“隐身”发布到底是什么,社区又是怎样在官宣前识别出作者的,GLM 5.3 Flash 实际能做什么,以及——最重要的——它是否值得你在日常工作里切换过去。
为什么要匿名发布模型
这种玩法叫“隐身”发布,过去一年里,中国实验室尤其喜欢用。套路很简单:把模型放到 OpenRouter 这类共享平台上,但不挂任何品牌——只用一个中性的代号。开放访问,通常还免费,然后就看会发生什么。
目的在于拿到真实反馈。如果模型卡上写着“某某知名实验室的新模型”,一半的反应来自预期和名声,而不是模型本身。但没人会怕一个无名的“Ox Alpha”,也没人欠它什么:开发者会直接把它投入工作,在真实任务里把它用坏,然后就在同样的群聊里写下它哪里强、哪里崩。对团队来说,这是在启动公关机器之前,用很低成本从真实使用中拉取指标的办法。
还有一个信号值得单独提一下。OpenCode 提到的预算大约是每天一百万亿 token——而且全部免费送出去。没人会“只是为了测试”烧掉这么多资源。看起来,更像是有人在有意把海量真实请求导入这个模型,而不是为了漂亮官宣准备几条 demo 示例。
社区是怎么在官宣前破案的
最有意思的是,Z.ai 几乎没来得及给大家一个惊喜。社区早在官方承认之前,就已经弄清了 Ox Alpha 的血统——靠的不是脑洞猜测,而是一连串很小的技术线索。
首先是 tokenizer。一个模型把文本切成片段的方式,几乎像家族指纹。Ox Alpha 的切法和人们此前在 GLM 中见过的模式吻合得可疑。其次,是它在敏感话题上的行为:这个模型会很典型地回避有关中国政治的问题——正是中国境内训练出的模型常见的方式。再加上一些 API 错误码也和已知家族相互呼应。每条线索单独看都可能只是巧合,但合在一起,就足以形成一个相当有把握的判断:“这是中国前沿实验室之一的模型,而且很可能属于 GLM 系列。”
结果也确实如此。8 月 26 日,Z.ai 确认 Ox Alpha 和 GLM 5.3 Flash 是同一个模型,并一并发布了权重和基准测试结果。
GLM 5.3 Flash 是什么
现在说正题。按照 Z.ai 自己的说法,GLM 5.3 Flash 是 GLM-5 系列首个原生多模态模型。这里的关键词是“原生”:这个模型不是事后再外挂一个图像识别器——而是从训练一开始,就被设计成能把不同数据类型当作同一条流来处理。
底层采用的是 Mixture-of-Experts(MoE)架构。说得非常直白一点:它不是让一个巨型网络在每次请求时全体上阵,而是把模型拆成许多“专家”,每个 token 只会激活其中一小部分。形式上,GLM 5.3 Flash 拥有 3200 亿参数,但任一时刻实际活跃的只有大约 180 亿。因此,它表现得像一个又大又聪明的模型,成本却更接近小模型。除此之外,它还使用了 hybrid sparse-linear attention——这种机制有助于在超长上下文里维持准确率,同时不让计算账单膨胀。
关键特性可以浓缩成这一份清单:
- 上下文——最高 100 万 token。也就是说,完整代码库或厚厚的文档真的可以一次性塞进去。
- 最大输出——一次最多 131,072 token。
- 输入——文本、图像和视频。
- 专长——代码和 agentic 场景:模型会自己调用工具、推进多步骤任务,直到产出结果。
- 权重——已在 HuggingFace 上以 MIT license 发布。也就是说,这个模型是真正开放的:你可以下载下来自己运行。
最后一点值得强调。开放的 MIT license 不是“看看就好”——而是允许你几乎不受限制地在自己的产品里使用这个模型。对这种级别的前沿模型来说,这依然很罕见。
它到底有多强
Z.ai 公布的是它在内部基准 Code Bench v1.0 上的成绩。按照这个基准,GLM 5.3 Flash 在所有难度级别上都“明显超过”上一代 GLM-5.2,并且在编程和 agentic 任务中“达到与 Claude Opus 4.8 相当的表现”。内部基准总是需要带着足够的怀疑去看——打分的是训练模型的同一支团队——但即便打个折,这个说法也很有分量。代码能力能跟上 Opus 4.8,那是顶级西方模型的水准,而不是“还不错的中端档”。
故事的另一半则是价格。在服务商那里,GLM 5.3 Flash 以它这个级别来说确实便宜:
| Token 类型 | 每 100 万价格 |
|---|---|
| 输入 | $0.15 |
| 输出 | $0.50 |
| 缓存输入 | $0.03 |
作为对比:强度相近的西方模型通常贵好几倍,有时甚至贵一个数量级。这种组合——“代码能力几乎像 Opus,但价格像轻量模型”——正是 Ox Alpha 在还没人知道它是谁之前就引发大量讨论的主要原因。
坑在哪里
它并不是完全没有附带条件,提前说清楚会更诚实。
第一——隐私。提供这个模型的服务商会保留你的提示词和回复。名义上不是用于训练,但事实仍然是:你的请求会被存储在某个地方。公开任务无所谓,但工作机密、商业往来或个人数据,最好不要交给这种模型。
第二——它仍然是一个刚发布的新模型。内部基准看起来很漂亮,但只有独立测试和数月真实使用,才能给出完整图景。眼下,可以把它视为非常有前景,但还没有经过时间充分打磨。
ChatPlus 上的 GLM 5.3 Flash
我们在它还处于“隐身”阶段时,就以 Ox Alpha 的名字加入了这个模型,并在正式发布后做了更新——切到当前 endpoint,修正了名称和价格。你现在就可以试用:打开 GLM 5.3 Flash 聊天。有两点值得知道:
- 该模型可在 PRO 订阅中使用。不需要绕任何弯子。
- 我们刻意没有把它放进自动选择。正因为前面提到的请求会存储在服务商一侧,我们不希望这个模型悄悄变成默认选项。让 GLM 5.3 Flash 成为一个有意识的选择:当你知道为什么要用它时,再手动开启。
它看起来非常适合代码和长流程 agentic 场景,尤其是当你需要超大上下文,并且不介意把整个代码库都交给一次任务的时候。它也给了你一个很好的理由,在同一个窗口里把 Z.ai 的新模型和熟悉的 GPT、Claude、Gemini 做对比——在 ChatPlus 上,你只要在聊天中切换模型即可。
简而言之
Ox Alpha 并不是一个神秘新玩家,而是 GLM 5.3 Flash——Z.ai 的新多模态模型。它擅长代码,支持 100 万 token 上下文,以同级标准来看价格低得惊人,并且采用开放许可发布。不足之处在于——服务商会存储你的请求,而且模型还太新,暂时无法下定论。它绝对值得一试:在 ChatPlus 上,它已经包含在 PRO 订阅中。