Muse Spark 1.3:Meta 新模型现已上线 ChatPlus
多年来,Meta 一直免费开放 Llama 模型。如今,它推出了闭源模型家族 Muse,正面迎战 OpenAI 和 Anthropic。Muse Spark 1.3 从何而来、能做什么、各项数据意味着什么、适合哪些任务?这款模型已经在 ChatPlus 上线。

一年半前,Meta 还是大家口中“把模型免费送出去的那家公司”。数百万人下载 Llama,创业公司基于它做产品,团队把它微调用到自己的工作流里。但在最聪明模型的竞赛中,Meta 显然落后于 OpenAI、Anthropic 和 Google。
如今,它换了一套策略,也换了一个模型家族:Muse。这些模型是闭源的,由专门部门负责打造,并且几乎每个月都有新版本发布。最新的 Muse Spark 1.3 于 9 月 2 日推出,并从今天起在 ChatPlus 上可用。下面我们聊聊:它从哪里来、能做什么、各项数据背后意味着什么,以及什么时候该选它。
Meta 如何走到 Muse
2025 年 4 月,Meta 发布 Llama 4,市场反应不算热烈。模型本身还可以,但没有达到此前承诺的高度,最大版本的发布也被推迟。对于一家每年在 AI 上投入数百亿美元的公司来说,这不是一个令人舒服的信号。
那个夏天,Zuckerberg 重组了整个 AI 方向。Meta 成立新部门 Meta Superintelligence Labs,从 OpenAI、Google 以及其他实验室挖来强研究员,并开始建设用于训练大模型的新数据中心。它公开提出的目标相当大胆:“personal superintelligence”,也就是帮助每个人实现各自目标的 AI。
第一个成果就是 Muse Spark。它于 2026 年 4 月 8 日发布,并直接进入 Meta AI assistant,在网页端和应用里上线。这是一个多模态推理模型:能调用工具、理解图像并进行推理,还能并行运行多个智能体。开发者一开始几乎接触不到它,只能通过私密预览使用。
随后,节奏明显加快:
- 7 月:Muse Spark 1.1,以及面向开发者的公开 API 预览;
- 8 月:Muse Spark 1.2 和 Muse Code,后者是 Meta 自家的编程智能体,可直接在终端中运行;
- 9 月 2 日:Muse Spark 1.3,也就是本文的主角。
三个月三个版本,对于一家大型实验室来说,这是非常快的迭代速度。
Muse Spark 1.3 能做什么
Meta 对新版本的描述是:这个模型针对长程、多步骤任务进行了训练。这句话背后,其实对应三项具体能力。
第一,它能跟住工作进度。面对一项长任务时,模型会记得自己已经做过什么、结果如何,而不是每一步都从零开始。如果你让它通读一个项目、修复测试并更新文档,它不会到了第三步就忘了第一步改过什么。
第二,它能处理混乱信息。真实任务很少是整整齐齐交到你手上的:需求文档说一套,邮件讨论里又是另一套,代码里体现出来的是第三套。Muse Spark 1.3 经过训练,能发现这类矛盾,并尝试理清它们,而不是随机选一个版本当真。
第三,它会提问。当信息缺失时,模型会先向你确认,而不是用猜测来填空。这听起来是小事,但智能体最常跑偏的原因,恰恰就是“自作主张”。
Meta 也特别强调了编码能力。1.3 版本基于 Muse Code 中的真实工作进行了优化。按公司说法,它会减少不必要的步骤,写出的代码也更紧凑。如果你把 AI 当作编程搭档,会很容易感受到这一点:模型生成之后需要你收拾的东西更少。
这个模型理解的不只是文本。你可以给它看截图、照片、图表或 PDF。Meta 提到一个有意思的细节:Muse Spark 的视觉推理会经过一个真实的执行环境。简单说,模型可以用代码来处理图像,而不只是“看一眼”然后凭感觉估算。
模型的上下文窗口是 1,048,576 tokens,超过一百万。这个量相当于一次性塞进数百页文本,或者一个大型代码仓库。更重要的是,如下面的数据所示,它并不只是形式上支持这么长的上下文,而是真的能用好。
数据说明了什么
下面所有结果均由 Meta 自行测得,使用的是其最高推理模式。
| Test | What it measures | Muse Spark 1.3 |
|---|---|---|
| Terminal-Bench 2.1 | 终端中的智能体工作 | 88.8% |
| DeepSWE 1.1 | 真实代码仓库中的长程工程任务 | 75.4% |
| MRCR v2, 512K–1M | 在超长上下文中找到正确细节 | 98.1% |
| JobBench | 使用工具完成专业工作 | 64.9% |
| GDPval-AA | 办公任务:报告、电子表格、文档 | 1754 Elo |
最亮眼的是长上下文表现。MRCR 测的是模型能否在一大段文本里,从许多相似片段中找出正确的那一段。很多模型名义上能接收一百万 tokens,但到了这个规模就会开始“丢掉”中间部分的信息。Muse Spark 1.3 在五十万到一百万 tokens 区间拿到 98.1%,几乎没有损失。
相比上一版,提升也很明显。在 JobBench 上,模型从 61.6% 升到 64.9%;在办公基准 GDPval-AA 上,则从 1615 提升到 1754 Elo 分。
再看与竞品的对比,不过这里需要加一句说明。在 GDPval-AA 上,Muse Spark 1.3 超过 GPT-5.6 Sol(1710),但落后于 Claude Opus 5(1824)。不过,Meta 对比的是上一代模型。此后 Claude Opus 5.5 和 GPT-6 Sol 已经发布,而 Meta 的表格没有把它们纳入。因此更公平的总结是:Muse Spark 1.3 已经进入旗舰模型同一梯队,但还没有超过这些品牌最新的旗舰版本。
价格如何
价格很有吸引力:输入每百万 tokens $1.25,输出每百万 tokens $4.25。作为对比,Claude Opus 5.5 是 $4 和 $20,GPT-6 Sol 是 $2 和 $10,Grok 4.7 是 $2 和 $6。以接近旗舰级的表现来看,这是市场上性价比很高的选择之一。
Meta 还提供了第二种几乎免费的选项:输入 10 美分,输出 20 美分。不过在这个价格下,Meta 有权使用你的提示词和回复来训练其模型。在 ChatPlus,我们只接入了标准档位,所以你与 Muse Spark 的对话不会被用于 Meta 的训练。
Muse Spark 适合什么,又该在什么时候换别的模型
Muse Spark 1.3 最擅长长而复杂的任务。通读一个大型项目、在别人的代码里定位 bug 原因、把几份互相矛盾的文档整合成一个结论、从厚厚的报告里抽取你需要的信息:这些都是它的舒适区。它处理截图也不错;把一个报错界面发给它,让它帮你判断问题所在,是很自然的用法。
它也有短板。它是推理模型,所以回答简单问题会比轻量模型更慢:先思考,再输出。翻译、摘要和快速查询这类任务,可以选更轻的模型,比如 GPT-6 Luna。Meta 对创意写作几乎没有多说,所以如果你在意文风,最好拿自己的任务和 Claude 对比一下。
如何在 ChatPlus 上试用
Muse Spark 1.3 可在 PRO 计划中使用,并且和其他强力模型一样,会消耗你的额度——也就是那个 5 小时限制,请求昂贵模型会从中扣除。打开与 Muse Spark 1.3 的聊天。
最有价值的做法,是拿你自己的任务把它和其他模型放在一起比较。在 ChatPlus,你可以在同一段对话中途切换模型:先问 Muse Spark,再切到 Claude 或 GPT,发送同一个请求,马上看看谁的回答更好。这个模型的规格和基准测试结果,已整理在专门的 Muse Spark 1.3 页面。
简而言之
Muse Spark 1.3 是 Meta Superintelligence Labs 的最新模型,于 2026 年 9 月 2 日发布。它在长程智能体任务、代码和超大上下文方面表现很强:Terminal-Bench 2.1 得分 88.8%,在一百万 tokens 下几乎没有信息损失。它距离 Anthropic 和 OpenAI 最新旗舰仍有差距,但价格低了好几倍。在 ChatPlus 上,这个模型已经可通过 PRO 计划使用。