live
10 labs · 30 models
全部文章
9 分钟阅读ChatPlus Team

Muse Spark 1.3:Meta 新模型现已上线 ChatPlus

多年来,Meta 一直免费开放 Llama 模型。如今,它推出了闭源模型家族 Muse,正面迎战 OpenAI 和 Anthropic。Muse Spark 1.3 从何而来、能做什么、各项数据意味着什么、适合哪些任务?这款模型已经在 ChatPlus 上线。

模型Meta新闻
夜晚,一名年轻男子在俯瞰城市的窗边工作,笔记本电脑屏幕上正在运行一个智能体,Max 吉祥物坐在笔记本电脑盖上,手里捧着一簇蓝色火花。这是 Meta 的 Muse Spark 1.3 相关文章封面图
收听文章00:00

一年半前,Meta 还是大家口中“把模型免费送出去的那家公司”。数百万人下载 Llama,创业公司基于它做产品,团队把它微调用到自己的工作流里。但在最聪明模型的竞赛中,Meta 显然落后于 OpenAI、Anthropic 和 Google。

如今,它换了一套策略,也换了一个模型家族:Muse。这些模型是闭源的,由专门部门负责打造,并且几乎每个月都有新版本发布。最新的 Muse Spark 1.3 于 9 月 2 日推出,并从今天起在 ChatPlus 上可用。下面我们聊聊:它从哪里来、能做什么、各项数据背后意味着什么,以及什么时候该选它。

Meta 如何走到 Muse

2025 年 4 月,Meta 发布 Llama 4,市场反应不算热烈。模型本身还可以,但没有达到此前承诺的高度,最大版本的发布也被推迟。对于一家每年在 AI 上投入数百亿美元的公司来说,这不是一个令人舒服的信号。

那个夏天,Zuckerberg 重组了整个 AI 方向。Meta 成立新部门 Meta Superintelligence Labs,从 OpenAI、Google 以及其他实验室挖来强研究员,并开始建设用于训练大模型的新数据中心。它公开提出的目标相当大胆:“personal superintelligence”,也就是帮助每个人实现各自目标的 AI。

第一个成果就是 Muse Spark。它于 2026 年 4 月 8 日发布,并直接进入 Meta AI assistant,在网页端和应用里上线。这是一个多模态推理模型:能调用工具、理解图像并进行推理,还能并行运行多个智能体。开发者一开始几乎接触不到它,只能通过私密预览使用。

随后,节奏明显加快:

  • 7 月:Muse Spark 1.1,以及面向开发者的公开 API 预览;
  • 8 月:Muse Spark 1.2 和 Muse Code,后者是 Meta 自家的编程智能体,可直接在终端中运行;
  • 9 月 2 日:Muse Spark 1.3,也就是本文的主角。

三个月三个版本,对于一家大型实验室来说,这是非常快的迭代速度。

Muse Spark 1.3 能做什么

Meta 对新版本的描述是:这个模型针对长程、多步骤任务进行了训练。这句话背后,其实对应三项具体能力。

第一,它能跟住工作进度。面对一项长任务时,模型会记得自己已经做过什么、结果如何,而不是每一步都从零开始。如果你让它通读一个项目、修复测试并更新文档,它不会到了第三步就忘了第一步改过什么。

第二,它能处理混乱信息。真实任务很少是整整齐齐交到你手上的:需求文档说一套,邮件讨论里又是另一套,代码里体现出来的是第三套。Muse Spark 1.3 经过训练,能发现这类矛盾,并尝试理清它们,而不是随机选一个版本当真。

第三,它会提问。当信息缺失时,模型会先向你确认,而不是用猜测来填空。这听起来是小事,但智能体最常跑偏的原因,恰恰就是“自作主张”。

Meta 也特别强调了编码能力。1.3 版本基于 Muse Code 中的真实工作进行了优化。按公司说法,它会减少不必要的步骤,写出的代码也更紧凑。如果你把 AI 当作编程搭档,会很容易感受到这一点:模型生成之后需要你收拾的东西更少。

这个模型理解的不只是文本。你可以给它看截图、照片、图表或 PDF。Meta 提到一个有意思的细节:Muse Spark 的视觉推理会经过一个真实的执行环境。简单说,模型可以用代码来处理图像,而不只是“看一眼”然后凭感觉估算。

模型的上下文窗口是 1,048,576 tokens,超过一百万。这个量相当于一次性塞进数百页文本,或者一个大型代码仓库。更重要的是,如下面的数据所示,它并不只是形式上支持这么长的上下文,而是真的能用好。

数据说明了什么

下面所有结果均由 Meta 自行测得,使用的是其最高推理模式。

TestWhat it measuresMuse Spark 1.3
Terminal-Bench 2.1终端中的智能体工作88.8%
DeepSWE 1.1真实代码仓库中的长程工程任务75.4%
MRCR v2, 512K–1M在超长上下文中找到正确细节98.1%
JobBench使用工具完成专业工作64.9%
GDPval-AA办公任务:报告、电子表格、文档1754 Elo

最亮眼的是长上下文表现。MRCR 测的是模型能否在一大段文本里,从许多相似片段中找出正确的那一段。很多模型名义上能接收一百万 tokens,但到了这个规模就会开始“丢掉”中间部分的信息。Muse Spark 1.3 在五十万到一百万 tokens 区间拿到 98.1%,几乎没有损失。

相比上一版,提升也很明显。在 JobBench 上,模型从 61.6% 升到 64.9%;在办公基准 GDPval-AA 上,则从 1615 提升到 1754 Elo 分。

再看与竞品的对比,不过这里需要加一句说明。在 GDPval-AA 上,Muse Spark 1.3 超过 GPT-5.6 Sol(1710),但落后于 Claude Opus 5(1824)。不过,Meta 对比的是上一代模型。此后 Claude Opus 5.5 和 GPT-6 Sol 已经发布,而 Meta 的表格没有把它们纳入。因此更公平的总结是:Muse Spark 1.3 已经进入旗舰模型同一梯队,但还没有超过这些品牌最新的旗舰版本。

价格如何

价格很有吸引力:输入每百万 tokens $1.25,输出每百万 tokens $4.25。作为对比,Claude Opus 5.5 是 $4 和 $20,GPT-6 Sol 是 $2 和 $10,Grok 4.7 是 $2 和 $6。以接近旗舰级的表现来看,这是市场上性价比很高的选择之一。

Meta 还提供了第二种几乎免费的选项:输入 10 美分,输出 20 美分。不过在这个价格下,Meta 有权使用你的提示词和回复来训练其模型。在 ChatPlus,我们只接入了标准档位,所以你与 Muse Spark 的对话不会被用于 Meta 的训练。

Muse Spark 适合什么,又该在什么时候换别的模型

Muse Spark 1.3 最擅长长而复杂的任务。通读一个大型项目、在别人的代码里定位 bug 原因、把几份互相矛盾的文档整合成一个结论、从厚厚的报告里抽取你需要的信息:这些都是它的舒适区。它处理截图也不错;把一个报错界面发给它,让它帮你判断问题所在,是很自然的用法。

它也有短板。它是推理模型,所以回答简单问题会比轻量模型更慢:先思考,再输出。翻译、摘要和快速查询这类任务,可以选更轻的模型,比如 GPT-6 Luna。Meta 对创意写作几乎没有多说,所以如果你在意文风,最好拿自己的任务和 Claude 对比一下。

如何在 ChatPlus 上试用

Muse Spark 1.3 可在 PRO 计划中使用,并且和其他强力模型一样,会消耗你的额度——也就是那个 5 小时限制,请求昂贵模型会从中扣除。打开与 Muse Spark 1.3 的聊天。

最有价值的做法,是拿你自己的任务把它和其他模型放在一起比较。在 ChatPlus,你可以在同一段对话中途切换模型:先问 Muse Spark,再切到 Claude 或 GPT,发送同一个请求,马上看看谁的回答更好。这个模型的规格和基准测试结果,已整理在专门的 Muse Spark 1.3 页面。

简而言之

Muse Spark 1.3 是 Meta Superintelligence Labs 的最新模型,于 2026 年 9 月 2 日发布。它在长程智能体任务、代码和超大上下文方面表现很强:Terminal-Bench 2.1 得分 88.8%,在一百万 tokens 下几乎没有信息损失。它距离 Anthropic 和 OpenAI 最新旗舰仍有差距,但价格低了好几倍。在 ChatPlus 上,这个模型已经可通过 PRO 计划使用。

在 ChatPlus 体验顶尖 AI 模型

GPT、Claude、Gemini、GLM 等 AI 模型,集中在一个窗口中使用。