Claude Opus 5.5、GPT-6 Sol 和 Grok 4.7:两天三连发,该选哪款模型
9 月底短短两天内,三款重磅新品相继登场:xAI 的 Grok 4.7、Anthropic 的 Claude Opus 5.5,以及 OpenAI 的 GPT-6 Sol 和 Luna。它们到底有何不同、各自真正擅长什么、你的任务该选哪一个?这篇文章给你一个直截了当的梳理。四款模型均已在 ChatPlus 上线。

9 月 21 日,xAI 发布了 Grok 4.7。第二天,Anthropic 推出 Claude Opus 5.5,OpenAI 则发布了 GPT-6 Sol 和 GPT-6 Luna。三家公司、四款模型、两天内集中登场。很难说这只是巧合:这场竞赛已经激烈到谁都不愿意让竞争对手哪怕独占一周头条。
先说结论:Opus 5.5 是这批新品中最强的一款;按独立测试来看,它也是目前市场上综合表现最好的模型。GPT-6 Sol 在原始智能上几乎没有明显提升,但价格减半,事实性错误也更少。Luna 更轻量,价格非常亲民。Grok 4.7 对 xAI 来说是一次大幅进步,但目前仍处在第二梯队,不过价格很有吸引力。下面是每款模型的细节,以及一些必须说清楚的限制。
四款模型一览
先看核心规格。价格按每百万 API token 计算,方便你判断哪些模型更贵;ChatPlus 不单独按 token 收费,所有内容都包含在订阅中。
| Model | Developer | Input / output, $ | Context | Best at |
|---|---|---|---|---|
| Claude Opus 5.5 | Anthropic | 4 / 20 | 1M | 长篇代码、文档、清晰写作 |
| GPT-6 Sol | OpenAI | 2 / 10 | 1.05M | 代码、智能体、事实准确性 |
| GPT-6 Luna | OpenAI | 0.10 / 0.50 | 1.05M | 快速、简单任务 |
| Grok 4.7 | xAI | 2 / 6 | 500K | 代码、工程、法律 |
Claude Opus 5.5:接近 Fable 水平的表现,但不用旗舰价
Opus 5.5 拉开了全新 Claude 5.5 系列的序幕。Anthropic 用一句话概括它的主要优势:这款模型达到了 Claude Fable 5.1 的水平——也就是该公司能力最强、价格最高的模型——同时比 Opus 5 便宜 40%。Token 价格下降了 20%,其余节省来自效率提升:完成同一任务时,模型需要的步骤更少、token 更少。它生成文本的速度也比前代快 30% 以上。
独立测试也证实了这一点。在 Artificial Analysis 综合指数中,Opus 5.5 在最高设置下拿到 58 分——这是该榜单有史以来测得的最佳成绩,并且领先数分。它几乎在各项任务上都处于领先:智能体编程(Terminal-Bench 4.0 上为 66.4%,而 Fable 5.1 为 55.8%,GPT-6 Astra 为 57.9%)、办公任务,以及复杂的工具调用问题。
不过,基准测试数字很难说明一个模型在真实工作中用起来是什么感觉。早期测试者的案例更有说服力。有人在不到一天内迁移了一个包含 680,000 行代码的项目,而这原本需要一个工程团队花上数周。另一位测试者在三小时内审计并修复了一个 200,000 行代码库;同样的工作,Opus 5 需要二十多个小时。还有一家公司表示,Opus 5.5 用 11 条提示、三小时完成了一项复杂任务,而此前完成同样任务需要 38 条提示和四天。Anthropic 还做过一项内部实验:让 Opus 5.5 和 Fable 5.1 把流行负载均衡器 HAProxy 从 C 重写为 Rust。两者都成功了,但 Opus 5.5 用 9.5 小时完成,而不是 12 小时,成本也只有一半。
第二个重大变化在于写作方式。Opus 5 经常被批评太啰嗦:开头铺垫很长、措辞偏企业腔,重点常常藏在第三段。Opus 5.5 会先把核心观点说出来,更少滑向行话,也更可靠地遵循你给出的风格要求。一位测试者的评价很简单:“它写出来就像我自己会写的那样。”处理文本时你会立刻感受到这一点:模型输出后需要清理的地方更少了。
有一个特性值得提前了解:Opus 5.5 不能关闭推理。它总是先思考,再回答。对复杂任务来说,这是优点。可如果你只是问“窗台的英文怎么说?”这类问题,就意味着要多等几秒。像这种小任务,选更简单的模型会更合适。
在 ChatPlus 上,Claude Opus 5.5 已可在聊天中使用——位于 Max 套餐,与其他顶级模型一起提供。
GPT-6 Sol:能力门槛不变,价格降到一半
9 月初,OpenAI 发布了旗舰模型 GPT-6 Astra;现在 GPT-6 系列的结构是:Astra 位于顶端,Sol 居中,Luna 位于入门档。Sol 被定位为主力工作马:它继承了 Astra 的精确性和把任务推进到完成的能力,但价格低得多。
OpenAI 对 Sol 的卖点不是刷新纪录,而是可靠性。该公司选取了用户曾标记出模型错误的真实对话,用新版本进行测试:Sol 出错的频率大约只有 GPT-5.6 Sol 的一半,并达到 Astra 级别的可靠性。一项独立幻觉测试也证实了这一点,不过需要加一句限定。编造答案的比例从 92% 降到了 60%,很大程度上是因为模型在不确定时更常拒绝回答。整体正确答案比例甚至略有下降,从 59% 降到 54%。对日常工作来说,这更多是好消息而不是坏消息:坦诚说“我不知道”,总比自信地胡编要好。
在编程方面,Sol 能跟上价格高得多的模型。在 DeepSWE 这项考察真实代码库中长程工程任务的测试中,它得分 68.8%。Claude Fable 5 以 69.9% 拿到最高分,但每项任务的成本大约是它的五倍。在 Terminal-Bench 4.0 上,Sol 从 37% 提升到 43%。
接下来是新闻稿没有提到的部分。在综合智能指数中,Sol 相比前代几乎没有变化:48 分对 47 分。它在办公文档任务上甚至出现了退步,在计算机控制方面也落后于 Astra 和上一代 Sol。所以这不是一次跃进,而是在能力门槛大致不变的前提下把价格砍半。对大多数任务来说,这恰恰是你需要的:写代码、做研究、处理邮件和分析。如果你需要一个能自己点击界面操作的模型,那就选 Astra。
GPT-6 Sol 可在我们的 PRO 订阅中使用;由于它的成本只有上一代 Sol 的一半,在长对话里,你的使用额度会明显更经用。打开 GPT-6 Sol 聊天。
GPT-6 Luna:更小的模型,却有最新的知识
OpenAI 对 Luna 的描述很直接:面向目标清晰的大批量任务。总结文档、从文本中提取数字和姓名、快速回答一个问题。这一点也不“低端”:人们每天使用 AI 做的大多数事,正是这些任务。
它的价格几乎只是象征性的:每百万输入 token 10 美分,每百万输出 token 50 美分。输入价格是 GPT-5.6 Luna 的一半,输出价格则便宜了接近 2.5 倍。在综合智能指数中,这款模型仍保持在前代水平。它在智能体编码上略有下滑,但在最高设置的 DeepSWE 中,每项任务仅需 22 美分就能达到 66.6%。按 OpenAI 的说法,这与中等设置下的 Claude Opus 5 和 Fable 5 相当,而成本低 93–96%。
一个有趣细节是:这个系列里最小的模型,反而拥有最新的知识。Luna 的训练数据截至 2026 年 5 月,而 Sol 和 Astra 截至 4 月。
在 ChatPlus 中,GPT-6 Luna 可在 PRO 订阅中使用,并且不会消耗你的额度——也就是昂贵模型请求会扣减的那个 5 小时限制。你可以放心使用,不必盯着计数器。它并不适合复杂的多文件代码任务,但你可以在同一段对话中切换到 Sol 或 Opus。
Grok 4.7:体量很大、来得较晚,却意外实惠
Grok 4.7 比其他几款更早到来,尽管它其实是最早被期待的:从 7 月下旬开始,Elon Musk 至少五次推迟发布。延期可以理解。这不是一次表面更新,而是一个全新的、规模明显更大的基础模型:据媒体报道,参数量约为 2.1 万亿。它接受了更长时间的强化学习训练,重点放在那些人类需要花数小时完成的任务上。xAI 也改进了自我检查:模型会更仔细地审查自己的回答,并更好地处理长上下文。顺带一提,该公司现在在官方材料中称自己为 SpaceXAI,不过模型仍然叫 Grok。
相比 Grok 4.6,它的提升相当明显。在 CursorBench 4.0 这项长程编程任务测试中,得分从 40.4% 升至 46.3%。在 Terminal-Bench 4.0 上,它几乎翻倍,从 20.3% 提高到 37.6%。在多小时办公任务——报告、电子表格、演示文稿——中,模型提升了超过一百个 Elo 点。它在法律任务上的表现尤其令人意外:在 Harvey 法律基准测试中,Grok 4.7 得分 19.6%,几乎是 Claude Fable 5.1 的 6.7% 的三倍。在电气工程基准 EEBench 上,它拿到 64%,而 Fable 为 56.4%。
但放到整体排名里,它的位置就没那么亮眼了。在多数对比中,Grok 4.7 处于第二梯队:办公任务落后于 Fable 5.1,工程任务落后于 GPT-6 Astra,并且与 Opus 5.5 仍有明显差距。独立测试给它的智能指数评分是 46 分。这足以让 xAI 进入前四大实验室,但也仅此而已。Musk 本人承诺,要到 Grok 4.9 才能达到“Astra 和 Fable 级别”。还有一点需要注意:在最高设置下,这款模型每项任务消耗的 token 是 Grok 4.6 的两倍多,所以相同的 token 单价并不意味着相同的结果成本。
Grok 4.7 的核心优势是性价比。它的价格与 Grok 4.6 相同——每百万输入 token 2 美元、每百万输出 token 6 美元——并且明显便宜于 Anthropic 和 OpenAI 的旗舰模型。Grok 4.7 已在 ChatPlus 的 PRO 订阅中提供。
那到底该选哪一个?
我们会这样拆分。
如果任务规模大且重要——复杂代码、项目审计、分析报告,或需要清晰思考的长文档——请选择 Claude Opus 5.5。它是目前可用的最强模型,写作也明显优于之前的 Claude 模型。
对于需要平衡表现的日常工作,GPT-6 Sol 非常合适:代码、研究、邮件和电子表格。它更谨慎,幻觉更少,也更省你的额度。
对于摘要、翻译、简短资料查询和草稿这类小任务,选择 GPT-6 Luna。它速度快,而且完全不消耗你的额度。
Grok 4.7 值得在法律和工程问题上试一试,它在这些方向上出人意料地强;当你想对比另一个模型的答案时,它也适合作为第二意见。
最简单的比较方式,就是拿你自己的任务来试。在 ChatPlus 中,你可以在对话中途切换模型:先问 Opus 一个问题,再切到 Sol 或 Grok,发送同一条提示,立刻看谁处理得最好。详细模型页面可见:Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna 和 Grok 4.7。
简而言之
两天内来了四款新模型。Claude Opus 5.5 是新的领跑者:以比 Opus 5 低 40% 的成本达到 Fable 5.1 级别能力,拥有同类最佳的智能体编码表现,写作也明显更清晰。GPT-6 Sol 在智能水平上几乎没有提升,但价格减半,事实性错误也减少了一半。GPT-6 Luna 是一款非常便宜、适合简单任务的模型,并且拥有该系列中最新的知识。Grok 4.7 有了大幅进步,尤其是在代码、法律和工程方面,但目前仍处在第二梯队——价格则很亲民。四款模型均已在 ChatPlus 上线。