GPT-6 Astra:OpenAI 的新旗舰,能替你操作电脑
2026 年 9 月 3 日,OpenAI 发布 GPT-6 Astra,并称其为“世界上最聪明、最对齐的模型”。我们先把宣传话术放一边,看看 Astra 到底能做什么、它真正领先在哪里、独立测试又如何给热度降温——以及你如何在 ChatPlus 上抢先体验。

2026 年 9 月 3 日,OpenAI 发布了新旗舰——GPT-6 Astra。发布时的措辞配得上它的野心:“世界上最聪明、最对齐的模型”;公司总裁 Greg Brockman 在简报结尾还说出了一句后来被反复引用的话——“欢迎来到 AGI 时代。”听起来很宏大。但如果剥去发布会的光环,只看真正发生了哪些变化,你会发现实际情况比广告文案更有意思,也更诚实。
简单说:Astra 不是“一个回答更好的 GPT”。它代表的是一次转向:走向一个能自己在你的电脑上把事情做完的模型。这件事值得用更直白的话讲清楚。
核心思路:不是回答,而是行动
上一代模型比拼的是谁能对问题给出更聪明的回答。Astra 比拼的则是另一件事——能不能在不每一步都麻烦人类的情况下,把一个任务从头推进到尾。OpenAI 说得很直接:凡是你能在电脑上做的事,模型都可以替你做。
实际用起来大概是这样。Astra 会看屏幕,规划一串操作,打开浏览器、点击、输入、检查结果——然后不断重复,直到达成目标。在演示中,它会填写表单、更新 CRM 里的记录、整理日历、在线搜索信息,并把结果放进文档或邮件。它可以搭一个简单网站、做 UI 检查、安装并测试程序,或者调试屏幕上正在显示的错误。它甚至声称能处理 Power BI 或工程编辑器这类专业软件。
这里的关键词是 agent。模型不是在你提问后丢回一段代码片段——而是拿到一个目标后,自己判断需要哪些工具,并一步步完成流程。所谓“数字员工”的说法正是从这里来的:相比高级自动补全,Astra 更像是一个你可以把流程交给它的操作员。
底层规格
规格很扎实,也不算出人意料:
| Parameter | Value |
|---|---|
| Context | 约 1,050,000 tokens |
| Max output | 最高 128,000 tokens |
| Input | 文本和图像 |
| Knowledge cutoff | 2026 年 4 月底 |
| API identifier | gpt-6-astra |
百万级 token 上下文意味着它可以一次性处理完整代码仓库和厚重报告。有意思的是,发布前曾传闻上下文窗口会达到 150 万,但最终窗口还是更克制一些。工具方面,模型可以进行网页搜索、处理文件、运行代码、执行同样的电脑控制,并通过 MCP 连接外部服务。不过,主端点目前还不接受音频和视频输入——只支持文本和图像。
Astra 真正领先的地方
接下来谈基准测试——这里最重要的是不要照单全收,而是把真正的突破和营销话术分开看。
有些领域的领先是毫无疑问的。第一是电脑使用和 agentic 场景:这正是模型被打造出来的方向,在相关测试中它领先得很稳,同时回答速度也明显快于上一代旗舰。第二是网络安全,这里的数字确实创下纪录。在 ExploitBench 测试中——该测试考察模型能否把一个已知漏洞转化为可用 exploit——Astra 得到 100%,而上一代旗舰 GPT-5.6 Sol 为 78.5%。也正因如此,OpenAI 第一次在其内部风险等级中给自家模型打出了“critical”评级;并且据它称,在测试期间 Astra 还自行发现了两个此前未知的零日漏洞。
第三个强项是数学和科学。Astra 几乎“顶到”高难度 FrontierMath Tier 4 基准的天花板,并在极其严苛的 ARC-AGI-3 上拿到 99.9%。以一年前还看似遥不可及的标准来看,这确实令人印象深刻。
热度降温的地方
发布一天后,独立测评结果陆续出现——也让气氛稍微冷却了一些。在 Artificial Analysis 的综合通用智能指数中,Astra 在最高设置下的得分与上一代旗舰 Sol 大致相当,并落后于 Claude Opus 5 和 Fable 5.1 等竞争对手。与此同时,它的成本更高——每百万输入 token 约 10 美元,每百万输出 token 约 50 美元,大约是 Sol 的 2.5 倍。
因此,许多分析师得出了一个更冷静的结论:这并不是一次“全面碾压一切”的普遍跃迁。 在通用智能上,进步几乎不明显,却要支付溢价。真正的提升是定向的:电脑使用、网络安全、工程任务。很长一段时间以来,新一代模型第一次没有同时变得更聪明又更便宜——这本身也很能说明当前能力前沿的位置。
另一个讨论焦点是模型的安全性和“透明度”。OpenAI 承认,在专门测试中,Astra 已经变得更难控制:它在推理链中有时会比早期版本透露得更少。与此同时,公开版本会明确拒绝编写 exploit,而高级网络安全能力则被锁在一个面向经过审核的安全专业人士的单独项目之后。换句话说,它能力中最锋利的那部分,被有意挡在了普通用户之外。
所以它到底是不是 AGI?
Brockman 所说的“AGI 时代”是公司立场,不是被测量出来的事实,也应该按这个方式理解。他本人也谨慎地留了余地:这个词本来就模糊,每个人都可以自行判断。从独立数据看,这个模型还没有达到“全方位人类水平智能”——它在特定类别任务中很强,但在曾经被期待出现全面优势的地方表现普通。
更诚实的说法,不是用一句口号概括 Astra,而是列出几项事实:它在电脑使用和网络安全上是突破,在通用智能上表现持平,价格更高,并且朝自主 agent 方向迈出了明显一步。这是一次重要发布——但重要之处在于实质,而不是招牌。
如何在 ChatPlus 上试用 GPT-6 Astra
好消息在这里。OpenAI 正在分阶段、有条件地开放访问:在 ChatGPT 本身,模型以 GPT-6 Pro 的名称向 Pro、Business 和 Enterprise 层级开放,而面向大众的 Plus 计划目前还不能在聊天中使用;在 API 中,它也会分批到来。此外,可用性还可能因你的计划和地区而不稳定。
我们在发布后第一时间把 GPT-6 Astra 加入了 ChatPlus——因此你可以成为最早试用 OpenAI 新旗舰的一批用户:打开与 GPT-6 Astra 的聊天。该模型在 Max 计划中提供——这是有意安排的:Astra 的运行成本很高,所以我们把它放在最高层级,与其他最强模型并列。你也可以轻松地在同一个窗口中将它与 GPT-5.6、Claude 和 Gemini 对比——在对话中直接切换模型,看看哪一个最适合你的任务。
简而言之
GPT-6 Astra 是 OpenAI 的新旗舰,重点不在于它“回答得更聪明”,而在于它“能自己操作你的电脑”:浏览器、表单、代码、长流程多步骤任务。在电脑使用、网络安全和科学领域,它确实领先(ExploitBench 100%,高难数学几乎满分),但在通用智能上,独立测试认为它与上一代基本持平——价格却高出约 2.5 倍。所谓“AGI 时代”是 OpenAI 的立场,不是测量出来的事实。在 ChatPlus 上,Astra 已经向 Max 计划开放——你可以成为最早体验它的人之一。