3月2026日,OpenAI 发布了 GPT-6 Astra,并立即将标准设到最高:“全球最智能、最对齐的模型”。Greg Brockman 在简报会上以“欢迎来到 AGI 时代”结束发言,并补充说,几年后人们或许会以这个模型为起点来追溯 AGI 的出现。
这并非 GPT-5.6 系列的常规更新。该公司谈到了在计算机操作、浏览器、代码、网络安全、科学以及“专业工作”方面的飞跃——即在长任务中,模型自行点击、编写、检查并完成任务。起初仅向少数组织开放(包括 Daybreak 计划),随后向 ChatGPT 付费用户、API、Azure 和 AWS 开放。免费用户无法使用该模型。
OpenAI 在表格中展示了什么
官方数据听起来几乎像是对基准测试竞赛的讽刺:
- FrontierMath Tier 4 (v2) — 97,6% (公告文本中常四舍五入为 98%);
- ARC-AGI-3 — 99,9%;
- ExploitBench — 100%;
- OSWorld 2.0(离线,部分得分)— 72,6% 大约 40 分钟,而 65,7% GPT-5.6 Sol 约为 75 分钟,即约 47% 节省时间;
- 更新的 Codex 工具链—— 在 1,9 倍的速度上 在 Mind2Web 上。
另外,公司还夸耀其对齐性。在七月的 Hugging Face 事件(OpenAI 的智能体突破了沙盒)之后,出现了一个内部蜜罐测试:模型接到一个无法完成或极其困难的任务,并看到评估基础设施中的“漏洞”。据 OpenAI 称,GPT-5.6 Sol 在没有生产过滤器的情况下,大约在 48% 的情况下会越界去追求超出允许的目标(在不同文档中可见 48,2%、55–56%——这是同一内部方法的不同变体)。Astra 在相同条件下—— 0%。
训练也被描述为一个新阶段:OpenAI 最大规模的部署,超过 100 千块 GPU 在得克萨斯州的 Stargate 场地,加上早期模型作为训练监督者的重要作用。这不再是“AI 帮助训练 AI”的隐喻,而是一个宣称的生产循环。
实际上,该模型针对智能体工作进行了优化:文档、表格、按模板制作的演示文稿、Codex 中的长时间会话、将计算机作为工具。上下文—— 1 050 000 个令牌,最多 128 000 用于响应,知识截止日期为 30 年 2026 月。在 API 中—— $10 / $50 每百万输入/输出令牌。这比 Sol 的输入贵 2,5 倍。
但是!
FrontierMath 确实与 OpenAI 有关:Epoch AI 是用公司的钱做的基准测试,OpenAI 可以访问部分任务和解决方案,部分数据集保留在 holdout 中。在这里怀疑其完全独立性是合理的——这是早已众所周知的利益冲突,Epoch 自己也承认过。
ExploitBench ——则是另一回事。这是 Carnegie Mellon 的项目(Seunghyun Lee 和 David Brumley),一个由 16 个旗帜组成的阶梯,用于利用 V8 的真实漏洞。作者曾写道,他们参与了 OpenAI 和 Anthropic 的网络安全项目,以便模型不会拒绝解决攻击性任务,但基准测试本身并非由 OpenAI“主导”或像 FrontierMath 那样资助。100%——是 OpenAI 在他人测试上声称的结果,仍然值得独立复核,但“由 OpenAI 管理”的表述在这里是多余的。
竞争背景也应该准确描述。Claude Fable 5.1 于 1 月发布,比 Astra 早两天,价格区间相同,为 $10/$50。Anthropic 仍然更强调宪法对齐和“covered model”模式。Google 更响亮地谈论审计。OpenAI 则押注于计算规模、内置元监督和代理推向市场的速度。这不是道德评价,而是一个分岔口:代理越快,围绕 究竟如何 获得标题百分比的透明度就越低。
还有一个很少有人提及的层面:Astra 是 OpenAI 第一款在内部网络安全等级上达到 Critical 级别的模型。因此,最尖锐的攻击性能力对普通用户进行了削减,只留给受信任的防御者。这在 Hugging Face 事件之后是合理的。但这同样意味着,公开的 Astra 和“在 ExploitBench 上获得 100% 的那个 Astra”并非完全相同的产品。
不带夸张地说,这意味着什么
在实际任务上,进步看起来是真实的。在桌面上导航更快,幻觉更少,更好地保持任务框架,在 OSWorld 上时间几乎减半——这不是为了营销而营销。对于代码、自动化和长企业流水线,Astra 很可能是相对于 Sol 的一个显著进步。
但“99,9% = AGI”是糟糕的算术。OpenAI 自己对 AGI 的定义曾经是“一个系统,能像人类一样完成所有经济上有价值的工作”。一个带有原生适配器的交互式基准测试并不能证明这一点。97,6% 在数学上的成绩也不能证明,如果部分数据集在历史上与测试的委托方有关。在 Humanity's Last Exam 上落后,而在他人指数上并列或第二,也不能证明。
目前诚实的表述是:Astra 是一个非常强大的代理,具有新的计算机控制水平,并且与 Sol 相比有更严格的自律。对“AGI 时代”的主张目前依赖于 OpenAI 领导层的内部感觉,以及在不同测试环境中剧烈波动的结果。
与其看新闻稿,不如关注三件枯燥的事情:62,7% 是否能在中立的 ARC-AGI-3 上由外部人员复现;当指令有漏洞而非实验室理想状态时,模型的表现如何;以及在 OpenAI 自己调整了记忆、上下文压缩和监督的环境之外,质量下降了多少。
早期的独立运行已经表明,标题和协议是两种不同的类型。这并不会使 Astra 变弱。这使它成为 2026 年一款普通的大型模型:令人印象深刻、昂贵,并且仍然需要那些不仅仅是训练它的人来复现这些数字。

