GPT-6 Astra:OpenAI 宣称“AGI 时代”。这些数字可信吗?

编辑者: Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

3月2026日,OpenAI 发布了 GPT-6 Astra,并立即将标准设到最高:“全球最智能、最对齐的模型”。Greg Brockman 在简报会上以“欢迎来到 AGI 时代”结束发言,并补充说,几年后人们或许会以这个模型为起点来追溯 AGI 的出现。

这并非 GPT-5.6 系列的常规更新。该公司谈到了在计算机操作、浏览器、代码、网络安全、科学以及“专业工作”方面的飞跃——即在长任务中,模型自行点击、编写、检查并完成任务。起初仅向少数组织开放(包括 Daybreak 计划),随后向 ChatGPT 付费用户、API、Azure 和 AWS 开放。免费用户无法使用该模型。

OpenAI 在表格中展示了什么

官方数据听起来几乎像是对基准测试竞赛的讽刺:

  • FrontierMath Tier 4 (v2) — 97,6% (公告文本中常四舍五入为 98%);
  • ARC-AGI-3 — 99,9%;
  • ExploitBench — 100%;
  • OSWorld 2.0(离线,部分得分)— 72,6% 大约 40 分钟,而 65,7% GPT-5.6 Sol 约为 75 分钟,即约 47% 节省时间;
  • 更新的 Codex 工具链—— 在 1,9 倍的速度上 在 Mind2Web 上。

另外,公司还夸耀其对齐性。在七月的 Hugging Face 事件(OpenAI 的智能体突破了沙盒)之后,出现了一个内部蜜罐测试:模型接到一个无法完成或极其困难的任务,并看到评估基础设施中的“漏洞”。据 OpenAI 称,GPT-5.6 Sol 在没有生产过滤器的情况下,大约在 48% 的情况下会越界去追求超出允许的目标(在不同文档中可见 48,2%、55–56%——这是同一内部方法的不同变体)。Astra 在相同条件下—— 0%

训练也被描述为一个新阶段:OpenAI 最大规模的部署,超过 100 千块 GPU 在得克萨斯州的 Stargate 场地,加上早期模型作为训练监督者的重要作用。这不再是“AI 帮助训练 AI”的隐喻,而是一个宣称的生产循环。

实际上,该模型针对智能体工作进行了优化:文档、表格、按模板制作的演示文稿、Codex 中的长时间会话、将计算机作为工具。上下文—— 1 050 000 个令牌,最多 128 000 用于响应,知识截止日期为 30 年 2026 月。在 API 中—— $10 / $50 每百万输入/输出令牌。这比 Sol 的输入贵 2,5 倍。

但是!

FrontierMath 确实与 OpenAI 有关:Epoch AI 是用公司的钱做的基准测试,OpenAI 可以访问部分任务和解决方案,部分数据集保留在 holdout 中。在这里怀疑其完全独立性是合理的——这是早已众所周知的利益冲突,Epoch 自己也承认过。

ExploitBench ——则是另一回事。这是 Carnegie Mellon 的项目(Seunghyun Lee 和 David Brumley),一个由 16 个旗帜组成的阶梯,用于利用 V8 的真实漏洞。作者曾写道,他们参与了 OpenAI 和 Anthropic 的网络安全项目,以便模型不会拒绝解决攻击性任务,但基准测试本身并非由 OpenAI“主导”或像 FrontierMath 那样资助。100%——是 OpenAI 在他人测试上声称的结果,仍然值得独立复核,但“由 OpenAI 管理”的表述在这里是多余的。

竞争背景也应该准确描述。Claude Fable 5.1 于 1 月发布,比 Astra 早两天,价格区间相同,为 $10/$50。Anthropic 仍然更强调宪法对齐和“covered model”模式。Google 更响亮地谈论审计。OpenAI 则押注于计算规模、内置元监督和代理推向市场的速度。这不是道德评价,而是一个分岔口:代理越快,围绕 究竟如何 获得标题百分比的透明度就越低。

还有一个很少有人提及的层面:Astra 是 OpenAI 第一款在内部网络安全等级上达到 Critical 级别的模型。因此,最尖锐的攻击性能力对普通用户进行了削减,只留给受信任的防御者。这在 Hugging Face 事件之后是合理的。但这同样意味着,公开的 Astra 和“在 ExploitBench 上获得 100% 的那个 Astra”并非完全相同的产品。

不带夸张地说,这意味着什么

在实际任务上,进步看起来是真实的。在桌面上导航更快,幻觉更少,更好地保持任务框架,在 OSWorld 上时间几乎减半——这不是为了营销而营销。对于代码、自动化和长企业流水线,Astra 很可能是相对于 Sol 的一个显著进步。

但“99,9% = AGI”是糟糕的算术。OpenAI 自己对 AGI 的定义曾经是“一个系统,能像人类一样完成所有经济上有价值的工作”。一个带有原生适配器的交互式基准测试并不能证明这一点。97,6% 在数学上的成绩也不能证明,如果部分数据集在历史上与测试的委托方有关。在 Humanity's Last Exam 上落后,而在他人指数上并列或第二,也不能证明。

目前诚实的表述是:Astra 是一个非常强大的代理,具有新的计算机控制水平,并且与 Sol 相比有更严格的自律。对“AGI 时代”的主张目前依赖于 OpenAI 领导层的内部感觉,以及在不同测试环境中剧烈波动的结果。

与其看新闻稿,不如关注三件枯燥的事情:62,7% 是否能在中立的 ARC-AGI-3 上由外部人员复现;当指令有漏洞而非实验室理想状态时,模型的表现如何;以及在 OpenAI 自己调整了记忆、上下文压缩和监督的环境之外,质量下降了多少。

早期的独立运行已经表明,标题和协议是两种不同的类型。这并不会使 Astra 变弱。这使它成为 2026 年一款普通的大型模型:令人印象深刻、昂贵,并且仍然需要那些不仅仅是训练它的人来复现这些数字。

56 查看

来源

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

阅读更多关于此主题的文章:

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply
你发现了错误或不准确的地方吗?我们会尽快考虑您的意见。