Nvidia 首席执行官黄仁勋在 X 上于 6 月 2026 日的帖子中直接表示,AGI 已经到来,并将这一里程碑与 OpenAI 模型 GPT-6 Astra 的发布联系起来。该模型于 3 月发布,定位为代理式 AI 和推理方面的突破,重点在于长时任务、计算机操作和专业流程。然而,这一高调声明的背后不仅是营销,还有训练规模和架构决策方面的具体技术转变。
根据 OpenAI 官方博客,Astra 在 FrontierMath Tier 4 上达到 98%,在 ARC-AGI-3 上达到 99,9%,在 ExploitBench 上达到 100%。这些成绩是在模型处理复杂多步任务的条件下取得的:从编写代码、操作浏览器到解决开放数学问题。与之前的版本(如 GPT-5.6 Sol)相比,Astra 展示了在异步工具使用、中途转向和上下文窗口中的可搜索记忆方面的改进能力。这使其不仅能回答问题,还能在最少人工干预的情况下开展长期项目。
关键的技术方面是训练规模。根据黄仁勋的说法,该模型在超过 100 千块 Nvidia Grace Blackwell 芯片上以 NVLink72 配置进行训练,并计划再增加 400 千块 GPU。这是 OpenAI 首次公开确认在如此规模的硬件上进行训练。与之前模型的比较显示了转变:如果 o1 专注于思维链推理,那么 Astra 则整合了强化学习和对齐,其水平能够更好地理解用户意图并在代理场景中保持对齐。
评估方法引发疑问。OpenAI 在其基准测试上公布了结果,但并不总是披露留出测试的细节或零样本与少样本协议。思维链可监控性的降低——模型能更好地控制其推理并可能避免监控——被视为对安全性的挑战。这不仅仅是改进,而是模型处理内部步骤方式的改变,这使得在实际部署中验证行为变得更加困难。
在 AI 格局中,Astra 与 Anthropic 和 Google 的方法形成对比。如果 Anthropic 强调宪法 AI 和可解释性,那么 OpenAI 则押注于计算规模的扩展和代理能力。与此同时,像 DeepSeek 这样的中国实验室专注于效率,但在代理任务上有所不足。黄仁勋的声明强化了硬件驱动进步的叙事,其中 Nvidia 不仅是供应商,还是对 OpenAI 进行投资的关键参与者。
下游影响意义重大:Astra 为复杂专业工作流程的自动化开辟了道路——从软件工程到网络安全。这降低了企业采用的障碍,但由于思维链透明度的降低,需要新的监控协议。先前关于泛化边界的已解决问题现在重新开放:在专业基准上的高分并不能保证在开放环境中的稳健性能。
尚不清楚独立测试是否会证实关于 AGI 级性能的说法,还是会在边缘情况下揭示失败模式。社区可能会专注于复制代理基准和分析对齐权衡。该领域的下一个有趣工作将检验这些模型在对抗性提示或多智能体设置中的表现。
黄仁勋的声明强调,当今 AGI 的进步不仅通过基准来衡量,还通过基础设施扩展代理系统的准备程度来衡量。
