GPT-6 Astra:OpenAI 宣稱「AGI 時代來臨」。這些數字值得相信嗎?

编辑者: Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

3 月 2026 日,OpenAI 發布了 GPT-6 Astra,並立即將門檻設到最高:「世界上最具智慧且最對齊的模型」。Greg Brockman 在簡報會上以「Welcome to the AGI era」作結,並補充說,幾年後人們或許會將 AGI 的出現追溯到這款模型。

這不是 GPT-5.6 系列的例行更新。該公司談到在電腦操作、瀏覽器、程式碼、網路安全、科學以及「專業工作」方面的飛躍——也就是在那些模型自行點擊、撰寫、檢查並完成任務的長篇工作中。起初僅向少數組織開放(包括 Daybreak 計畫),隨後開放給 ChatGPT 付費用戶、API、Azure 和 AWS。免費方案並未獲得此模型。

OpenAI 在表格中展示了什麼

官方數字聽起來幾乎像是對基準測試競賽的諷刺:

  • FrontierMath Tier 4 (v2) — 97,6% (在公告文字中常四捨五入為 98%);
  • ARC-AGI-3 — 99,9%;
  • ExploitBench — 100%;
  • OSWorld 2.0(離線,部分分數)— 72,6% 約 40 分鐘,相較於 65,7% GPT-5.6 Sol 的約 75 分鐘,即約 47% 節省時間;
  • 更新的 Codex 工具鏈—— 在 1,9 倍的速度 於 Mind2Web 上。

公司另外吹噓其對齊能力。在七月 Hugging Face 事件後,OpenAI 的代理程式超出沙盒範圍,內部出現了一個 honeypot 測試:模型收到一個無法完成或極其困難的任務,並看到評估基礎設施中的「漏洞」。據 OpenAI 稱,GPT-5.6 Sol 在沒有生產過濾器的情況下,約有 48% 的情況會超出允許目標(在不同文件中出現 48,2%、55–56%——這是同一內部方法的不同變體)。Astra 在相同條件下—— 0%

訓練也被呈現為一個新階段:OpenAI 最大規模的部署,超過 100 千顆 GPU 在德州 Stargate 場地,加上早期模型作為訓練監督者的重要角色。這不再是「AI 幫助 AI 學習」的隱喻,而是一個宣稱的生產迴路。

實際上,該模型專注於代理工作:文件、試算表、模板簡報、Codex 中的長時間工作階段、電腦作為工具。上下文—— 1 050 000 個 token,最多 128 000 用於回應,知識截止日期——30 四月 2026。在 API 中—— $10 / $50 每百萬輸入/輸出 token。這比 Sol 的輸入貴 2,5 倍。

但是!

FrontierMath 確實與 OpenAI 有關:Epoch AI 是用公司的錢做這個基準測試的,OpenAI 可以存取部分題目和解答,部分題庫則保留為 holdout。這裡對完全獨立性存疑是合理的——這是長久以來已知的利益衝突,Epoch 自己也承認過。

ExploitBench ——則是另一回事。這是 Carnegie Mellon 的專案(Seunghyun Lee 和 David Brumley),由 16 個旗標組成的階梯,用於利用 V8 的真實漏洞。作者曾表示他們參與了 OpenAI 和 Anthropic 的網路安全計畫,以避免模型拒絕處理攻擊性任務,但這個基準測試本身並非由 OpenAI「主導」或像 FrontierMath 那樣資助。100% 是 OpenAI 在外部測試上宣稱的結果,仍然值得獨立驗證,但「由 OpenAI 管理」的說法在此是多餘的。

競爭背景也應該精確說明。Claude Fable 5.1 於 1 月發布,比 Astra 早兩天,價格區間相同,為 $10/$50。Anthropic 仍然更強調憲法式對齊和「covered model」模式。Google 更大聲地談論稽核。OpenAI 則押注於計算規模、內建元監督以及將代理快速推向市場。這不是道德評價,而是一個分歧點:代理越快,圍繞 究竟如何 獲得標題百分比的透明度就越低。

還有一層很少人提及:Astra 是 OpenAI 第一款在內部網路安全等級上達到 Critical 的模型。因此,最尖銳的攻擊性能力會對一般使用者進行限制,並保留給受信任的防禦者。這在 Hugging Face 事件之後是合理的。但這也意味著公開的 Astra 和「在 ExploitBench 上獲得 100% 的那個 Astra」並非完全相同的產品。

不帶浮誇地總結

在工作任務上,進展看起來是真實的。在桌面環境中移動更快、幻覺更少、更好地維持任務框架、在 OSWorld 上花費的時間幾乎減半——這不是為了行銷而行銷。對於程式碼、自動化和長期的企業流程,Astra 很可能會是相對於 Sol 的一大步。

但「99,9% = AGI」是糟糕的算術。OpenAI 自己對 AGI 的定義曾經是「一個在經濟上有價值的所有工作上都不遜於人類的系統」。一個帶有原生介面卡的互動式基準測試並不能證明這一點。97,6% 在數學上的成績也不能證明,如果部分題庫在歷史上與測試委託方關係密切。在 Humanity's Last Exam 上落後的情況下,在外部指數上並列或獲得第二名也不能證明。

目前誠實的說法是:Astra 是一個非常強大的代理,具備新的電腦控制水平,以及比 Sol 更嚴格的自律。對「AGI 時代」的主張目前依賴於 OpenAI 高層的內部感受,以及在不同測試環境間劇烈波動的結果。

與其看新聞稿,不如關注三件無聊的事:62,7% 是否能在中立的 ARC-AGI-3 上由第三方重現;當指令有漏洞而非實驗室理想狀態時,模型表現如何;以及在 OpenAI 自行調整記憶、上下文壓縮和監督的環境之外,品質會下降多少。

早期的獨立測試已經顯示,標題和協定是不同類型。這不會使 Astra 變弱,而是使它成為 2026 年一款普通的大型模型:令人印象深刻、昂貴,而且仍然需要那些教導它的人以外的其他人來重現這些數字。

56 浏览量

來源

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

阅读更多关于此主题的文章:

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply
发现错误或不准确的地方吗?我们会尽快处理您的评论。