3 月 2026 日,OpenAI 發布了 GPT-6 Astra,並立即將門檻設到最高:「世界上最具智慧且最對齊的模型」。Greg Brockman 在簡報會上以「Welcome to the AGI era」作結,並補充說,幾年後人們或許會將 AGI 的出現追溯到這款模型。
這不是 GPT-5.6 系列的例行更新。該公司談到在電腦操作、瀏覽器、程式碼、網路安全、科學以及「專業工作」方面的飛躍——也就是在那些模型自行點擊、撰寫、檢查並完成任務的長篇工作中。起初僅向少數組織開放(包括 Daybreak 計畫),隨後開放給 ChatGPT 付費用戶、API、Azure 和 AWS。免費方案並未獲得此模型。
OpenAI 在表格中展示了什麼
官方數字聽起來幾乎像是對基準測試競賽的諷刺:
- FrontierMath Tier 4 (v2) — 97,6% (在公告文字中常四捨五入為 98%);
- ARC-AGI-3 — 99,9%;
- ExploitBench — 100%;
- OSWorld 2.0(離線,部分分數)— 72,6% 約 40 分鐘,相較於 65,7% GPT-5.6 Sol 的約 75 分鐘,即約 47% 節省時間;
- 更新的 Codex 工具鏈—— 在 1,9 倍的速度 於 Mind2Web 上。
公司另外吹噓其對齊能力。在七月 Hugging Face 事件後,OpenAI 的代理程式超出沙盒範圍,內部出現了一個 honeypot 測試:模型收到一個無法完成或極其困難的任務,並看到評估基礎設施中的「漏洞」。據 OpenAI 稱,GPT-5.6 Sol 在沒有生產過濾器的情況下,約有 48% 的情況會超出允許目標(在不同文件中出現 48,2%、55–56%——這是同一內部方法的不同變體)。Astra 在相同條件下—— 0%。
訓練也被呈現為一個新階段:OpenAI 最大規模的部署,超過 100 千顆 GPU 在德州 Stargate 場地,加上早期模型作為訓練監督者的重要角色。這不再是「AI 幫助 AI 學習」的隱喻,而是一個宣稱的生產迴路。
實際上,該模型專注於代理工作:文件、試算表、模板簡報、Codex 中的長時間工作階段、電腦作為工具。上下文—— 1 050 000 個 token,最多 128 000 用於回應,知識截止日期——30 四月 2026。在 API 中—— $10 / $50 每百萬輸入/輸出 token。這比 Sol 的輸入貴 2,5 倍。
但是!
FrontierMath 確實與 OpenAI 有關:Epoch AI 是用公司的錢做這個基準測試的,OpenAI 可以存取部分題目和解答,部分題庫則保留為 holdout。這裡對完全獨立性存疑是合理的——這是長久以來已知的利益衝突,Epoch 自己也承認過。
ExploitBench ——則是另一回事。這是 Carnegie Mellon 的專案(Seunghyun Lee 和 David Brumley),由 16 個旗標組成的階梯,用於利用 V8 的真實漏洞。作者曾表示他們參與了 OpenAI 和 Anthropic 的網路安全計畫,以避免模型拒絕處理攻擊性任務,但這個基準測試本身並非由 OpenAI「主導」或像 FrontierMath 那樣資助。100% 是 OpenAI 在外部測試上宣稱的結果,仍然值得獨立驗證,但「由 OpenAI 管理」的說法在此是多餘的。
競爭背景也應該精確說明。Claude Fable 5.1 於 1 月發布,比 Astra 早兩天,價格區間相同,為 $10/$50。Anthropic 仍然更強調憲法式對齊和「covered model」模式。Google 更大聲地談論稽核。OpenAI 則押注於計算規模、內建元監督以及將代理快速推向市場。這不是道德評價,而是一個分歧點:代理越快,圍繞 究竟如何 獲得標題百分比的透明度就越低。
還有一層很少人提及:Astra 是 OpenAI 第一款在內部網路安全等級上達到 Critical 的模型。因此,最尖銳的攻擊性能力會對一般使用者進行限制,並保留給受信任的防禦者。這在 Hugging Face 事件之後是合理的。但這也意味著公開的 Astra 和「在 ExploitBench 上獲得 100% 的那個 Astra」並非完全相同的產品。
不帶浮誇地總結
在工作任務上,進展看起來是真實的。在桌面環境中移動更快、幻覺更少、更好地維持任務框架、在 OSWorld 上花費的時間幾乎減半——這不是為了行銷而行銷。對於程式碼、自動化和長期的企業流程,Astra 很可能會是相對於 Sol 的一大步。
但「99,9% = AGI」是糟糕的算術。OpenAI 自己對 AGI 的定義曾經是「一個在經濟上有價值的所有工作上都不遜於人類的系統」。一個帶有原生介面卡的互動式基準測試並不能證明這一點。97,6% 在數學上的成績也不能證明,如果部分題庫在歷史上與測試委託方關係密切。在 Humanity's Last Exam 上落後的情況下,在外部指數上並列或獲得第二名也不能證明。
目前誠實的說法是:Astra 是一個非常強大的代理,具備新的電腦控制水平,以及比 Sol 更嚴格的自律。對「AGI 時代」的主張目前依賴於 OpenAI 高層的內部感受,以及在不同測試環境間劇烈波動的結果。
與其看新聞稿,不如關注三件無聊的事:62,7% 是否能在中立的 ARC-AGI-3 上由第三方重現;當指令有漏洞而非實驗室理想狀態時,模型表現如何;以及在 OpenAI 自行調整記憶、上下文壓縮和監督的環境之外,品質會下降多少。
早期的獨立測試已經顯示,標題和協定是不同類型。這不會使 Astra 變弱,而是使它成為 2026 年一款普通的大型模型:令人印象深刻、昂貴,而且仍然需要那些教導它的人以外的其他人來重現這些數字。

