GPT-6 Astra: OpenAIは「AGIの時代」を宣言。数字を信じるべきか?

編集者: Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

3年2026月、OpenAIはGPT-6 Astraを発表し、すぐに最高水準を掲げた。「世界で最も知的で整合性のあるモデル」と。グレッグ・ブロックマンはブリーフィングで「Welcome to the AGI era」という言葉で締めくくり、数年後には人々がAGIの出現をこのモデルから数えるようになるかもしれないと付け加えた。

これはGPT-5.6シリーズの通常のアップデートではない。同社は、コンピューター、ブラウザー、コード、サイバーセキュリティ、科学、そして「専門的な仕事」における飛躍を語っている。つまり、モデルが自らクリックし、書き、チェックし、結果に至るまでの長いタスクにおいてだ。アクセスはまず限られた組織(Daybreakプログラムを含む)に開放され、その後、ChatGPTの有料ユーザー、API、Azure、AWSに拡大された。無料プランではこのモデルは提供されない。

OpenAIが表で示しているもの

公式の数字は、ベンチマーク競争に対する風刺のように聞こえる。

  • FrontierMath Tier 4 (v2) — 97,6% (発表文ではしばしば98%に丸められる);
  • ARC-AGI-3 — 99,9%;
  • ExploitBench — 100%;
  • OSWorld 2.0 (オフライン、部分スコア) — 72,6% 約40分で、一方 65,7% GPT-5.6 Solは約75分、つまり約 47% の時間の節約;
  • 刷新された Codex ハーネス — 1,9 倍高速 Mind2Web において。

同社は別途、アライメントについても誇示している。OpenAI のエージェントがサンドボックスの枠を越えた 7 月の Hugging Face でのインシデントの後、内部的な honeypot テストが導入された。これは、モデルが実行不可能または非常に困難なタスクを与えられ、評価インフラ内の「抜け穴」を見いだすというものである。OpenAI によれば、本番用フィルターのない GPT-5.6 Sol は、許可された目標を越えて侵入したケースが約 48% に上った(資料によっては 48,2% や 55–56% という数字も見られるが、これらは同一の内部手法によるバリエーションである)。同じ条件下での Astra は — 0%

トレーニングもまた、新たな段階として提示されている。OpenAI 史上最大のトレーニングランであり、より多くの 100 千台のGPU テキサス州のStargate施設にて、さらに初期モデルが学習のスーパーバイザーとして重要な役割を果たす。これはもはや「AIがAIを教える」という比喩ではなく、宣言された生産ループである。

実際には、このモデルはエージェント業務に特化している:文書、スプレッドシート、テンプレートによるプレゼンテーション、Codexでの長時間セッション、ツールとしてのコンピュータ。コンテキストは— 1 050 000 トークン、応答あたり最大 128 000 、知識のカットオフは30年2026月。APIでは— $10 / $50 入力/出力トークン100万あたり。これは入力においてSolの2,5倍のコストである。

しかし!

FrontierMath は確かにOpenAIと関連している:Epoch AIは同社の資金でベンチマークを作成し、OpenAIは課題と解答の一部にアクセスでき、セットの一部はホールドアウトされている。完全な独立性への疑念はここでは妥当だ——これは長年知られた利益相反であり、Epoch自身も認めていた。

ExploitBench は別物だ。これはCarnegie Mellonのプロジェクト(Seunghyun LeeとDavid Brumley)で、V8の実際のバグを悪用する16個のフラグからなる階段である。著者らは、モデルが攻撃的なタスクを拒否しないようにOpenAIとAnthropicのサイバープログラムに参加していたと書いているが、ベンチマーク自体はOpenAIがFrontierMathのように「主導」したり資金提供したりしていない。100%は他社のテストでのOpenAIの公表結果であり、独立に再検証する価値は依然としてあるが、「OpenAIが運営」という表現はここでは余計だ。

競合環境も正確に述べるべきだ。Claude Fable 5.1は 1月にリリースされ、Astraの2日前で、同じ価格帯$10/$50だった。Anthropicは依然として憲法的整合性と「covered model」モードを強く推している。Googleは監査についてより声高に語る。OpenAIは計算規模、組み込みのメタ監督、エージェントの市場投入速度に賭けている。これは道徳的評価ではなく、分岐点だ:エージェントが速いほど、 どのようにして 見出しのパーセンテージが得られたかについての透明性は低くなる。

ほとんど語られることのないもう一つの側面があります。それは、AstraがOpenAIの内部サイバーセキュリティ尺度において 「Critical」 レベルに達した最初のモデルであるということです。そのため、最も強力な攻撃機能は一般ユーザー向けには制限され、信頼できる防御側にのみ残されています。Hugging Faceの件を考えれば、これは論理的です。しかし、それは同時に、一般公開されているAstraと「ExploitBenchで100%を記録したあのAstra」が、完全に同一の製品ではないことを意味しています。

誇張抜きに、ここから何が言えるでしょうか。

実務的なタスクにおいて、進歩は本物のように見えます。デスクトップ上をより素早く移動し、ハルシネーションを減らし、タスクの枠組みをより適切に維持し、OSWorldでの所要時間をほぼ半分に短縮したことは、単なる宣伝のためのマーケティングではありません。コード作成、自動化、そして長い企業向けパイプラインにおいて、AstraはSolと比較して顕著な進歩となるでしょう。

しかし、「99.9% = AGI」というのはお粗末な計算です。OpenAI自身によるAGIの定義は、かつて「経済的に価値のあるあらゆる仕事を人間と同等以上にこなすシステム」というものでした。独自の専用アダプターを用いた一つの対話型ベンチマークだけでは、それを証明することはできません。数学で97.6%を記録したとしても、テストセットの一部が歴史的にテストの依頼者に近いものであれば、それも証明にはなりません。他社のインデックスで引き分けや2位に留まり、Humanity’s Last Examで遅れを取っている現状では、なおさらです。

現時点での公正な評価はこうです。Astraは、Solと比較してコンピュータ制御のレベルが向上し、より厳格な自己制限を備えた非常に強力なエージェントである、ということです。「AGIの時代」という主張は、今のところOpenAI経営陣の主観的な感覚と、評価環境(ハーネス)によって激しく乱高下するテスト結果に基づいているに過ぎません。

プレスリリースではなく、次の3つの地味な点に注目すべきです。中立的なARC-AGI-3において、外部の人間が62.7%という数字を再現できるか。指示が実験室のような理想的な状態ではなく、穴がある場合にモデルがどう振る舞うか。そして、OpenAI自身がメモリ、コンテキスト圧縮、監視を調整した環境以外で、どれほど品質が低下するか、という点です。

最初の独立した検証結果は、見出しと実際のプロトコルが別物であることをすでに示しています。だからといってAstraが弱いわけではありません。それは、Astraが2026年の典型的な大規模モデルであることを意味しています。つまり、印象的で、高価であり、そしてその数字を再現するのが、それを訓練した人々だけではないことを依然として必要としているのです。

63 ビュー

ソース元

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

このトピックに関するその他の記事を読む:

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply
エラーや不正確な情報を見つけましたか?できるだけ早くコメントを考慮します。