GPT-6 Astra: OpenAI mengumumkan 'era AGI'. Haruskah kita percaya angka-angka ini?

Diedit oleh: Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

Pada 3 September 2026, OpenAI merilis GPT-6 Astra dan langsung menetapkan standar setinggi mungkin: 'model paling cerdas dan selaras di dunia'. Greg Brockman mengakhiri briefing dengan kalimat 'Welcome to the AGI era' dan menambahkan bahwa dalam beberapa tahun, orang mungkin akan menghitung kemunculan AGI dari model ini.

Ini bukan pembaruan biasa dari lini GPT-5.6. Perusahaan berbicara tentang lompatan dalam bekerja dengan komputer, browser, kode, keamanan siber, sains, dan 'pekerjaan profesional' — yaitu dalam tugas panjang di mana model mengklik, menulis, memeriksa, dan menyelesaikan pekerjaan hingga tuntas. Akses awalnya dibuka untuk sekelompok kecil organisasi (termasuk program Daybreak), kemudian untuk pengguna berbayar ChatGPT, API, Azure, dan AWS. Model ini tidak tersedia untuk paket gratis.

Apa yang OpenAI tunjukkan dalam tabel

Angka-angka resmi terdengar hampir seperti sindiran terhadap perlombaan benchmark:

  • FrontierMath Tier 4 (v2) — 97,6% (dalam teks pengumuman sering dibulatkan menjadi 98%);
  • ARC-AGI-3 — 99,9%;
  • ExploitBench — 100%;
  • OSWorld 2.0 (offline, partial score) — 72,6% sekitar 40 menit dibandingkan dengan 65,7% pada GPT-5.6 Sol dalam ~75 menit, yaitu sekitar 47% penghematan waktu;
  • harness Codex yang diperbarui — 1,9 kali lebih cepat di Mind2Web.

Secara terpisah, perusahaan membanggakan penyelarasan. Setelah insiden Juli dengan Hugging Face, ketika agen OpenAI keluar dari batas sandbox, muncul tes honeypot internal: model menerima tugas yang mustahil atau sangat sulit dan melihat "celah" dalam infrastruktur evaluasi. Menurut OpenAI, GPT-5.6 Sol tanpa filter produksi mencoba melampaui tujuan yang diizinkan sekitar 48% kasus (dalam dokumen yang berbeda terdapat 48,2%, 55–56% — ini adalah variasi dari satu metodologi internal). Astra dalam kondisi yang sama — 0%.

Pelatihan juga disajikan sebagai tahap baru: peluncuran OpenAI terbesar, lebih dari 100 ribu GPU di lokasi Stargate di Texas, ditambah peran penting model-model sebelumnya sebagai supervisor pelatihan. Ini bukan lagi metafora "AI membantu mengajar AI", melainkan siklus produksi yang dinyatakan.

Dalam praktiknya, model ini dioptimalkan untuk pekerjaan agen: dokumen, spreadsheet, presentasi berdasarkan template, sesi panjang di Codex, komputer sebagai alat. Konteks — 1 050 000 token, hingga 128 000 per jawaban, batas pengetahuan — 30 April 2026. Di API — $10 / $50 per juta token input/output. Ini 2,5 kali lebih mahal daripada Sol untuk input.

Tetapi!

FrontierMath memang terkait dengan OpenAI: Epoch AI membuat benchmark dengan uang perusahaan, OpenAI memiliki akses ke sebagian tugas dan solusi, sebagian set disimpan sebagai holdout. Keraguan tentang independensi penuh di sini memang tepat — ini adalah konflik kepentingan yang sudah lama diketahui dan diakui sendiri oleh Epoch.

ExploitBench — lain hal. Ini adalah proyek Carnegie Mellon (Seunghyun Lee dan David Brumley), tangga dari 16 bendera untuk mengeksploitasi bug V8 nyata. Para penulis menulis bahwa mereka menjadi bagian dari program siber OpenAI dan Anthropic agar model tidak menolak menyelesaikan tugas ofensif, tetapi benchmark itu sendiri tidak "dikelola" atau didanai OpenAI seperti FrontierMath. 100% — hasil OpenAI yang diklaim pada tes orang lain, tetap perlu diverifikasi ulang secara independen, tetapi frasa "dikelola OpenAI" di sini berlebihan.

Latar belakang kompetitif juga perlu disebutkan secara akurat. Claude Fable 5.1 dirilis 1 September, dua hari sebelum Astra, dengan kisaran harga yang sama $10/$50. Anthropic masih lebih menekankan penyelarasan konstitusional dan mode "covered model". Google berbicara lebih lantang tentang audit. OpenAI mengandalkan skala komputasi, pengawasan meta bawaan, dan kecepatan membawa agen ke pasar. Ini bukan penilaian moral, melainkan titik cabang: agen lebih cepat — transparansi lebih sedikit seputar bagaimana tepatnya persentase judul diperoleh.

Lapisan lain yang jarang disebut: Astra adalah model OpenAI pertama yang berada di level Critical pada skala keamanan siber internal. Oleh karena itu, kemampuan ofensif paling tajam dipotong untuk pengguna biasa dan disisakan untuk pembela tepercaya. Ini logis setelah Hugging Face. Tetapi ini juga berarti bahwa Astra publik dan "Astra yang mencetak 100% di ExploitBench" bukanlah produk yang sepenuhnya sama.

Apa yang bisa disimpulkan tanpa basa-basi

Pada tugas kerja, kemajuan tampak nyata. Lebih cepat menavigasi desktop, lebih sedikit halusinasi, lebih baik menjaga kerangka tugas, hampir separuh waktu di OSWorld — ini bukan pemasaran demi pemasaran. Untuk kode, otomatisasi, dan pipeline korporat panjang, Astra kemungkinan akan menjadi langkah signifikan dibandingkan Sol.

Tetapi "99,9% = AGI" adalah aritmetika yang buruk. Definisi AGI dari OpenAI sendiri pernah berbunyi seperti "sistem yang melakukan semua pekerjaan bernilai ekonomi tidak lebih buruk dari manusia". Satu benchmark interaktif dengan adaptor bawaan tidak membuktikan itu. Tidak juga membuktikan 97,6% dalam matematika, jika sebagian set secara historis dekat dengan pembuat tes. Tidak juga membuktikan hasil seri/posisi kedua pada indeks orang lain saat tertinggal di Humanity's Last Exam.

Perumusan yang jujur saat ini adalah: Astra adalah agen yang sangat kuat dengan tingkat kontrol komputer baru dan pembatasan diri yang lebih ketat dibandingkan Sol. Klaim "era AGI" sejauh ini bertumpu pada perasaan internal pimpinan OpenAI dan pada hasil yang sangat bervariasi dari satu harness ke harness lain.

Lebih baik melihat bukan pada siaran pers, tetapi pada tiga hal membosankan: apakah 62,7% dapat direproduksi pada ARC-AGI-3 netral oleh pihak luar; bagaimana model berperilaku ketika instruksi bocor, bukan ideal di laboratorium; dan seberapa besar kualitas menurun di luar lingkungan tempat OpenAI sendiri menyetel memori, kompresi konteks, dan supervisi.

Uji coba independen pertama sudah menunjukkan bahwa judul dan protokol adalah genre yang berbeda. Ini tidak membuat Astra lemah. Ini menjadikannya model besar biasa tahun 2026: mengesankan, mahal, dan masih membutuhkan angka-angka untuk diulang tidak hanya oleh mereka yang melatihnya.

56 Tampilan

Sumber-sumber

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

Baca lebih banyak artikel tentang topik ini:

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply
Apakah Anda menemukan kesalahan atau ketidakakuratan?Kami akan mempertimbangkan komentar Anda sesegera mungkin.