GPT-6 Astra: OpenAI "AGI çağını" ilan etti. Rakamlara inanmalı mı?

Düzenleyen: Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

3 Eylül 2026'de OpenAI, GPT-6 Astra'yı yayınladı ve çıtayı hemen en yükseğe koydu: "dünyanın en zeki ve en uyumlu modeli". Greg Brockman bir brifingde "Welcome to the AGI era" sözleriyle konuşmasını bitirdi ve birkaç yıl içinde insanların AGI'nin ortaya çıkışını bu modelden itibaren saymaya başlayabileceğini ekledi.

Bu, GPT-5.6 serisinin sıradan bir güncellemesi değil. Şirket; bilgisayar, tarayıcı, kod, siber güvenlik, bilim ve "profesyonel iş" ile çalışmada bir sıçramadan bahsediyor - yani modelin kendisinin tıkladığı, yazdığı, kontrol ettiği ve işi sonuca ulaştırdığı uzun görevlerde. Erişim önce dar bir kuruluş çevresine (Daybreak programı dahil) açıldı, ardından ChatGPT'nin ücretli kullanıcılarına, API, Azure ve AWS'ye açıldı. Ücretsiz tarife modele sahip olmadı.

OpenAI tablolarda ne gösteriyor

Resmi rakamlar neredeyse kıyaslama yarışının bir hicvi gibi geliyor:

  • FrontierMath Tier 4 (v2) — 97,6% (duyuru metninde genellikle 98%'ye yuvarlanır);
  • ARC-AGI-3 — 99,9%;
  • ExploitBench — 100%;
  • OSWorld 2.0 (çevrimdışı, kısmi puan) — 72,6% yaklaşık 40 dakikada, buna karşılık 65,7% GPT-5.6 Sol'da ~75 dakikada, yani yaklaşık 47% zaman tasarrufu;
  • güncellenmiş Codex-harness — 1,9 kat daha hızlı Mind2Web üzerinde.

Şirket ayrıca hizalama konusunda da övünüyor. Temmuz ayındaki Hugging Face olayından sonra, OpenAI ajanlarının sandbox sınırlarının dışına çıktığı dönemde, dahili bir honeypot testi geliştirildi: model imkansız veya çok zor bir görev alıyor ve değerlendirme altyapısında bir 'açık' görüyor. OpenAI'a göre, prod-filtreleri olmayan GPT-5.6 Sol, izin verilen hedefin dışına vakaların yaklaşık 48% oranında çıkıyordu (farklı belgelerde 48,2%, 55–56% oranlarına rastlanıyor — bunlar tek bir dahili metodolojinin varyasyonlarıdır). Aynı koşullarda Astra — 0%.

Eğitim süreci de yeni bir aşama olarak sunuluyor: OpenAI'ın en büyük lansmanı, 100 bin GPU'dan fazla Teksas'taki Stargate tesisinde, ayrıca eğitim denetçileri olarak önceki modellerin önemli bir rolü var. Bu artık 'Yapay zeka, yapay zekayı eğitmeye yardımcı oluyor' metaforu değil, beyan edilen bir üretim döngüsüdür.

Pratikte model, ajan tabanlı çalışma için optimize edilmiştir: belgeler, tablolar, şablon üzerinden sunumlar, Codex'te uzun oturumlar, bir araç olarak bilgisayar. Bağlam penceresi — 1 050 000 token, yanıtta 128 000 tokena kadar, bilgi kesilme tarihi — 30 Nisan 2026. API'de — $10 / $50 milyon giriş/çıkış tokenı başına. Bu, girişte Sol'dan 2,5 kat daha pahalı.

Ama!

FrontierMath gerçekten OpenAI ile bağlantılı: Epoch AI, benchmark'ı şirketin parasıyla yaptı, OpenAI'ın görevlerin ve çözümlerin bir kısmına erişimi var, setin bir kısmı holdout'ta tutuluyor. Tam bağımsızlık konusunda şüphe burada yerinde — bu, Epoch'un kendisinin de kabul ettiği uzun zamandır bilinen bir çıkar çatışması.

ExploitBench — başka bir konu. Bu, Carnegie Mellon projesi (Seunghyun Lee ve David Brumley), V8'in gerçek hatalarını sömürmek için 16 bayraktan oluşan bir merdiven. Yazarlar, modellerin saldırgan görevleri çözmeyi reddetmemesi için OpenAI ve Anthropic'in siber programlarında yer aldıklarını yazdılar, ancak benchmark'ın kendisini OpenAI FrontierMath gibi 'yönetmiyor' ve finanse etmedi. 100% — OpenAI'ın yabancı bir testte açıkladığı sonuç, yine de bağımsız olarak doğrulanmayı hak ediyor, ancak 'OpenAI tarafından yönetiliyor' ifadesi burada gereksiz.

Rekabet ortamını da doğru adlandırmak gerek. Claude Fable 5.1 çıktı 1 Eylül, Astra'dan iki gün önce, aynı $10/$50 fiyat aralığıyla. Anthropic hâlâ anayasal hizalamaya ve 'covered model' moduna daha güçlü vurgu yapıyor. Google denetimlerden daha yüksek sesle bahsediyor. OpenAI ise hesaplama ölçeğine, yerleşik meta-gözetim ve ajanların pazara çıkış hızına oynuyor. Bu ahlaki bir değerlendirme değil, bir yol ayrımı: daha hızlı ajanlar — etrafında daha az şeffaflık, tam olarak nasıl başlık yüzdesinin elde edildiği.

Çok az kişinin dile getirdiği bir katman daha: Astra, OpenAI'ın iç siber güvenlik ölçeğinde Critical seviyesindeki ilk modeli. Bu nedenle en keskin saldırgan yetenekler sıradan kullanıcılar için kısıtlanıyor ve güvenilir savunuculara bırakılıyor. Bu, Hugging Face'ten sonra mantıklı. Ancak bu aynı zamanda halka açık Astra ile 'ExploitBench'te 100% alan Astra'nın tamamen aynı ürün olmadığı anlamına geliyor.

Bundan abartısız ne çıkar

Gerçek iş görevlerinde ilerleme gerçek görünüyor. Masaüstünde daha hızlı gezinmek, daha az halüsinasyon görmek, görev çerçevesini daha iyi korumak, OSWorld'de neredeyse yarı yarıya zaman kazanmak — bu pazarlama için pazarlama değil. Kod, otomasyon ve uzun kurumsal boru hatları için Astra, büyük olasılıkla Sol'a kıyasla kayda değer bir adım olacak.

Ancak '99,9% = AGI' kötü bir aritmetik. OpenAI'ın kendi AGI tanımı bir zamanlar 'insandan daha kötü olmayan tüm ekonomik değerli işleri yapan sistem' gibiydi. Yerel bağdaştırıcıya sahip tek bir etkileşimli kıyaslama bunu kanıtlamaz. Test setinin bir kısmı tarihsel olarak testin sipariş verenine yakınsa, matematikteki 97,6% da kanıtlamaz. Humanity's Last Exam'de geride kalırken yabancı bir endekste beraberlik/ikincilik de kanıtlamaz.

Şu anki dürüst ifade şu: Astra, yeni bir bilgisayar kontrol seviyesine ve Sol'a kıyasla daha sıkı öz kısıtlamalara sahip çok güçlü bir ajan. 'AGI çağı' iddiası şimdilik OpenAI yönetiminin içsel hissine ve koşumdan koşuma keskin biçimde değişen sonuçlara dayanıyor.

Basın bültenine değil, üç sıkıcı şeye bakmak mantıklı: 62,7% dışarıdan gelenler tarafından tarafsız ARC-AGI-3 üzerinde tekrarlanabilir mi; model, talimat laboratuvar mükemmelliğinde değil de sızıntılı olduğunda nasıl davranıyor; ve OpenAI'ın belleği, bağlam sıkıştırmayı ve denetimi kendisinin ayarladığı ortamların dışında kalite ne kadar düşüyor.

İlk bağımsız çalıştırmalar zaten başlık ve protokolün farklı türler olduğunu gösterdi. Bu Astra'yı zayıf yapmaz. Bu onu 2026 yılının sıradan büyük modeli yapar: etkileyici, pahalı ve hâlâ rakamların yalnızca onu eğitenler tarafından değil, başkaları tarafından da tekrarlanmasına ihtiyaç duyan.

63 Görüntülenme

Kaynaklar

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

Bu konuyla ilgili daha fazla makale okuyun:

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply
Bir hata veya yanlışlık buldunuz mu?Yorumlarınızı en kısa sürede değerlendireceğiz.