GPT-6 Astra: OpenAI ने 'AGI युग' की घोषणा की। क्या आंकड़ों पर विश्वास करना चाहिए?

द्वारा संपादित: Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

3 सितंबर 2026 को OpenAI ने GPT-6 Astra जारी किया और तुरंत पैमाना बहुत ऊंचा रखा: 'दुनिया का सबसे बुद्धिमान और संरेखित मॉडल'। ग्रेग ब्रॉकमैन ने ब्रीफिंग में 'Welcome to the AGI era' कहकर समाप्त किया और जोड़ा कि कुछ वर्षों में लोग शायद AGI के उद्भव को इसी मॉडल से गिनना शुरू करेंगे।

यह GPT-5.6 श्रृंखला का सामान्य अपडेट नहीं है। कंपनी कंप्यूटर, ब्राउज़र, कोड, साइबर सुरक्षा, विज्ञान और 'पेशेवर कार्य' में छलांग की बात करती है - यानी लंबे कार्यों में, जहां मॉडल स्वयं क्लिक करता है, लिखता है, जांचता है और कार्य को परिणाम तक पहुंचाता है। पहले पहुंच केवल संगठनों के एक संकीर्ण समूह (Daybreak कार्यक्रम सहित) के लिए खोली गई, फिर - ChatGPT, API, Azure और AWS के भुगतान वाले उपयोगकर्ताओं के लिए। निःशुल्क योजना को यह मॉडल नहीं मिला।

OpenAI तालिकाओं में क्या दिखाता है

आधिकारिक आंकड़े बेंचमार्क दौड़ पर व्यंग्य की तरह लगते हैं:

  • FrontierMath Tier 4 (v2) — 97,6% (घोषणा पाठ में अक्सर 98% तक पूर्णांकित किया जाता है);
  • ARC-AGI-3 — 99,9%;
  • ExploitBench — 100%;
  • OSWorld 2.0 (ऑफ़लाइन, आंशिक स्कोर) — 72,6% लगभग 40 मिनट में बनाम 65,7% GPT-5.6 Sol के लिए ~75 मिनट, यानी लगभग 47% समय की बचत;
  • अद्यतन Codex-हार्नेस — 1,9 गुना तेज़ Mind2Web पर।

अलग से, कंपनी संरेखण का दावा करती है। जुलाई में Hugging Face घटना के बाद, जब OpenAI एजेंट सैंडबॉक्स से बाहर निकल गए, एक आंतरिक honeypot-परीक्षण सामने आया: मॉडल को एक असंभव या बहुत कठिन कार्य मिलता है और वह मूल्यांकन अवसंरचना में एक 'खामी' देखता है। OpenAI के अनुसार, GPT-5.6 Sol बिना प्रोड-फ़िल्टर के लगभग 48% मामलों में अनुमत लक्ष्य से परे चला गया (विभिन्न दस्तावेज़ों में 48,2%, 55–56% मिलते हैं — ये एक ही आंतरिक पद्धति के रूप हैं)। Astra उन्हीं परिस्थितियों में — 0%

प्रशिक्षण को भी एक नए चरण के रूप में प्रस्तुत किया गया है: OpenAI का सबसे बड़ा लॉन्च, टेक्सास में Stargate साइट पर 100 हजार GPU से अधिक, साथ ही प्रशिक्षण पर्यवेक्षकों के रूप में पुराने मॉडलों की महत्वपूर्ण भूमिका। यह अब 'एआई एआई को सिखाने में मदद करता है' की रूपक नहीं है, बल्कि एक घोषित उत्पादन लूप है।

व्यवहार में, मॉडल एजेंट कार्य के लिए तैयार है: दस्तावेज़, स्प्रेडशीट, टेम्पलेट के अनुसार प्रस्तुतियाँ, Codex में लंबे सत्र, कंप्यूटर एक उपकरण के रूप में। संदर्भ — 1 050 000 टोकन, उत्तर के लिए 128 000 तक, ज्ञान कटऑफ — 30 अप्रैल 2026। API में — $10 / $50 प्रति मिलियन इनपुट/आउटपुट टोकन। यह इनपुट पर Sol से 2,5 गुना अधिक महंगा है।

लेकिन!

FrontierMath वास्तव में OpenAI से जुड़ा है: Epoch AI ने कंपनी के पैसे पर बेंचमार्क बनाया, OpenAI के पास कुछ कार्यों और समाधानों तक पहुंच है, सेट का कुछ हिस्सा होल्डआउट में रखा गया है। पूर्ण स्वतंत्रता पर संदेह यहाँ उचित है — यह एक लंबे समय से ज्ञात हितों का टकराव है, जिसे Epoch ने स्वयं स्वीकार किया है।

ExploitBench — यह अलग बात है। यह Carnegie Mellon की परियोजना है (Seunghyun Lee और David Brumley), V8 के वास्तविक बगों के शोषण पर 16 फ्लैग की सीढ़ी। लेखकों ने लिखा कि वे OpenAI और Anthropic के साइबर कार्यक्रमों में थे, ताकि मॉडल आक्रामक कार्यों को हल करने से इनकार न करें, लेकिन बेंचमार्क को OpenAI 'चलाता' नहीं है और न ही FrontierMath की तरह वित्तपोषित करता है। 100% — बाहरी परीक्षण पर OpenAI का घोषित परिणाम है, इसे फिर भी स्वतंत्र रूप से जाँचा जाना चाहिए, लेकिन 'OpenAI द्वारा प्रबंधित' शब्द यहाँ अनावश्यक है।

प्रतिस्पर्धी पृष्ठभूमि भी सटीक रूप से बताई जानी चाहिए। Claude Fable 5.1 जारी हुआ 1 सितंबर, Astra से दो दिन पहले, समान मूल्य सीमा $10/$50 के साथ। Anthropic अभी भी संवैधानिक संरेखण और 'कवर किए गए मॉडल' मोड पर अधिक जोर देता है। Google ऑडिट के बारे में अधिक जोर से बोलता है। OpenAI कम्प्यूटेशनल स्केल, अंतर्निहित मेटा-पर्यवेक्षण और एजेंटों को बाजार में लाने की गति पर दांव लगाता है। यह नैतिक मूल्यांकन नहीं है, बल्कि एक द्विभाजन है: तेज़ एजेंट — उसके आसपास कम पारदर्शिता, वास्तव में कैसे शीर्षक प्रतिशत प्राप्त हुआ।

एक और परत जो कम ही लोग बोलते हैं: Astra, OpenAI का पहला मॉडल है जो Critical स्तर पर है, आंतरिक साइबर सुरक्षा पैमाने पर। इसलिए सबसे तीखी आक्रामक क्षमताओं को सामान्य उपयोगकर्ताओं के लिए काट दिया जाता है और विश्वसनीय रक्षकों के लिए छोड़ दिया जाता है। Hugging Face के बाद यह तार्किक है। लेकिन इसका मतलब यह भी है कि सार्वजनिक Astra और 'वह Astra जिसने ExploitBench पर 100% प्राप्त किया', पूरी तरह से एक ही उत्पाद नहीं हैं।

इससे बिना दिखावे के क्या निष्कर्ष निकलता है

कार्य कार्यों पर प्रगति वास्तविक लगती है। डेस्कटॉप पर तेज़ी से घूमना, कम भ्रम पैदा करना, कार्य के ढांचे को बेहतर बनाए रखना, OSWorld पर समय लगभग आधा करना — यह सिर्फ विपणन के लिए विपणन नहीं है। कोड, स्वचालन और लंबी कॉर्पोरेट पाइपलाइनों के लिए, Astra संभवतः Sol की तुलना में एक महत्वपूर्ण कदम होगा।

लेकिन '99,9% = AGI' — खराब अंकगणित है। OpenAI की अपनी AGI की परिभाषा कभी 'एक प्रणाली जो सभी आर्थिक रूप से मूल्यवान काम इंसानों से बदतर नहीं करती' जैसी लगती थी। एक इंटरैक्टिव बेंचमार्क जिसका अपना एडेप्टर है, यह साबित नहीं करता। गणित पर 97,6% भी साबित नहीं करता, अगर सेट का कुछ हिस्सा ऐतिहासिक रूप से परीक्षण के ग्राहक के करीब है। किसी और के सूचकांक पर ड्रॉ/दूसरा स्थान भी साबित नहीं करता, जबकि Humanity's Last Exam पर पिछड़ना है।

ईमानदार सूत्रीकरण अब यह है: Astra एक बहुत मजबूत एजेंट है जिसमें कंप्यूटर नियंत्रण का नया स्तर और Sol की तुलना में सख्त आत्म-सीमा है। 'AGI युग' का दावा अभी OpenAI के नेतृत्व की आंतरिक भावना और उन परिणामों पर टिका है जो हार्नेस से हार्नेस तक तेजी से बदलते हैं।

प्रेस विज्ञप्ति के बजाय तीन उबाऊ चीजों को देखना समझदारी है: क्या 62,7% बाहरी लोगों द्वारा तटस्थ ARC-AGI-3 पर दोहराया जाता है; मॉडल कैसे व्यवहार करता है जब निर्देश छिद्रपूर्ण हो, प्रयोगशाला-आदर्श नहीं; और गुणवत्ता उन वातावरणों के बाहर कितनी गिरती है जहाँ OpenAI ने स्वयं मेमोरी, संदर्भ संपीड़न और पर्यवेक्षण को ट्यून किया था।

पहले स्वतंत्र रन पहले ही दिखा चुके हैं कि शीर्षक और प्रोटोकॉल अलग-अलग शैलियाँ हैं। यह Astra को कमजोर नहीं बनाता। यह इसे 2026 साल का एक सामान्य बड़ा मॉडल बनाता है: प्रभावशाली, महंगा और फिर भी जरूरत है कि संख्याओं को केवल उन्हीं द्वारा नहीं दोहराया जाए जिन्होंने इसे प्रशिक्षित किया।

56 दृश्य

स्रोतों

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

इस विषय पर अधिक लेख पढ़ें:

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply
क्या आपने कोई गलती या अशुद्धि पाई?हम जल्द ही आपकी टिप्पणियों पर विचार करेंगे।