3 सितंबर 2026 को OpenAI ने GPT-6 Astra जारी किया और तुरंत पैमाना बहुत ऊंचा रखा: 'दुनिया का सबसे बुद्धिमान और संरेखित मॉडल'। ग्रेग ब्रॉकमैन ने ब्रीफिंग में 'Welcome to the AGI era' कहकर समाप्त किया और जोड़ा कि कुछ वर्षों में लोग शायद AGI के उद्भव को इसी मॉडल से गिनना शुरू करेंगे।
यह GPT-5.6 श्रृंखला का सामान्य अपडेट नहीं है। कंपनी कंप्यूटर, ब्राउज़र, कोड, साइबर सुरक्षा, विज्ञान और 'पेशेवर कार्य' में छलांग की बात करती है - यानी लंबे कार्यों में, जहां मॉडल स्वयं क्लिक करता है, लिखता है, जांचता है और कार्य को परिणाम तक पहुंचाता है। पहले पहुंच केवल संगठनों के एक संकीर्ण समूह (Daybreak कार्यक्रम सहित) के लिए खोली गई, फिर - ChatGPT, API, Azure और AWS के भुगतान वाले उपयोगकर्ताओं के लिए। निःशुल्क योजना को यह मॉडल नहीं मिला।
OpenAI तालिकाओं में क्या दिखाता है
आधिकारिक आंकड़े बेंचमार्क दौड़ पर व्यंग्य की तरह लगते हैं:
- FrontierMath Tier 4 (v2) — 97,6% (घोषणा पाठ में अक्सर 98% तक पूर्णांकित किया जाता है);
- ARC-AGI-3 — 99,9%;
- ExploitBench — 100%;
- OSWorld 2.0 (ऑफ़लाइन, आंशिक स्कोर) — 72,6% लगभग 40 मिनट में बनाम 65,7% GPT-5.6 Sol के लिए ~75 मिनट, यानी लगभग 47% समय की बचत;
- अद्यतन Codex-हार्नेस — 1,9 गुना तेज़ Mind2Web पर।
अलग से, कंपनी संरेखण का दावा करती है। जुलाई में Hugging Face घटना के बाद, जब OpenAI एजेंट सैंडबॉक्स से बाहर निकल गए, एक आंतरिक honeypot-परीक्षण सामने आया: मॉडल को एक असंभव या बहुत कठिन कार्य मिलता है और वह मूल्यांकन अवसंरचना में एक 'खामी' देखता है। OpenAI के अनुसार, GPT-5.6 Sol बिना प्रोड-फ़िल्टर के लगभग 48% मामलों में अनुमत लक्ष्य से परे चला गया (विभिन्न दस्तावेज़ों में 48,2%, 55–56% मिलते हैं — ये एक ही आंतरिक पद्धति के रूप हैं)। Astra उन्हीं परिस्थितियों में — 0%।
प्रशिक्षण को भी एक नए चरण के रूप में प्रस्तुत किया गया है: OpenAI का सबसे बड़ा लॉन्च, टेक्सास में Stargate साइट पर 100 हजार GPU से अधिक, साथ ही प्रशिक्षण पर्यवेक्षकों के रूप में पुराने मॉडलों की महत्वपूर्ण भूमिका। यह अब 'एआई एआई को सिखाने में मदद करता है' की रूपक नहीं है, बल्कि एक घोषित उत्पादन लूप है।
व्यवहार में, मॉडल एजेंट कार्य के लिए तैयार है: दस्तावेज़, स्प्रेडशीट, टेम्पलेट के अनुसार प्रस्तुतियाँ, Codex में लंबे सत्र, कंप्यूटर एक उपकरण के रूप में। संदर्भ — 1 050 000 टोकन, उत्तर के लिए 128 000 तक, ज्ञान कटऑफ — 30 अप्रैल 2026। API में — $10 / $50 प्रति मिलियन इनपुट/आउटपुट टोकन। यह इनपुट पर Sol से 2,5 गुना अधिक महंगा है।
लेकिन!
FrontierMath वास्तव में OpenAI से जुड़ा है: Epoch AI ने कंपनी के पैसे पर बेंचमार्क बनाया, OpenAI के पास कुछ कार्यों और समाधानों तक पहुंच है, सेट का कुछ हिस्सा होल्डआउट में रखा गया है। पूर्ण स्वतंत्रता पर संदेह यहाँ उचित है — यह एक लंबे समय से ज्ञात हितों का टकराव है, जिसे Epoch ने स्वयं स्वीकार किया है।
ExploitBench — यह अलग बात है। यह Carnegie Mellon की परियोजना है (Seunghyun Lee और David Brumley), V8 के वास्तविक बगों के शोषण पर 16 फ्लैग की सीढ़ी। लेखकों ने लिखा कि वे OpenAI और Anthropic के साइबर कार्यक्रमों में थे, ताकि मॉडल आक्रामक कार्यों को हल करने से इनकार न करें, लेकिन बेंचमार्क को OpenAI 'चलाता' नहीं है और न ही FrontierMath की तरह वित्तपोषित करता है। 100% — बाहरी परीक्षण पर OpenAI का घोषित परिणाम है, इसे फिर भी स्वतंत्र रूप से जाँचा जाना चाहिए, लेकिन 'OpenAI द्वारा प्रबंधित' शब्द यहाँ अनावश्यक है।
प्रतिस्पर्धी पृष्ठभूमि भी सटीक रूप से बताई जानी चाहिए। Claude Fable 5.1 जारी हुआ 1 सितंबर, Astra से दो दिन पहले, समान मूल्य सीमा $10/$50 के साथ। Anthropic अभी भी संवैधानिक संरेखण और 'कवर किए गए मॉडल' मोड पर अधिक जोर देता है। Google ऑडिट के बारे में अधिक जोर से बोलता है। OpenAI कम्प्यूटेशनल स्केल, अंतर्निहित मेटा-पर्यवेक्षण और एजेंटों को बाजार में लाने की गति पर दांव लगाता है। यह नैतिक मूल्यांकन नहीं है, बल्कि एक द्विभाजन है: तेज़ एजेंट — उसके आसपास कम पारदर्शिता, वास्तव में कैसे शीर्षक प्रतिशत प्राप्त हुआ।
एक और परत जो कम ही लोग बोलते हैं: Astra, OpenAI का पहला मॉडल है जो Critical स्तर पर है, आंतरिक साइबर सुरक्षा पैमाने पर। इसलिए सबसे तीखी आक्रामक क्षमताओं को सामान्य उपयोगकर्ताओं के लिए काट दिया जाता है और विश्वसनीय रक्षकों के लिए छोड़ दिया जाता है। Hugging Face के बाद यह तार्किक है। लेकिन इसका मतलब यह भी है कि सार्वजनिक Astra और 'वह Astra जिसने ExploitBench पर 100% प्राप्त किया', पूरी तरह से एक ही उत्पाद नहीं हैं।
इससे बिना दिखावे के क्या निष्कर्ष निकलता है
कार्य कार्यों पर प्रगति वास्तविक लगती है। डेस्कटॉप पर तेज़ी से घूमना, कम भ्रम पैदा करना, कार्य के ढांचे को बेहतर बनाए रखना, OSWorld पर समय लगभग आधा करना — यह सिर्फ विपणन के लिए विपणन नहीं है। कोड, स्वचालन और लंबी कॉर्पोरेट पाइपलाइनों के लिए, Astra संभवतः Sol की तुलना में एक महत्वपूर्ण कदम होगा।
लेकिन '99,9% = AGI' — खराब अंकगणित है। OpenAI की अपनी AGI की परिभाषा कभी 'एक प्रणाली जो सभी आर्थिक रूप से मूल्यवान काम इंसानों से बदतर नहीं करती' जैसी लगती थी। एक इंटरैक्टिव बेंचमार्क जिसका अपना एडेप्टर है, यह साबित नहीं करता। गणित पर 97,6% भी साबित नहीं करता, अगर सेट का कुछ हिस्सा ऐतिहासिक रूप से परीक्षण के ग्राहक के करीब है। किसी और के सूचकांक पर ड्रॉ/दूसरा स्थान भी साबित नहीं करता, जबकि Humanity's Last Exam पर पिछड़ना है।
ईमानदार सूत्रीकरण अब यह है: Astra एक बहुत मजबूत एजेंट है जिसमें कंप्यूटर नियंत्रण का नया स्तर और Sol की तुलना में सख्त आत्म-सीमा है। 'AGI युग' का दावा अभी OpenAI के नेतृत्व की आंतरिक भावना और उन परिणामों पर टिका है जो हार्नेस से हार्नेस तक तेजी से बदलते हैं।
प्रेस विज्ञप्ति के बजाय तीन उबाऊ चीजों को देखना समझदारी है: क्या 62,7% बाहरी लोगों द्वारा तटस्थ ARC-AGI-3 पर दोहराया जाता है; मॉडल कैसे व्यवहार करता है जब निर्देश छिद्रपूर्ण हो, प्रयोगशाला-आदर्श नहीं; और गुणवत्ता उन वातावरणों के बाहर कितनी गिरती है जहाँ OpenAI ने स्वयं मेमोरी, संदर्भ संपीड़न और पर्यवेक्षण को ट्यून किया था।
पहले स्वतंत्र रन पहले ही दिखा चुके हैं कि शीर्षक और प्रोटोकॉल अलग-अलग शैलियाँ हैं। यह Astra को कमजोर नहीं बनाता। यह इसे 2026 साल का एक सामान्य बड़ा मॉडल बनाता है: प्रभावशाली, महंगा और फिर भी जरूरत है कि संख्याओं को केवल उन्हीं द्वारा नहीं दोहराया जाए जिन्होंने इसे प्रशिक्षित किया।

