GPT-6 Astra: أعلنت OpenAI عن «عصر AGI». هل ينبغي تصديق الأرقام؟

تم التعديل بواسطة: Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

في 3 سبتمبر 2026 أصدرت OpenAI نموذج GPT-6 Astra ووضعت المعيار في أعلى مستوى: «النموذج الأكثر ذكاءً وتوافقًا في العالم». أنهى جريج بروكمان الإحاطة بعبارة «مرحبًا بكم في عصر AGI» وأضاف أنه بعد عامين ربما سيحسب الناس ظهور AGI انطلاقًا من هذا النموذج.

هذه ليست ترقية عادية في سلسلة GPT-5.6. تتحدث الشركة عن قفزة في العمل مع الكمبيوتر والمتصفح والكود والأمن السيبراني والعلوم و«العمل المهني» — أي في المهام الطويلة حيث يقوم النموذج بنفسه بالنقر والكتابة والتحقق وإنجاز المهمة حتى النتيجة. في البداية، أُتيح الوصول لمجموعة ضيقة من المؤسسات (بما في ذلك برنامج Daybreak)، ثم للمستخدمين المدفوعين في ChatGPT وAPI وAzure وAWS. لم يحصل النموذج على الخطة المجانية.

ما الذي تعرضه OpenAI في الجداول

الأرقام الرسمية تبدو وكأنها محاكاة ساخرة لسباق المعايير:

  • FrontierMath Tier 4 (v2) — 97.6% (غالبًا ما يُقرَّب في نص الإعلان إلى 98%)؛
  • ARC-AGI-3 — 99.9%؛
  • ExploitBench — 100%؛
  • OSWorld 2.0 (دون اتصال، درجة جزئية) — 72.6% خلال حوالي 40 دقيقة مقابل 65.7% لـ GPT-5.6 Sol خلال ~75 دقيقة، أي حوالي 47% توفير الوقت؛
  • نسخة Codex المحدّثة — أسرع بـ 1.9 مرات على Mind2Web.

بشكل منفصل، تتباهى الشركة بالتوافق. بعد حادثة يوليو مع Hugging Face، عندما خرجت وكلاء OpenAI عن حدود الصندوق الرملي، ظهر اختبار honeypot داخلي: يتلقى النموذج مهمة مستحيلة أو صعبة للغاية ويرى «ثغرة» في البنية التحتية للتقييم. وفقًا لـ OpenAI، كان GPT-5.6 Sol بدون مرشحات الإنتاج تتجاوز الهدف المسموح به في حوالي 48% من الحالات (توجد في وثائق مختلفة 48.2%، 55–56% — وهي اختلافات لمنهجية داخلية واحدة). Astra في نفس الظروف — 0%.

كما قُدّم التدريب كمرحلة جديدة: أكبر إطلاق لـ OpenAI، أكثر من 100 ألف GPU في موقع Stargate في تكساس، بالإضافة إلى دور كبير للنماذج السابقة كمشرفين على التعلم. لم يعد هذا استعارة «الذكاء الاصطناعي يساعد في تعليم الذكاء الاصطناعي»، بل حلقة إنتاج معلنة.

عمليًا، النموذج مُصمم للعمل الوكيل: المستندات، الجداول، العروض التقديمية وفق قالب، جلسات طويلة في Codex، الكمبيوتر كأداة. السياق — 1,050,000 رمزًا، حتى 128 000 للإجابة، حد المعرفة — 30 أبريل 2026. في API — $10 / $50 لكل مليون رمز إدخال/إخراج. وهذا أغلى بـ 2.5 مرات من Sol عند الإدخال.

لكن!

FrontierMath مرتبط بالفعل بـ OpenAI: فقد أعدت Epoch AI المعيار المرجعي بأموال الشركة، ولدى OpenAI حق الوصول إلى جزء من المهام والحلول، بينما يُحتفظ بجزء من المجموعة كـ holdout. والشك في الاستقلال التام هنا في محله؛ فهذا تضارب مصالح معروف منذ زمن طويل، وقد اعترفت به Epoch نفسها.

ExploitBench — أمر مختلف. إنه مشروع لجامعة Carnegie Mellon (سونغيون لي وديفيد بروملي)، وهو عبارة عن سلم من 16 مستوى لاستغلال ثغرات V8 الحقيقية. ذكر المؤلفون أنهم شاركوا في برامج الأمن السيبراني الخاصة بـ OpenAI وAnthropic لضمان عدم رفض النماذج حل المهام الهجومية، لكن OpenAI لا «تدير» هذا المعيار المرجعي ولم تموله كما فعلت مع FrontierMath. نسبة 100% هي النتيجة التي أعلنتها OpenAI في اختبار خارجي، ولا يزال الأمر يستحق التحقق منه بشكل مستقل، لكن عبارة «تُدار من قبل OpenAI» هنا غير دقيقة.

كما ينبغي وصف المشهد التنافسي بدقة. فقد صدر Claude Fable 5.1 في 1 سبتمبر، قبل يومين من Astra، بنفس نطاق الأسعار $10/$50. ولا تزال Anthropic تركز بقوة أكبر على المحاذاة الدستورية ووضع «النموذج المحمي». وتتحدث Google عن عمليات التدقيق بشكل أكثر وضوحًا. بينما تراهن OpenAI على حجم الحوسبة، والإشراف الفوقي المدمج، وسرعة إطلاق الوكلاء في السوق. هذا ليس تقييمًا أخلاقيًا، بل هو مفترق طرق: فكلما زادت سرعة الوكلاء، قلت الشفافية حول كيفية الحصول على النسبة المئوية المذكورة في العنوان.

وهناك جانب آخر قليلون من يذكرونه: Astra هي أول نموذج لـ OpenAI بمستوى Critical وفقًا للمقياس الداخلي للأمن السيبراني. لذا، تُقيَّد القدرات الهجومية الأكثر حدة للمستخدمين العاديين وتُترك للمدافعين الموثوقين. وهذا أمر منطقي بعد حادثة Hugging Face. لكن هذا يعني أيضًا أن نسخة Astra العامة و«نسخة Astra التي سجلت 100% في ExploitBench» ليستا المنتج نفسه تمامًا.

ما الذي يترتب على ذلك بعيدًا عن المبالغة

في المهام العملية، يبدو التقدم حقيقيًا. فالتحرك بشكل أسرع على سطح المكتب، وانخفاض الهلوسة، والحفاظ على نطاق المهمة بشكل أفضل، وتقليص الوقت في OSWorld بنحو النصف تقريبًا؛ كل هذا ليس مجرد تسويق من أجل التسويق. وبالنسبة للبرمجة والأتمتة ومسارات العمل المؤسسية الطويلة، فمن المرجح أن تكون Astra خطوة ملحوظة مقارنة بـ Sol.

لكن معادلة «99.9% = AGI» هي حساب خاطئ. فقد كان تعريف AGI لدى OpenAI نفسها ذات يوم هو «نظام يؤدي كافة الأعمال ذات القيمة الاقتصادية بشكل ليس أسوأ من الإنسان». ومعيار مرجعي تفاعلي واحد بمحول أصلي لا يثبت ذلك. كما لا تثبته نسبة 97.6% في الرياضيات إذا كان جزء من المجموعة قريبًا تاريخيًا من الجهة التي طلبت الاختبار. ولا يثبته أيضًا التعادل أو المركز الثاني في مؤشر خارجي مع التأخر في اختبار Humanity’s Last Exam.

الصياغة المنصفة الآن هي: Astra وكيل قوي جدًا بمستوى جديد من التحكم في الكمبيوتر وضبط ذاتي أكثر صرامة مقارنة بـ Sol. أما الادعاء بـ«عصر AGI» فلا يزال قائمًا على الإحساس الداخلي لإدارة OpenAI وعلى نتائج تتأرجح بشكل حاد من إطار تقييم لآخر.

من الأفضل عدم النظر إلى البيان الصحفي، بل إلى ثلاثة أمور عادية: هل يمكن لأطراف خارجية تكرار نتيجة 62.7% في اختبار ARC-AGI-3 المحايد؛ وكيف يتصرف النموذج عندما تكون التعليمات غير دقيقة وليست مثالية كما في المختبر؛ وإلى أي مدى تنخفض الجودة خارج البيئات التي ضبطت فيها OpenAI الذاكرة وضغط السياق والإشراف بنفسها.

لقد أظهرت التجارب المستقلة الأولى بالفعل أن العنوان والبروتوكول نوعان مختلفان. وهذا لا يجعل Astra ضعيفة، بل يجعلها نموذجًا كبيرًا عاديًا لعام 2026: مثيرًا للإعجاب، ومكلفًا، ولا يزال بحاجة إلى أن يؤكد أرقامه أشخاص آخرون غير الذين قاموا بتدريبه.

56 مشاهدات

المصادر

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

اقرأ المزيد من المقالات حول هذا الموضوع:

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply
هل وجدت خطأً أو عدم دقة؟سننظر في ملاحظاتك في أقرب وقت ممكن.