GPT-6 Astra: OpenAI הכריזה על "עידן ה-AGI". האם כדאי להאמין למספרים?

נערך על ידי: Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

ב-3 בספטמבר 2026 OpenAI שחררה את GPT-6 Astra ומיד הציבה את הרף גבוה ביותר: "המודל החכם והמיושר ביותר בעולם". גרג ברוקמן בסיכום הבריף סיים במשפט "Welcome to the AGI era" והוסיף שבעוד כמה שנים אנשים אולי יספרו את הופעת ה-AGI מהמודל הזה.

זה לא עדכון שגרתי של סדרת GPT-5.6. החברה מדברת על קפיצה בעבודה עם מחשב, דפדפן, קוד, אבטחת סייבר, מדע ו"עבודה מקצועית" – כלומר במשימות ארוכות שבהן המודל בעצמו לוחץ, כותב, בודק ומביא את התוצאה לסוף. הגישה נפתחה תחילה למעגל מצומצם של ארגונים (כולל תוכנית Daybreak), ולאחר מכן למשתמשים בתשלום של ChatGPT, API, Azure ו-AWS. התוכנית החינמית לא קיבלה את המודל.

מה OpenAI מציגה בטבלאות

המספרים הרשמיים נשמעים כמעט כמו סאטירה על מרוץ הביצועים:

  • FrontierMath Tier 4 (v2) — 97.6% (בטקסט ההכרזה לעתים קרובות מעגלים ל-98%);
  • ARC-AGI-3 — 99.9%;
  • ExploitBench — 100%;
  • OSWorld 2.0 (offline, partial score) — 72.6% בערך תוך 40 דקות לעומת 65.7% אצל GPT-5.6 Sol תוך כ-75 דקות, כלומר בערך 47% חיסכון בזמן;
  • ערכת Codex מעודכנת — פי 1.9 מהר יותר ב-Mind2Web.

בנפרד, החברה מתגאה ביישור. לאחר תקרית יולי עם Hugging Face, כאשר סוכני OpenAI חרגו מהארגז החול, הופיע מבחן honeypot פנימי: המודל מקבל משימה בלתי אפשרית או קשה מאוד ורואה "פרצה" בתשתית ההערכה. לפי OpenAI, GPT-5.6 Sol ללא מסנני prod ניסתה לחרוג מהיעד המותר בכ- 48% מהמקרים (במסמכים שונים מופיעים 48.2%, 55–56% — אלה וריאציות של מתודולוגיה פנימית אחת). Astra באותם תנאים — 0%.

האימון מוצג גם כשלב חדש: ההשקה הגדולה ביותר של OpenAI, יותר מ- 100 אלף GPU באתר Stargate בטקסס, בתוספת תפקיד משמעותי של מודלים מוקדמים יותר כמפקחי אימון. זה כבר לא מטפורה של "AI עוזר ללמד AI", אלא מעגל ייצור מוצהר.

בפועל, המודל מכוון לעבודה סוכנת: מסמכים, גיליונות אלקטרוניים, מצגות לפי תבנית, סשנים ארוכים ב-Codex, מחשב ככלי. הקשר — 1,050,000 טוקנים, עד 128 000 לתשובה, חיתוך ידע — 30 באפריל 2026. ב-API — $10 / $50 למיליון טוקני קלט/פלט. זה פי 2.5 יותר יקר מ-Sol בקלט.

אבל!

FrontierMath אכן קשור ל-OpenAI: Epoch AI יצרה את הבנצ'מרק בכספי החברה, ל-OpenAI יש גישה לחלק מהמשימות והפתרונות, וחלק מהסט שמור ב-holdout. הספק לגבי עצמאות מלאה כאן מוצדק — זהו ניגוד עניינים ידוע מזה זמן, ש-Epoch עצמה הכירה בו.

ExploitBench — זה סיפור אחר. זה פרויקט של Carnegie Mellon (סונגיון לי ודייוויד ברומלי), סולם של 16 דגלים לניצול באגים אמיתיים ב-V8. הכותבים כתבו שהם היו חלק מתוכניות הסייבר של OpenAI ו-Anthropic, כדי שמודלים לא יסרבו לפתור משימות התקפיות, אבל את הבנצ'מרק עצמו OpenAI לא "מובילה" ולא מימנה כמו FrontierMath. 100% — התוצאה ש-OpenAI הצהירה על מבחן זר, ובכל זאת כדאי לבדוק אותה באופן בלתי תלוי, אבל הניסוח "מנוהל על ידי OpenAI" כאן מיותר.

גם את הרקע התחרותי כדאי לציין במדויק. Claude Fable 5.1 יצא ב-1 בספטמבר, יומיים לפני Astra, עם אותה וילת מחירים $10/$50. Anthropic עדיין לוחצת חזק יותר על יישור חוקתי ומצב "covered model". Google מדברת על ביקורות בקול רם יותר. OpenAI מהמרת על קנה המידה של חישוב, פיקוח-על מובנה ומהירות הבאת סוכנים לשוק. זו לא הערכה מוסרית, אלא נקודת פיצול: סוכנים מהירים יותר — פחות שקיפות סביב איך בדיוק הושג האחוז שבכותרת.

עוד שכבה שמעטים מדברים עליה: Astra היא המודל הראשון של OpenAI ברמת Critical בסולם הפנימי של אבטחת סייבר. לכן היכולות ההתקפיות החריפות ביותר נחתכות למשתמשים רגילים ונשמרות למגנים מהימנים. זה הגיוני אחרי Hugging Face. אבל זה גם אומר שהציבורית Astra ו"ה-Astra ההיא שהשיגה 100% ב-ExploitBench" — אינן בדיוק אותו מוצר.

מה נובע מכך בלי פאתוס

במשימות עבודה, ההתקדמות נראית אמיתית. מהירות גבוהה יותר בניווט בשולחן העבודה, פחות הזיות, שמירה טובה יותר על מסגרת המשימה, כמעט חצי זמן ב-OSWorld — זה לא שיווק לשם שיווק. עבור קוד, אוטומציה ופייפליינים ארגוניים ארוכים, Astra ככל הנראה תהיה צעד משמעותי יחסית ל-Sol.

אבל "99.9% = AGI" הוא חשבון גרוע. ההגדרה של AGI אצל OpenAI עצמה נשמעה פעם כ"מערכת שעושה את כל העבודה בעלת הערך הכלכלי לא פחות טוב מאדם". בנצ'מרק אינטראקטיבי אחד עם מתאם ביתי לא מוכיח זאת. גם 97.6% במתמטיקה לא מוכיחים, אם חלק מהסט היסטורית קרוב למזמין המבחן. גם תיקו/מקום שני במדד זר לא מוכיח, כשבמבחן Humanity's Last Exam יש פיגור.

הניסוח הכנה כרגע הוא כזה: Astra היא סוכן חזק מאוד עם רמה חדשה של שליטה במחשב והגבלה עצמית מחמירה יותר בהשוואה ל-Sol. הטענה ל"עידן AGI" עדיין נשענת על תחושה פנימית של הנהלת OpenAI ועל תוצאות שמזנקות בחדות מהרנס להרנס.

כדאי להסתכל לא על ההודעה לעיתונות, אלא על שלושה דברים משעממים: האם 62.7% על ARC-AGI-3 נייטרלי משתחזרים אצל גורמים חיצוניים; איך המודל מתנהג כשההוראה דולפת, ולא אידיאלית-מעבדתית; ועד כמה האיכות יורדת מחוץ לסביבות שבהן OpenAI עצמה כיוונה את הזיכרון, דחיסת הקשר והפיקוח.

הרצות בלתי תלויות ראשונות כבר הראו שהכותרת והפרוטוקול הם ז'אנרים שונים. זה לא עושה את Astra לחלשה. זה עושה אותה למודל גדול רגיל של 2026: מרשים, יקר, ועדיין זקוק לכך שהמספרים יחזרו על עצמם לא רק אצל אלה שאימנו אותה.

56 צפיות

מקורות

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

קראו כתבות נוספות בנושא זה:

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply
מצאתם טעות או אי-דיוק?הערותיכם ייבחנו בהקדם האפשרי.