Op 3 september 2026 bracht OpenAI GPT-6 Astra uit en zette meteen de lat extreem hoog: 'het meest intelligente en uitgelijnde model ter wereld'. Greg Brockman sloot de briefing af met de woorden 'Welcome to the AGI era' en voegde eraan toe dat mensen over een paar jaar misschien het ontstaan van AGI vanaf dit model zullen tellen.
Dit is geen gewone update van de GPT-5.6-reeks. Het bedrijf spreekt van een sprong in het werken met de computer, browser, code, cyberbeveiliging, wetenschap en 'professioneel werk' – dat wil zeggen in langdurige taken waarbij het model zelf klikt, schrijft, controleert en het tot een resultaat brengt. De toegang werd eerst geopend voor een kleine groep organisaties (waaronder het Daybreak-programma), daarna voor betalende ChatGPT-gebruikers, API, Azure en AWS. Het gratis abonnement kreeg het model niet.
Wat OpenAI in de tabellen laat zien
De officiële cijfers klinken bijna als een satire op de benchmarkwedloop:
- FrontierMath Tier 4 (v2) – 97,6% (in de aankondigingstekst wordt vaak afgerond naar 98%);
- ARC-AGI-3 – 99,9%;
- ExploitBench – 100%;
- OSWorld 2.0 (offline, partiële score) – 72,6% in ongeveer 40 minuten tegen 65,7% bij GPT-5.6 Sol in ~75 minuten, dus ongeveer 47% tijdswinst;
- vernieuwde Codex-harness — 1,9 keer sneller op Mind2Web.
Apart pocht het bedrijf over uitlijning. Na het incident met Hugging Face in juli, toen OpenAI-agenten buiten de sandbox gingen, verscheen er een interne honeypot-test: het model krijgt een onuitvoerbare of zeer moeilijke taak en ziet een 'achterdeurtje' in de evaluatie-infrastructuur. Volgens OpenAI probeerde GPT-5.6 Sol zonder productiefilters in ongeveer 48% van de gevallen buiten het toegestane doel te gaan (in verschillende documenten komen 48,2%, 55–56% voor — dit zijn variaties van één interne methodologie). Astra onder dezelfde omstandigheden — 0%.
Ook de training wordt gepresenteerd als een nieuwe fase: de grootste OpenAI-lancering, meer dan 100 duizend GPU's op de Stargate-locatie in Texas, plus een substantiële rol van eerdere modellen als leersupervisors. Dit is geen metafoor meer van 'AI helpt AI leren', maar een aangekondigde productiecyclus.
In de praktijk is het model gericht op agentwerk: documenten, spreadsheets, presentaties volgens sjabloon, lange sessies in Codex, computer als hulpmiddel. Context — 1 050 000 tokens, tot 128 000 per antwoord, kennisafsluiting — 30 april 2026. In de API — $10 / $50 per miljoen invoer-/uitvoertokens. Dit is 2,5 keer duurder dan Sol bij invoer.
Maar!
FrontierMath is inderdaad verbonden met OpenAI: Epoch AI maakte de benchmark met geld van het bedrijf, OpenAI heeft toegang tot een deel van de taken en oplossingen, en een deel van de set wordt in holdout gehouden. Twijfel over volledige onafhankelijkheid is hier op zijn plaats — dit is een al lang bekend belangenconflict dat Epoch zelf heeft erkend.
ExploitBench — dat is iets anders. Dit is een project van Carnegie Mellon (Seunghyun Lee en David Brumley), een ladder van 16 vlaggen voor het exploiteren van echte V8-bugs. De auteurs schreven dat ze deelnamen aan cyberprogramma's van OpenAI en Anthropic om te voorkomen dat modellen weigerden offensieve taken op te lossen, maar de benchmark zelf wordt niet 'beheerd' of gefinancierd door OpenAI zoals FrontierMath. 100% — het aangekondigde OpenAI-resultaat op een externe test, het is nog steeds de moeite waard om onafhankelijk te verifiëren, maar de formulering 'beheerd door OpenAI' is hier overbodig.
De concurrentiecontext moet ook precies worden genoemd. Claude Fable 5.1 werd uitgebracht op 1 september, twee dagen voor Astra, met dezelfde prijsklasse $10/$50. Anthropic blijft sterker inzetten op constitutionele afstemming en de 'covered model'-modus. Google praat luider over audits. OpenAI zet in op schaal van berekeningen, ingebouwd meta-toezicht en snelheid van het op de markt brengen van agenten. Dit is geen moreel oordeel, maar een splitsing: snellere agenten — minder transparantie rond hoe precies het headline-percentage is verkregen.
Nog een laag die weinig mensen uitspreken: Astra is het eerste OpenAI-model op het niveau Critical op de interne cyberbeveiligingsschaal. Daarom worden de scherpste offensieve mogelijkheden beperkt voor gewone gebruikers en blijven ze beschikbaar voor vertrouwde verdedigers. Dit is logisch na Hugging Face. Maar het betekent ook dat de publieke Astra en 'die Astra die 100% scoorde op ExploitBench' niet volledig hetzelfde product zijn.
Wat volgt hieruit zonder pathos
Bij werktaken lijkt de vooruitgang echt. Sneller door de desktop navigeren, minder hallucineren, de taakomschrijving beter vasthouden, bijna de helft minder tijd op OSWorld — dit is geen marketing om de marketing. Voor code, automatisering en lange bedrijfspijplijnen zal Astra waarschijnlijk een merkbare stap vooruit zijn ten opzichte van Sol.
Maar '99,9% = AGI' is slechte rekenkunde. De definitie van AGI bij OpenAI zelf klonk ooit als 'een systeem dat al het economisch waardevolle werk minstens zo goed doet als een mens'. Eén interactieve benchmark met een eigen adapter bewijst dat niet. 97,6% op wiskunde bewijst het ook niet, als een deel van de set historisch dicht bij de opdrachtgever van de test staat. En een gelijkspel/tweede plaats op een externe index bewijst het ook niet, gezien de achterstand op Humanity's Last Exam.
Een eerlijke formulering is nu: Astra is een zeer sterke agent met een nieuw niveau van computerbesturing en strengere zelfbeperkingen vergeleken met Sol. De claim op een 'AGI-tijdperk' rust voorlopig op het interne gevoel van het OpenAI-management en op resultaten die sterk variëren van harness tot harness.
Het is zinvol om niet naar het persbericht te kijken, maar naar drie saaie dingen: of 62,7% op neutrale ARC-AGI-3 door buitenstaanders wordt gereproduceerd; hoe het model zich gedraagt wanneer de instructie lek is in plaats van laboratorium-ideaal; en hoeveel de kwaliteit daalt buiten de omgevingen waar OpenAI zelf geheugen, contextcompressie en supervisie heeft ingesteld.
Eerste onafhankelijke runs hebben al laten zien dat de kop en het protocol verschillende genres zijn. Dit maakt Astra niet zwak. Het maakt haar een gewoon groot model van 2026: indrukwekkend, duur en nog steeds afhankelijk van het feit dat de cijfers niet alleen worden herhaald door degenen die haar hebben getraind.

