GPT-6 Astra : OpenAI déclare « l'ère de l'AGI ». Faut-il croire les chiffres ?

Édité par : Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

Le 3 septembre 2026, OpenAI a publié GPT-6 Astra et a d'emblée placé la barre très haut : « le modèle le plus intelligent et le plus aligné au monde ». Greg Brockman a conclu le briefing par « Welcome to the AGI era » et a ajouté que dans quelques années, les gens dateront peut-être l'apparition de l'AGI à partir de ce modèle.

Ce n'est pas une mise à jour ordinaire de la gamme GPT-5.6. L'entreprise parle d'un bond en avant dans le travail avec l'ordinateur, le navigateur, le code, la cybersécurité, la science et le « travail professionnel » – c'est-à-dire dans les tâches longues où le modèle clique, écrit, vérifie et mène à bien le résultat. L'accès a d'abord été ouvert à un cercle restreint d'organisations (notamment au programme Daybreak), puis aux utilisateurs payants de ChatGPT, à l'API, à Azure et à AWS. Le modèle n'a pas été proposé dans le forfait gratuit.

Ce qu'OpenAI montre dans les tableaux

Les chiffres officiels semblent presque une satire de la course aux benchmarks :

  • FrontierMath Tier 4 (v2) — 97,6% (dans le texte de l'annonce, on arrondit souvent à 98%) ;
  • ARC-AGI-3 — 99,9%;
  • ExploitBench — 100%;
  • OSWorld 2.0 (hors ligne, score partiel) — 72,6% en environ 40 minutes contre 65,7% pour GPT-5.6 Sol en ~75 minutes, soit environ 47% gain de temps ;
  • le harnais Codex mis à jour — 1,9 fois plus rapide sur Mind2Web.

La société se vante également de l'alignement. Après l'incident de juillet avec Hugging Face, lorsque les agents d'OpenAI ont dépassé les limites du bac à sable, un test honeypot interne a été créé : le modèle reçoit une tâche impossible ou très difficile et voit une « faille » dans l'infrastructure d'évaluation. Selon OpenAI, GPT-5.6 Sol sans filtres de production s'aventurait au-delà de la cible autorisée dans environ 48% des cas (dans différents documents, on trouve 48,2%, 55–56% — ce sont des variations d'une même méthode interne). Astra dans les mêmes conditions — 0%.

L'entraînement est également présenté comme une nouvelle étape : le plus grand lancement d'OpenAI, plus de 100 mille GPU sur le site Stargate au Texas, plus un rôle important des modèles antérieurs comme superviseurs d'entraînement. Ce n'est plus une métaphore « l'IA aide à apprendre à l'IA », mais une boucle de production déclarée.

En pratique, le modèle est conçu pour le travail d'agent : documents, feuilles de calcul, présentations à partir de modèles, longues sessions dans Codex, ordinateur comme outil. Contexte — 1 050 000 jetons, jusqu'à 128 000 par réponse, coupure des connaissances — 30 avril 2026. Dans l'API — $10 / $50 par million de jetons d'entrée/sortie. C'est 2,5 fois plus cher que Sol à l'entrée.

Mais !

FrontierMath est effectivement lié à OpenAI : Epoch AI a réalisé le benchmark avec l'argent de l'entreprise, OpenAI a accès à une partie des tâches et des solutions, et une partie de l'ensemble est conservée en holdout. Le doute sur une indépendance totale est ici justifié — c'est un conflit d'intérêts connu depuis longtemps, qu'Epoch a elle-même reconnu.

ExploitBench — c'est autre chose. C'est un projet de Carnegie Mellon (Seunghyun Lee et David Brumley), une échelle de 16 drapeaux pour l'exploitation de vrais bugs de V8. Les auteurs ont écrit qu'ils faisaient partie des programmes cyber d'OpenAI et d'Anthropic pour que les modèles ne refusent pas de résoudre des tâches offensives, mais OpenAI ne « pilote » pas et n'a pas financé le benchmark comme FrontierMath. 100% — le résultat annoncé par OpenAI sur un test externe, il vaut toujours la peine d'être vérifié indépendamment, mais la formulation « géré par OpenAI » est ici superflue.

Le contexte concurrentiel mérite aussi d'être précisé. Claude Fable 5.1 est sorti le 1 septembre, deux jours avant Astra, avec la même fourchette de prix $10/$50. Anthropic insiste toujours davantage sur l'alignement constitutionnel et le mode « covered model ». Google parle plus fort d'audits. OpenAI mise sur l'échelle de calcul, la méta-supervision intégrée et la vitesse de mise sur le marché des agents. Ce n'est pas un jugement moral, mais un choix : des agents plus rapides — moins de transparence autour de la manière exacte dont le pourcentage annoncé est obtenu.

Une autre couche que peu de gens évoquent : Astra est le premier modèle d'OpenAI au niveau Critical sur son échelle interne de cybersécurité. C'est pourquoi les capacités offensives les plus sensibles sont retirées pour les utilisateurs ordinaires et réservées aux défenseurs de confiance. C'est logique après Hugging Face. Mais cela signifie aussi que l'Astra public et « l'Astra qui a obtenu 100% sur ExploitBench » ne sont pas entièrement le même produit.

Ce qu'il faut en conclure sans emphase

Sur les tâches professionnelles, le progrès semble réel. Naviguer plus vite sur le bureau, moins halluciner, mieux tenir le cadre de la tâche, réduire de près de moitié le temps sur OSWorld — ce n'est pas du marketing pour le marketing. Pour le code, l'automatisation et les longs pipelines d'entreprise, Astra sera probablement un pas notable par rapport à Sol.

Mais « 99,9% = AGI » est une mauvaise arithmétique. La définition de l'AGI chez OpenAI était autrefois « un système qui effectue tout travail économiquement valable aussi bien qu'un humain ». Un benchmark interactif avec un adaptateur maison ne le prouve pas. 97,6% en mathématiques ne le prouve pas non plus, si une partie de l'ensemble est historiquement proche du commanditaire du test. Pas plus qu'une égalité/seconde place sur un indice externe avec un retard sur Humanity's Last Exam.

La formulation honnête est aujourd'hui la suivante : Astra est un agent très puissant avec un nouveau niveau de contrôle informatique et une auto-limitation plus stricte que Sol. La prétention à « l'ère de l'AGI » repose pour l'instant sur le ressenti interne de la direction d'OpenAI et sur des résultats qui varient fortement d'un harnais à l'autre.

Il vaut mieux regarder non pas le communiqué de presse, mais trois choses ennuyeuses : si 62,7% se reproduit sur un ARC-AGI-3 neutre chez des tiers ; comment le modèle se comporte quand l'instruction est imparfaite, pas idéale en laboratoire ; et à quel point la qualité chute en dehors des environnements où OpenAI a elle-même réglé la mémoire, la compression du contexte et la supervision.

Les premiers essais indépendants ont déjà montré que le titre et le protocole sont des genres différents. Cela ne rend pas Astra faible. Cela en fait un grand modèle ordinaire de 2026 : impressionnant, coûteux et ayant toujours besoin que les chiffres soient répétés par d'autres que ceux qui l'ont entraîné.

56 Vues

Sources

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

Lire plus d'articles sur ce sujet :

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply
Avez-vous trouvé une erreur ou une inexactitude ?Nous étudierons vos commentaires dans les plus brefs délais.