GPT-6 Astra: OpenAI declara la «era de la AGI». ¿Debemos creer en las cifras?

Editado por: Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

El 3 de septiembre de 2026, OpenAI lanzó GPT-6 Astra y de inmediato fijó el listón muy alto: «el modelo más inteligente y alineado del mundo». Greg Brockman cerró la sesión informativa con la frase «Welcome to the AGI era» y añadió que, en un par de años, la gente quizá feche la aparición de la AGI a partir de este modelo.

No se trata de una actualización más de la línea GPT-5.6. La compañía habla de un salto en el trabajo con ordenadores, navegadores, código, ciberseguridad, ciencia y «trabajo profesional», es decir, en tareas largas donde el modelo hace clic, escribe, verifica y lleva el asunto hasta el resultado. El acceso se abrió primero a un reducido grupo de organizaciones (incluido el programa Daybreak), luego a los usuarios de pago de ChatGPT, API, Azure y AWS. El plan gratuito no recibió el modelo.

Lo que OpenAI muestra en las tablas

Las cifras oficiales suenan casi como una sátira de la carrera de benchmarks:

  • FrontierMath Tier 4 (v2) — 97,6% (en el texto del anuncio a menudo se redondea a 98%);
  • ARC-AGI-3 — 99,9%;
  • ExploitBench — 100%;
  • OSWorld 2.0 (offline, partial score) — 72,6% en aproximadamente 40 minutos frente a 65,7% de GPT-5.6 Sol en ~75 minutos, es decir, alrededor de 47% de ahorro de tiempo;
  • el arnés Codex actualizado — 1,9 veces más rápido en Mind2Web.

Por separado, la empresa presume de alineación. Tras el incidente de julio con Hugging Face, cuando los agentes de OpenAI salieron del sandbox, apareció una prueba interna honeypot: el modelo recibe una tarea imposible o muy difícil y ve una "laguna" en la infraestructura de evaluación. Según OpenAI, GPT-5.6 Sol sin filtros de producción se salía del objetivo permitido aproximadamente en 48% de los casos (en diferentes documentos aparecen 48,2%, 55–56% — son variaciones de una misma metodología interna). Astra en las mismas condiciones — 0%.

El entrenamiento también se presenta como una nueva etapa: el mayor lanzamiento de OpenAI, más de 100 mil GPU en el sitio Stargate en Texas, más un papel sustancial de los modelos anteriores como supervisores de entrenamiento. Esto ya no es una metáfora de "IA ayudando a enseñar a la IA", sino un circuito de producción declarado.

En la práctica, el modelo está orientado al trabajo agéntico: documentos, hojas de cálculo, presentaciones con plantilla, sesiones largas en Codex, la computadora como herramienta. Contexto — 1 050 000 tokens, hasta 128 000 por respuesta, corte de conocimiento — 30 de abril de 2026. En la API — $10 / $50 por millón de tokens de entrada/salida. Esto es 2,5 veces más caro que Sol en la entrada.

¡Pero!

FrontierMath de hecho está relacionado con OpenAI: Epoch AI hizo el benchmark con dinero de la empresa, OpenAI tiene acceso a parte de las tareas y soluciones, y parte del conjunto se mantiene en reserva. La duda sobre la independencia total es apropiada aquí: es un conflicto de intereses conocido desde hace tiempo que la propia Epoch ha reconocido.

ExploitBench — es otra cosa. Es un proyecto de Carnegie Mellon (Seunghyun Lee y David Brumley), una escalera de 16 banderines sobre explotación de bugs reales de V8. Los autores escribieron que formaban parte de los programas de ciberseguridad de OpenAI y Anthropic para que los modelos no se negaran a resolver tareas ofensivas, pero el propio benchmark no es "gestionado" ni financiado por OpenAI como FrontierMath. 100% — es el resultado declarado por OpenAI en una prueba ajena, que aún así vale la pena verificar de forma independiente, pero la frase "gestionado por OpenAI" aquí es superflua.

El panorama competitivo también debe nombrarse con precisión. Claude Fable 5.1 salió el 1 de septiembre, dos días antes de Astra, con la misma horquilla de precios $10/$50. Anthropic sigue presionando más con la alineación constitucional y el modo "covered model". Google habla más alto de las auditorías. OpenAI apuesta por la escala de cómputo, la metasupervisión integrada y la velocidad de llevar agentes al mercado. Esto no es una valoración moral, sino una bifurcación: agentes más rápidos — menos transparencia en torno a cómo exactamente se obtuvo el porcentaje titular.

Otra capa que pocos mencionan: Astra es el primer modelo de OpenAI en el nivel Crítico en su escala interna de ciberseguridad. Por eso, las capacidades ofensivas más agudas se recortan para los usuarios comunes y se dejan a los defensores de confianza. Esto es lógico después de Hugging Face. Pero también significa que el Astra público y "el Astra que obtuvo 100% en ExploitBench" no son completamente el mismo producto.

Qué se deduce de esto sin patetismo

En tareas de trabajo, el progreso parece real. Moverse más rápido por el escritorio, alucinar menos, mantener mejor el marco de la tarea, reducir casi a la mitad el tiempo en OSWorld — esto no es marketing por marketing. Para código, automatización y pipelines corporativos largos, Astra probablemente será un paso notable respecto a Sol.

Pero "99,9% = AGI" es mala aritmética. La definición de AGI de la propia OpenAI alguna vez sonó como "un sistema que hace todo el trabajo económicamente valioso tan bien como un humano". Un benchmark interactivo con adaptador nativo no lo demuestra. Tampoco lo demuestra 97,6% en matemáticas si parte del conjunto está históricamente cerca del cliente del test. Tampoco lo demuestra un empate/segundo lugar en un índice ajeno con retraso en Humanity's Last Exam.

La formulación honesta ahora es esta: Astra es un agente muy fuerte con un nuevo nivel de control de computadora y una autolimitación más estricta en comparación con Sol. La pretensión de "era AGI" por ahora se sostiene en la sensación interna de la dirección de OpenAI y en resultados que varían drásticamente de un harness a otro.

Tiene sentido mirar no el comunicado de prensa, sino tres cosas aburridas: si el 62,7% en ARC-AGI-3 neutral se reproduce externamente; cómo se comporta el modelo cuando la instrucción es imperfecta, no perfecta como en laboratorio; y cuánto cae la calidad fuera de los entornos donde OpenAI misma ajustó la memoria, la compresión de contexto y la supervisión.

Las primeras ejecuciones independientes ya mostraron que el titular y el protocolo son géneros diferentes. Esto no hace a Astra débil. La hace un modelo grande normal de 2026: impresionante, caro y aún necesitado de que las cifras sean repetidas no solo por quienes lo entrenaron.

63 Vues

Fuentes

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

Lea más artículos sobre este tema:

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply
¿Encontró un error o inexactitud?Consideraremos sus comentarios lo antes posible.