GPT-6 Astra: OpenAI anuncia a "era AGI". Devemos acreditar nos números?

Editado por: Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

Em 3 de setembro de 2026, a OpenAI lançou o GPT-6 Astra e imediatamente estabeleceu o padrão no nível mais alto: "o modelo mais inteligente e alinhado do mundo". Greg Brockman encerrou o briefing com a frase "Welcome to the AGI era" e acrescentou que, em alguns anos, as pessoas talvez contem o surgimento da AGI a partir deste modelo.

Não é uma atualização comum da linha GPT-5.6. A empresa fala em um salto no trabalho com computador, navegador, código, segurança cibernética, ciência e "trabalho profissional" — ou seja, em tarefas longas em que o modelo clica, escreve, verifica e leva o trabalho até o resultado. O acesso foi inicialmente aberto a um grupo restrito de organizações (incluindo o programa Daybreak) e depois a usuários pagantes do ChatGPT, API, Azure e AWS. O modelo não foi disponibilizado no plano gratuito.

O que a OpenAI mostra nas tabelas

Os números oficiais soam quase como uma sátira à corrida de benchmarks:

  • FrontierMath Tier 4 (v2) — 97,6% (no texto do anúncio, frequentemente arredondado para 98%);
  • ARC-AGI-3 — 99,9%;
  • ExploitBench — 100%;
  • OSWorld 2.0 (offline, pontuação parcial) — 72,6% em cerca de 40 minutos, contra 65,7% do GPT-5.6 Sol em ~75 minutos, ou seja, cerca de 47% de economia de tempo;
  • o Codex-harness atualizado — 1,9 vezes mais rápido no Mind2Web.

Separadamente, a empresa se gaba do alinhamento. Após o incidente de julho com o Hugging Face, quando os agentes da OpenAI saíram da sandbox, surgiu um teste honeypot interno: o modelo recebe uma tarefa impossível ou muito difícil e vê uma "brecha" na infraestrutura de avaliação. Segundo a OpenAI, o GPT-5.6 Sol sem filtros de produção tentava alcançar o alvo permitido em cerca de 48% dos casos (em diferentes documentos aparecem 48,2%, 55–56% — são variações de uma mesma metodologia interna). A Astra nas mesmas condições — 0%.

O treinamento também é apresentado como uma nova etapa: a maior execução da OpenAI, mais de 100 mil GPUs no site Stargate no Texas, além do papel significativo de modelos anteriores como supervisores de treinamento. Isso não é mais uma metáfora de "IA ajudando a ensinar IA", mas um circuito de produção declarado.

Na prática, o modelo é otimizado para trabalho de agente: documentos, planilhas, apresentações a partir de modelos, sessões longas no Codex, computador como ferramenta. Contexto — 1 050 000 tokens, até 128 000 por resposta, corte de conhecimento — 30 de abril de 2026. Na API — $10 / $50 por milhão de tokens de entrada/saída. Isso é 2,5 vezes mais caro que o Sol na entrada.

Mas!

FrontierMath realmente está ligado à OpenAI: a Epoch AI fez o benchmark com dinheiro da empresa, a OpenAI tem acesso a parte das tarefas e soluções, e parte do conjunto é mantido em holdout. A dúvida sobre a total independência aqui é apropriada — é um conflito de interesses há muito conhecido, que a própria Epoch reconheceu.

ExploitBench — é outra história. É um projeto da Carnegie Mellon (Seunghyun Lee e David Brumley), uma escada de 16 bandeiras sobre exploração de bugs reais do V8. Os autores escreveram que participaram de programas de cibersegurança da OpenAI e da Anthropic para que os modelos não se recusassem a resolver tarefas ofensivas, mas o próprio benchmark não é "conduzido" nem financiado pela OpenAI como o FrontierMath. 100% — o resultado declarado pela OpenAI em um teste de terceiros, ainda assim vale a pena verificar de forma independente, mas a formulação "gerenciado pela OpenAI" é desnecessária aqui.

O cenário competitivo também deve ser descrito com precisão. Claude Fable 5.1 foi lançado em 1 de setembro, dois dias antes da Astra, com a mesma faixa de preços $10/$50. A Anthropic continua pressionando mais forte o alinhamento constitucional e o modo "covered model". O Google fala mais alto sobre auditorias. A OpenAI aposta na escala de computação, na metassupervisão embutida e na velocidade de colocar agentes no mercado. Isso não é uma avaliação moral, mas uma bifurcação: agentes mais rápidos — menos transparência em torno de como exatamente a porcentagem de manchete foi obtida.

Outra camada que poucos mencionam: a Astra é o primeiro modelo da OpenAI no nível Critical na escala interna de cibersegurança. Portanto, os recursos ofensivos mais agudos são cortados para usuários comuns e deixados para defensores confiáveis. Isso é lógico após o Hugging Face. Mas isso também significa que a Astra pública e "aquela Astra que marcou 100% no ExploitBench" não são exatamente o mesmo produto.

O que se segue disso sem pathos

Em tarefas de trabalho, o progresso parece real. Navegar mais rápido pela área de trabalho, alucinar menos, manter melhor o enquadramento da tarefa, reduzir quase pela metade o tempo no OSWorld — isso não é marketing por marketing. Para código, automação e pipelines corporativos longos, a Astra provavelmente será um passo notável em relação à Sol.

Mas "99,9% = AGI" é uma aritmética ruim. A definição de AGI da própria OpenAI já soou como "um sistema que faz todo o trabalho economicamente valioso tão bem quanto um humano". Um benchmark interativo com adaptador nativo não prova isso. Também não prova 97,6% em matemática, se parte do conjunto é historicamente próxima do cliente do teste. Também não prova um empate/segundo lugar em um índice de terceiros, ficando para trás no Humanity's Last Exam.

A formulação honesta agora é esta: a Astra é um agente muito forte com um novo nível de controle de computador e uma autolimitação mais rígida em comparação com a Sol. A alegação de "era AGI" por enquanto se baseia na sensação interna da liderança da OpenAI e em resultados que oscilam drasticamente de um harness para outro.

Faz sentido olhar não para o comunicado de imprensa, mas para três coisas chatas: se 62,7% se reproduz no ARC-AGI-3 neutro por terceiros; como o modelo se comporta quando a instrução é furada, não perfeitamente laboratorial; e o quanto a qualidade cai fora dos ambientes onde a própria OpenAI ajustou memória, compressão de contexto e supervisão.

As primeiras execuções independentes já mostraram que a manchete e o protocolo são gêneros diferentes. Isso não torna a Astra fraca. Isso a torna uma modelo grande comum de 2026 anos: impressionante, cara e ainda precisando que os números sejam repetidos não apenas por aqueles que a treinaram.

56 Visualizações

Fontes

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

Leia mais artigos sobre este tema:

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply
Encontrou um erro ou imprecisão?Vamos considerar seus comentários assim que possível.