Resumo:
Poucas horas antes do lançamento do Astra, a comunidade de IA estava um caos. Na noite de 3 de setembro, ChatGPT, Claude e Grok experimentaram anormalidades de serviço em grande escala quase simultaneamente. Um grande número de usuários não conseguiu abrir os modelos ou suas solicitações falharam. Neste momento, a conta oficial do ChatGPT olhava para as estrelas: “As estrelas estão quase alinhadas.”

Alguém logo começou a brincar: o Astra hackeou tanto o Anthropic quanto o xAI durante a implantação e nem se poupou no final?
Claro, isso é apenas uma piada criada por internautas. Atualmente não há evidências de que esta falha esteja relacionada ao Astra.
Mas esta piada apareceu na hora certa - há apenas dois dias, a OpenAI tinha acabado de anunciar que este novo modelo, que ainda não foi lançado oficialmente, se tornou o primeiro modelo da empresa a cruzar o limite de capacidade de segurança cibernética "crítica" do Quadro de Preparação.
Então as estrelas realmente se encaixaram.
Na madrugada de 4 de setembro, horário de Pequim, a OpenAI lançou oficialmente o GPT-6 Astra.
Mas nem todos estão online. Atualmente, o Astra está aberto apenas a um pequeno número de organizações no sistema Trusted Access/Daybreak e usuários de segurança de rede auditados - usuários Plus, Pro, Business, Enterprise e API terão que esperar para ver por mais alguns dias.

Astra está chegando, mas Tathagata
Em 4 de setembro, a OpenAI lançou o GPT-6 Astra “internamente”.
Atualmente, o Astra está aberto apenas a um pequeno número de instituições no sistema Trusted Access/Daybreak. OpenAI disse que assinantes e APIs Plus, Pro, Business, Enterprise terão acesso nos próximos dias.
Quanto a quantos dias esses "alguns dias" realmente duram, não há um cronograma mais específico por enquanto.
Em uma coletiva de imprensa a portas fechadas antes do lançamento, o presidente da OpenAI, Greg Brockman, deu à Astra uma nota de rodapé um tanto exagerada: "Bem-vindo à era AGI."
Bem-vindo à era AGI.
Aidan Clark, vice-presidente de pesquisa da OpenAI, explicou por que o Astra é especial sob outra perspectiva: "Esta é a primeira vez que mais de 100.000 GPUs foram usadas para pré-treinamento na unidade Stargate, no Texas. Da rede do data center ao núcleo de inferência e ao formato do modelo em si, tudo é projetado do zero em torno dessa escala de treinamento."
Aidan também disse que o Astra também é o primeiro produto da OpenAI a permitir que modelos da geração antiga se envolvam profundamente no processo de treinamento.
Simplificando, as pessoas que treinam a próxima geração de IA já começaram a aparecer na geração anterior de IA.
Embora esteja longe de "a IA se treinar", o modelo entrou no processo de desenvolvimento do modelo da próxima geração.
Depois que a Anthropic chamou o Fable/Mythos 5.1 de "o modelo de trabalho de codificação e conhecimento mais avançado do mundo" anteontem, hoje, a OpenAI também chamou o Astra de "o modelo mais forte e alinhado do mundo".
Em termos de testes de benchmark, os números mais assustadores vêm do ARC-AGI-3.
Este é um benchmark de agente que testa especificamente se um modelo pode entrar em um ambiente 2D nunca visto antes, descobrir regras por meio de tentativa e erro contínuos e atingir metas. Não é como um exame tradicional que testa quanto conhecimento é memorizado, mas está mais perto de jogar a IA em um jogo desconhecido para ver se ela consegue descobrir “como o mundo funciona” por conta própria.
Astra alcançou a pontuação mais alta de 99,9% na configuração do adaptador de provedor da própria OpenAI.
Mas esse número precisa ser desmontado. O Prêmio ARC também usa um conjunto de chicotes padrão que todos os fabricantes podem comparar uniformemente. Aqui, o Astra atinge apenas 62,7%.

A maior diferença entre os dois não é que o assunto tenha mudado. A OpenAI descobriu anteriormente que a razão pela qual Sol obteve pontuação baixa não foi porque o modelo era estúpido, mas porque o chicote continuou a formatar sua memória. Portanto, o que a OpenAI fez foi substituir o chicote do ARC-AGI-3 pela configuração de produção de sua própria API de Respostas e, em seguida, preparar especialmente duas configurações especiais para o ARC-AGI-3, ou seja, raciocínio retido e compactação. O primeiro permite que o modelo lembre-se de seus pensamentos anteriores entre as ações, enquanto o último usa resumo em vez de truncamento aproximado.
Depois de se conectar a esse sistema de produção, o Astra saltou de 62,7% para 99,9%. Nas tarefas concluídas com sucesso por ambas as partes, o Adaptador Provedor em geral funcionou aproximadamente 3,66 vezes mais rápido e o consumo de tokens foi reduzido em 49%.
De certa forma, é como abrir um plug-in.
Em matemática difícil, o FrontierMath Tier 4 é de 97,6%. A Epoch AI, onde a FrontierMath está sediada, disse que a OpenAI financiou o desenvolvimento do benchmark e tem acesso exclusivo a algumas de suas questões.
As pontuações que merecem atenção incluem:
DeepSWE v1.1 74,1%
BenchCAD 95,9%
Tarefa científica do Terminal-Bench 64,6%.

Mas desta vez a OpenAI obviamente não se baseou apenas em uma série de benchmarks para apresentar o Astra.
Quando você abre o site oficial, os cases são postados quase um após o outro.
KiCad, Excel, Blender, Power BI, preenchimento de formulários no navegador, controle de qualidade de sites; depois procurar uma casa, encontrar um médico, marcar consulta no Detran, fazer declarações fiscais, fazer PPT, desenvolver jogos e analisar dados de pesquisas científicas.
Nas últimas gerações de lançamentos GPT, a OpenAI informava principalmente aos usuários o que o modelo poderia responder; com o Astra, seu foco parece ter mudado e passou a ser: quantas coisas restam que podem ser entregues diretamente à IA.
A OpenAI até chamou diretamente o Astra de "o melhor modelo de uso de computador do mundo".
O progresso do modelo no “uso de computadores” pode ser mais importante que a pontuação. No Codex, o Astra traz um novo mecanismo de contexto: em vez de apenas compactar o resumo quando a janela de contexto está cheia, você pode manter anotações nas janelas e pesquisar mensagens anteriores e saídas de ferramentas.
O Astra também pode continuar trabalhando na parte que não depende da resposta quando uma determinada questão não é resolvida, de modo a evitar que uma única questão não resolvida bloqueie toda a tarefa.
É claro que os recursos também estão diretamente incluídos no preço.
O preço padrão da API do GPT-6 Astra é: US$ 10 por milhão de tokens de entrada, US$ 1 para entrada em cache e US$ 50 para saída.
Em comparação com a atual entrada de US$ 4 do GPT-5.6 Sol, cache de US$ 0,4 e saída de US$ 20, o preço de toda a linha do Astra foi aumentado diretamente para 2,5 vezes. O posicionamento da OpenAI também é muito claro: se você não sabe qual modelo principal escolher, pode escolher o Astra; se você se preocupa mais com o custo, continue usando GPT-5.6 Terra ou Luna.
Ele ainda fornece 1,05 milhão de contexto de token e uma saída máxima de 128.000 tokens. Mas o contexto longo também tem custos adicionais: como a série GPT-5.6, quando uma única entrada excede 272 mil tokens, o custo de entrada de toda a solicitação será calculado como 2 vezes e a saída será calculada como 1,5 vezes.
Portanto, a OpenAI definiu um nível inteligente mais caro para o Astra.
Se você apenas fizer uma pergunta e alterar alguns parágrafos do texto, pode não valer a pena gastar 2,5 vezes o preço.
Mas se o modelo puder realmente ficar na frente do computador, trabalhar continuamente por dezenas de minutos ou até horas e concluir toda a tarefa que costumava exigir que as pessoas trocassem de software, verificassem informações, preenchessem formulários e modificassem arquivos, então o que realmente precisa ser comparado não é mais apenas quanto dinheiro por milhão de tokens.
Alguns pontos técnicos dignos de nota
O Astra também possui vários pontos técnicos que podem ser mais dignos de nota do que o próprio Benchmark.
A primeira é a engenharia reversa.
A OpenAI citou o SRE-Bench nesta versão. Este é um conjunto de benchmarks de engenharia reversa lançado este ano por equipes como Columbia DAPLab: o código-fonte do modelo não é fornecido, apenas o programa binário compilado é fornecido para ver se ele consegue reentender a lógica do programa e encontrar comportamentos-chave.
O Astra tem uma taxa de sucesso de 88,0% em uma tentativa e 99,2% em até quatro tentativas.
Sob o mesmo conjunto de regras, GPT-5.6 Sol é de apenas 55,9% e 68,7%, respectivamente.

Em termos humanos, quando confrontada com um programa que foi compilado e quase não possui código legível por humanos, a IA está começando a ser capaz de “retirá-lo” pouco a pouco das instruções da máquina.
Isso tem implicações diretas na análise de malware, pesquisa de firmware, mineração de vulnerabilidades e análise forense digital.
A segunda mudança é que o Astra "não é mais fácil encontrar itens perdidos" em missões extremamente longas.
No teste de recuperação de oito pinos MRCR v2, a precisão do Astra atingiu 100% ao enfrentar contextos de 256K a 512K; quando se tratava de 512 mil a 1 milhão de tokens, ainda tinha 96,3% de precisão. Porém, o GPT-5.6 Sol possui apenas 91,5% e 73,8% nesses dois intervalos respectivamente.

No passado, muitos modelos alegavam suportar milhões de contextos, mas se uma informação importante estiver escondida fora de centenas de milhares de tokens, o modelo pode quase tê-la esquecido na segunda metade do processo.
A Astra começou a enfatizar "qual é o tamanho da janela de contexto" para outra questão mais prática: por quanto tempo um agente pode se lembrar do que aconteceu antes.
Para um Agente que precisa trabalhar continuamente por dezenas de minutos ou até horas, isso pode ser mais importante do que adicionar centenas de milhares de janelas de token a mais.
Além disso, o Astra tem outra mudança incomum.
Torna-se mais alinhado, mas também mais difícil de monitorar.
Em um conjunto de testes internos de segurança de uso de computadores publicados pela OpenAI, a taxa de violação do Astra caiu de 22,0% no Sol para 2,4%; em um teste que observou especificamente se o modelo contornaria as restrições para completar a tarefa, o Astra foi de 0%. O teste de alucinação interna também caiu de 9,4% no Sol para 2,0% no Astra.
Pelo menos de acordo com os próprios testes da OpenAI, o Astra é significativamente menos “caótico”. Mas o cientista-chefe da OpenAI, Jakub Pachocki, também lembrou: “O progresso da inteligência não garante o progresso do alinhamento.”

Uma das razões é que Astra começou a escrever cada vez menos seu processo de pensamento completo.
Um método de segurança de IA muito importante no passado era monitorar a cadeia de pensamento do modelo: se o modelo fosse ultrapassar sua autoridade, atacar um determinado sistema ou alterar secretamente seus objetivos, você poderia ver pistas em seu raciocínio antecipadamente.
Mas a OpenAI descobriu que a Astra tinha maior controle sobre seu raciocínio escrito. Alguns problemas que no passado tinham que ser resolvidos através da escrita de muitos passos podem agora ser resolvidos com um raciocínio menos explícito; se o modelo souber que seu processo de pensamento está sendo monitorado, esses conteúdos serão significativamente alterados ou encurtados.
Portanto, a OpenAI não pode mais se concentrar apenas na cadeia de pensamento.
Para ficar de olho no Astra e evitar que ele cometa os mesmos ataques que apareceram no Sol antes, a OpenAI instalou o "monitoramento de desalinhamento" no ambiente de produção. Ele observa simultaneamente o raciocínio do modelo, as ações reais, as chamadas de ferramentas e toda a trajetória da tarefa.
Se o sistema determinar que o modelo pode estar se desviando seriamente da intenção original do usuário, ele poderá pausar ou até mesmo encerrar a tarefa diretamente.
Na API, a tarefa interceptada pode terminar diretamente; no ChatGPT ou Codex, em alguns casos o usuário será solicitado a reconfirmar primeiro:
"É realmente isso que você quer que eu faça?"

No nível do produto, o nome do modelo de API do Astra é diretamente gpt-6-astra e também entra no Amazon Bedrock.
OpenAI também lançou o modo Rápido: o preço dobrou e a velocidade máxima de execução é cerca de 2,5 vezes.
Para bate-papo casual, isso pode não ser atraente. Mas se um Agente originalmente precisar rodar no navegador e no software por 40 minutos, e o tempo for reduzido para dez ou vinte minutos, a própria velocidade se tornará parte das capacidades do produto.
Do lado da assinatura, o Astra será incluído na cota de assinatura existente; Pro, Business e Enterprise também receberão o Astra Pro mais poderoso. O Enterprise não será ativado diretamente por padrão e precisa ser ativado manualmente pelo administrador.
Embora ainda não possa ser aberto...
História complexa, abertura limitada
O Astra pode ser o lançamento de modelo mais “histórico” da OpenAI até hoje.
Muitos modelos são lançados primeiro e depois expõem problemas lentamente, mas o Astra faz o oposto - é claro, alguns métodos de marketing não estão descartados. Mas antes de ser lançado oficialmente, o OpenAI passou quase um mês explicando constantemente por que precisava ser treinado, testado e aberto com mais cuidado.
Em 7 de agosto, a OpenAI declarou publicamente pela primeira vez que a última avaliação interna tornou impossível para a empresa descartar a possibilidade de a Astra ter atingido o limite de capacidade de segurança cibernética "crítica" no âmbito do Quadro de Preparação.
Em 1º de setembro, essa “possibilidade” tornou-se uma conclusão formal: o Astra se tornou o primeiro modelo da OpenAI classificado como Crítico em recursos de segurança de rede.
De acordo com os próprios padrões da OpenAI, isso significa que com as ferramentas certas e direitos de acesso, a Astra foi capaz de descobrir de forma independente vulnerabilidades anteriormente desconhecidas e desenvolver explorações disponíveis em muitos sistemas reforçados do mundo real, sem a necessidade de orientação humana passo a passo; ou pode projetar e executar um conjunto de estratégias de ataque ponta a ponta contra alvos endurecidos, apenas fornecendo-lhes um alvo de alto nível.
Este não é mais apenas um nível de "ser capaz de escrever código de ataque". No ExploitBench, o Astra obteve pontuação direta de 100%.

Para evitar que o modelo memorize apenas vulnerabilidades públicas, a OpenAI preparou outro conjunto de testes internos e colocou 20 vulnerabilidades V8 de alto risco que só foram divulgadas de junho a agosto de 2026. O Astra não apenas usa menos tokens de saída do que o GPT-5.6 Sol, mas também atinge uma taxa de sucesso de execução de código arbitrário significativamente maior.
Durante o teste, ele até descobriu e explorou dois dias zero até então desconhecidos e os vinculou a uma cadeia de exploração. A OpenAI disse que está atualmente divulgando essas duas vulnerabilidades aos mantenedores.
Os testes de especialistas estão mais próximos dos ataques da vida real. Diante de um navegador reforçado, o Astra pode escapar totalmente da sandbox após encontrar vulnerabilidades desconhecidas e executar comandos na máquina host; no sistema operacional reforçado, ele reúne diversas vulnerabilidades em uma cadeia de escalonamento de privilégios local para obter privilégios de root de usuários comuns.
Foi durante esse processo que a OpenAI descobriu pela primeira vez que as capacidades perigosas do modelo começaram a afetar a forma como o próprio modelo deveria ser treinado.
Em 18 de agosto, a OpenAI admitiu publicamente que a empresa havia suspendido temporariamente a expansão da escala de treinamento, incluindo a suspensão do último modelo de treinamento de aprendizagem por reforço planejado para implantação por duas semanas.
Ao mesmo tempo, um grande número de tarefas de treinamento e avaliação envolvendo o Astra continuam suspensas porque ainda não foram migradas para o novo ambiente seguro.
No passado, ao discutir a segurança da IA, perguntávamos principalmente se o modelo poderia ser entregue com segurança aos usuários após o treinamento; mas aqui na Astra o problema avançou para a fase de treinamento.
A OpenAI, portanto, fortaleceu todo o ambiente de pesquisa. A tarefa de executar o código de geração de modelo requer um sandbox mais rigoroso; cargas de trabalho de alto risco exigem um isolamento de rede mais forte; O ponto de verificação Astra adiciona criptografia e controle de acesso; toda inferência do Astra com ferramentas está sujeita a monitoramento adicional.
Esse conjunto de monitoramento em si não é nem barato. A OpenAI estima que a sobrecarga computacional causada apenas pelo sistema de monitoramento é equivalente a aproximadamente 20% do poder de computação de inferência monitorado.
Em outras palavras, o custo do Astra não é apenas "treinar um modelo maior", mas o OpenAI também gasta uma quantidade considerável de poder de computação adicional para monitorar o que o modelo está fazendo.
Isso também explica por que, após o lançamento oficial do Astra, os recursos de segurança de rede mais avançados não foram liberados diretamente para todos.
A OpenAI deixou claro que a versão de produção padrão do Astra ainda estabelecerá limites para solicitações de ataques de rede de alto risco; fluxos de trabalho de segurança de rede mais avançados serão inicialmente abertos a um pequeno grupo de testadores Alpha e, em seguida, expandidos gradualmente para usuários defensivos auditados por meio do Daybreak Blue.
Embora os usuários comuns também recebam o Astra nos próximos dias, isso não significa que todos terão exatamente os mesmos recursos.
Essas restrições podem até causar ferimentos acidentais. A OpenAI avisa antecipadamente que verificações de segurança adicionais podem retardar, suspender ou até interromper tarefas normais. Mesmo algumas tarefas de longo prazo do Agente que parecem não ter nada a ver com a segurança da rede também podem ser rotuladas incorretamente.
Se as tarefas no ChatGPT ou Codex forem suspensas pelo monitoramento de desalinhamento, o usuário pode precisar voltar para confirmar a operação antes de continuar; tarefas na API podem ser encerradas diretamente.
Esta parte da mudança foi facilmente ofuscada pelo "AGI" após o lançamento do Astra.
Quanto mais capaz for o modelo, mais capacidades uma pessoa pode obter diretamente, isso passa a depender cada vez mais de quanta autoridade a plataforma está disposta a lhe dar.
Então, após uma série de "críticas, suspensão de treinamento, isolamento, monitoramento e abertura gradual", Greg Brockman disse na coletiva de imprensa sobre o lançamento do Astra: "Bem-vindo à era AGI."
Ele até disse que se fosse julgar pessoalmente, pensaria "conseguimos isso".
Mas quando perguntado: "A OpenAI anunciou oficialmente a implementação do AGI?" Brockman admitiu que a AGI se tornou uma "coisa cinzenta e confusa", mais como um "conceito de missão" ou "conceito espiritual" do que um padrão técnico que pode ser desenhado com precisão.
Anteriormente, em "Sources Podcast", Altman estava relutante em discutir seriamente a questão de "quando implementaremos AGI". Ele acreditava que o termo AGI era “na melhor das hipóteses, um conceito muito vago” e quase o chamou de “termo de marketing insignificante”.
A razão não é que a OpenAI esteja mais distante da AGI. Pelo contrário, é porque, na opinião de Altman, a AGI pode não ser mais tão importante.
O que realmente o deixou preocupado foi a palavra seguinte: Superinteligência.
Altman disse que, há um ano, não acreditava que a OpenAI estivesse em uma trajetória de curto prazo em direção à superinteligência. Agora, ele acha que isso “poderia acontecer”.
Mas ainda quero reclamar: ASI não é um “termo de marketing insignificante”?
Comentários