Resumo:
O tão aguardado
GPT-6 Astra
eGPT-6 Astra Pro
Lançado oficialmente! O GPT-6 Astra é o modelo mais inteligente e coordenado do mundo, estabelecendo uma nova referência para uso de computador, uso de navegador, engenharia de software, segurança cibernética, ciência e trabalho profissional.

A era da AGI foi anunciada unilateralmente como "abertura" pela OpenAI...
No final da conferência GPT-6, o presidente da OpenAI, Greg Brockman, disse diretamente:
Bem-vindo à era AGI. (Bem-vindo à era AGI)
Não admira que o grupo Claude e Grok tenha ficado offline. Descobriu-se que o Astra escaneou a Internet depois de ser ativado e eliminou diretamente todos os LLM do planeta——
Ultron (versão OpenAI) está realmente aqui (doge).

É claro que a OpenAI não é discreta neste momento, com a escala de treinamento e as atualizações de capacidade totalmente alcançadas.
De acordo com relatos, o Astra é a maior tarefa de treinamento na história da OpenAI, usando mais de
100.000 GPUs no campus Stargate no Texas
Pré-treinamento concluído.É também o primeiro produto carro-chefe da OpenAI profundamente envolvido na supervisão de treinamento por modelos da geração anterior.
Que velho trazendo o novo, o RSI da OpenAI está realmente mudando...
O preço do GPT-6 também foi anunciado oficialmente, e o preço da API é:
Insumo: 10 USD/milhão de tokens;
Saída: 50 USD/milhão de tokens
Equivalente a
2,5 vezes o GPT-5.6 Sol, o mesmo que o recém-lançado Fable 5.1
.(O preço oficial atual do GPT-5.6 Sol é de US$ 4 para entrada e US$ 20 para saída/milhão de tokens)

Os testes de benchmark estão próximos da "saturação"
A principal mudança do GPT-6 Astra desta vez é continuar avançando de “responder perguntas” para “concluir diretamente o trabalho”.
Ele pode não apenas gerar um trecho de texto ou código, mas também operar computadores e navegadores, inserir diferentes softwares para executar tarefas de várias etapas e, finalmente, entregar documentos, formulários, apresentações, sites e até projetos de engenharia que podem ser usados diretamente.
Quanto ao boletim... todos que o viram disseram que era ultrajante, e três dos resultados foram particularmente atraentes:
FrontierMath Nível 4 v2: 97,6%
ARC-AGI-3: 99,9% (a geração anterior GPT-5.6 Sol era de 7,8%)
ExploitBench: 100%
Uma matemática difícil, um raciocínio em um ambiente desconhecido, uma exploração de vulnerabilidade, quase todos obtiveram notas perfeitas.

Entre eles, o ARC-AGI-3 é um teste projetado especificamente para testar a capacidade de modelos grandes de se adaptarem a ambientes desconhecidos. Sem explicação das regras, o modelo é lançado diretamente em um jogo bidimensional que nunca viu antes, e pode jogar e explorar como passar de nível.
Esta pontuação significa que, quando confrontado com um problema que nunca foi visto antes e que não tem solução pronta,
o Astra demonstrou fortes capacidades de exploração independente e aprendizagem de regras
.No entanto, este resultado usa a estrutura operacional Responses API Harness da OpenAI.
A OpenAI afirmou que este conjunto de Harness ajustou duas configurações para tornar o teste mais próximo do uso de agentes reais, mas não otimizou especificamente o ARC-AGI-3.
Portanto, 99,9% não é inteiramente resultado do modelo básico, mas inclui também os ganhos trazidos pelo gerenciamento de memória e pelo framework de execução do Agente.
A codificação também é a principal direção de atualização do Astra desta vez.
No Terminal-Bench 4.0, o Astra alcançou 57,7%, superando os 55,8% do Fable 5.1 e os 37,3% do GPT-5.6 Sol.
No DeepSWE v1.1, o Astra obtém 74,1%, o que é superior aos 72,7% do Sol e aos 67,4% do Fable 5.1.

Em termos de matemática e ciências, o Astra também alcançou uma série de pontuações altas.
No difícil teste de matemática FrontierMath Tier 4 v2, obteve 97,6%; nas perguntas e respostas científicas de pós-graduação GPQA Diamond, atingiu 96%, um pouco acima dos 95,3% do Gemini 3.8 Flash.

A mudança mais importante é que o Astra combina recursos de codificação com o uso do computador. Ele não apenas gera código, mas também pode entrar no terminal e nas ferramentas de desenvolvimento para executar, testar, descobrir problemas e continuar a modificá-lo.
Essa mudança é mais óbvia em testes de Agente que estão mais próximos do trabalho real.
No
último exame dos agentes
Em diante, o Astra alcançou 59,3%, superando os 53,6% do GPT-5.6 Sol e os 55,5% do Claude Opus 5.
Este teste o coloca em um ambiente de computador real, permitindo que ele opere software, terminais e arquivos ao mesmo tempo, conclua tarefas de longo processo em pesquisa científica, engenharia, finanças e outras áreas, e julgue com base nos resultados finais.
E no
AutomationBench
, que está mais próximo do processo real do escritório No GPT-5.6 Sol, a pontuação do Astra aumentou de 18,1% para 41,4%, superando também o Fable 5.1 (31%).
Esse teste não apenas verifica se a tarefa foi concluída, mas também mostra o custo da API necessário para concluí-la.
Como pode ser visto na figura, os resultados do Astra sob diferentes configurações de custos são significativamente superiores aos do Sol.
OSWorld 2.0 examina capacidades de operação mais direta do computador. Nos testes offline, o Astra alcançou 72,6% e o GPT-5.6 Sol alcançou 65,7%.
O Astra leva em média cerca de 40 minutos para concluir uma única tarefa, enquanto o Sol leva cerca de 75 minutos, uma redução no consumo de tempo de cerca de 47%.

Embora a precisão aumente, o tempo necessário para concluir as tarefas também é reduzido. Isso também explica os altos preços disfarçados do Astra.
A OpenAI acredita que, comparado a quanto dinheiro é gasto por milhão de Tokens, o indicador verdadeiramente significativo é quanto dinheiro é necessário para concluir uma tarefa.
Na coletiva de imprensa, Greg Brockman também mencionou que uma única chamada de modelo é mais cara, mas se o retrabalho puder ser reduzido e todo o trabalho concluído em menos etapas, o custo total poderá ser menor.
Mas o que há de mais especial no Astra é a
segurança da rede
.Ele recebeu uma pontuação perfeita no ExploitBench e melhorou dos 30,3% do Sol para 42,4% no ExploitGym.
Diante das novas vulnerabilidades divulgadas nos últimos três meses, a taxa de sucesso do Astra foi de 39%, enquanto a do Sol foi de apenas 5,5%. Durante os testes, o Astra também descobriu e explorou duas vulnerabilidades de dia zero do V8 anteriormente desconhecidas.
Depois que suas capacidades se tornaram mais fortes, a OpenAI também testou especificamente se ultrapassaria os limites para concluir a tarefa.
Em uma tarefa simulada de segurança de rede, a OpenAI deixou deliberadamente vulnerabilidades falsas exploráveis nos sistemas circundantes. Quando a tarefa original foi difícil de ser concluída, 48,2% dos testes do GPT-5.6 Sol mostraram comportamento fora dos limites, enquanto o do Astra foi de 0%.
Por outras palavras, a Astra não só é melhor a encontrar lacunas, mas também sabe melhor quais os sistemas que não podem ser tocados.

Quanto à aparência dessas pontuações na realidade, a OpenAI também preparou um grande número de demonstrações.
Insira o KiCad para desenhar você mesmo a placa de circuito
No caso de engenharia eletrônica, a Astra entrou diretamente no KiCad para completar o layout do PCB com base no diagrama esquemático eletrônico.
É necessário colocar os componentes, planejar a localização e, em seguida, conectar os fios de cobre entre os diferentes componentes e, finalmente, obter uma placa de circuito que possa entrar no processo de fabricação.
O layout da PCB era originalmente uma tarefa que dependia muito da experiência manual e também era uma etapa comum e demorada no desenvolvimento de produtos eletrônicos.
O Astra ainda não pode substituir engenheiros profissionais, mas começou realmente a utilizar software profissional.
Você pode dar dois passos para dentro de uma casa
Outro caso é mais intuitivo. Astra primeiro construiu um modelo de casa no Blender, depois importou-o para o Unreal Engine 5 e, finalmente, gerou um espaço tridimensional que pode ser percorrido livremente.

Da modelagem aos motores de jogos, todo o trabalho abrange diferentes softwares e formatos de arquivo. O modelo não deve apenas gerar conteúdo, mas também compreender a interface e as ferramentas operacionais, e garantir que as etapas anteriores e subsequentes possam ser conectadas.

A OpenAI também demonstrou casos como a produção de jogos de corrida pela Astra.

Também estamos começando a prestar atenção se os PPTs e formulários podem ser enviados diretamente
Em cenários de escritório profissional, o Astra pode criar apresentações com base nos modelos existentes da empresa, em vez de apenas produzir um monte de texto aguardando a composição tipográfica humana.
A OpenAI forneceu várias páginas de modelos PPT de produtos fictícios GPT-Gaia, e a Astra produziu uma apresentação completa baseada nele, continuando o formato, estilo visual e estrutura narrativa do modelo original.

Converta horas de tarefas de pesquisa em minutos
Astra também realizou tarefas como encontrar um pediatra, examinar apartamentos, marcar consultas no DMV, encontrar lanches com baixo teor de carboidratos e analisar jardins de infância.
Em uma das tarefas de busca do pediatra, o Astra levou 2 minutos e 54 segundos, enquanto a mesma tarefa levaria aproximadamente 5 horas para ser concluída por um humano.

No passado, quando as empresas queriam usar software interno para modelos grandes, geralmente precisavam desenvolver APIs, plug-ins e conectores para cada sistema separadamente.
Mas a maioria dos softwares possui um conjunto de interfaces universais projetadas para humanos, como tela, mouse e teclado.
A opinião de Brockman é que, desde que o modelo seja bom no uso de computadores, ele poderá operar diretamente essas interfaces como um ser humano, sem ter que esperar que cada software construa um canal dedicado para IA.
Essa também é a diferença mais óbvia entre o Astra e os chatbots tradicionais.
Os humanos não precisam ficar dizendo onde clicar em seguida. Eles só precisam explicar os objetivos e limites e depois verificar os resultados finais.
Continue realizando tarefas longas no Codex
O uso do computador resolve "como fazer", enquanto o conteúdo da atualização vazado pelo Codex resolve "como terminar uma coisa continuamente".
No passado, depois que a tarefa ultrapassava a janela de contexto, o Codex geralmente compactava as informações anteriores por meio de compactação.
Mas a compactação pode perder detalhes importantes, como por que uma correção falhou, quais testes foram executados ou quais restrições o usuário propôs inicialmente.

Com o Astra, o Codex pode salvar notas de trabalho em janelas de contexto e pesquisar mensagens anteriores e resultados de ferramentas. Mesmo que uma informação não esteja incluída no resumo, ela poderá ser encontrada posteriormente.
O Astra também pode solicitar informações adicionais aos usuários enquanto trabalha. As seções que não estão relacionadas à resposta não farão uma pausa e aguardarão uma resposta; somente quando escolhas importantes estiverem envolvidas, ele fará uma pausa e aguardará confirmação.
A OpenAI também atualizou a estrutura de execução Computer Use do Codex. No teste Mind2Web, a nova estrutura combinada com o Astra concluiu tarefas 1,9 vezes mais rápido do que a experiência atual do GPT-5.6 Sol.
Alguém já está trabalhando nisso
O Astra ainda não foi lançado em grande escala, mas o primeiro lote de testes empresariais já começou.
Legora, a plataforma jurídica de IA, usou o Astra para reconciliar 41 documentos financeiros de uma só vez. Todo o processo levou apenas alguns minutos e todos os quatro erros pré-incorporados foram encontrados, incluindo uma diferença de £ 500.000 nas notas de rendimentos.
Olhando apenas para este trabalho, o Astra é quase 40% mais rápido que o modelo da geração anterior; mas quando calculada a média de todas as tarefas do agente Legora, a melhoria é de cerca de 3%.

Por outro lado, a empresa de jogos Playco permite que Astra entre diretamente no Unity e Godot para fazer jogos.
Com o mesmo rascunho de caixa cinza, ele apresenta 3 protótipos jogáveis com temas diferentes ao mesmo tempo, e a maioria deles pode ser executada na primeira versão.
O feedback da Playco é que o trabalho de reparo manual foi reduzido pela metade, e o raciocínio espacial, a restauração de imagens de referência e a interface do jogo também são muito melhores do que na geração anterior.
Ambos os exemplos ilustram que o foco do GPT-6 Astra não está mais apenas em responder perguntas, mas em completar todo o fluxo de trabalho em software real e materiais complexos.
Ele pode ler informações continuamente, chamar ferramentas, verificar resultados e, em seguida, modificar sua saída com base no feedback.
De acordo com notícias oficiais, o Astra estará disponível para usuários ChatGPT Plus, Pro, Business e Enterprise, enquanto o Astra Pro estará disponível para usuários Pro, Business e Enterprise.
Usuários gratuitos comuns...precisam esperar por enquanto.
Isso é considerado AGI?
Pode-se dizer que a OpenAI foi bastante ousada desta vez.
Na conferência de imprensa, Greg Brockman disse que pessoalmente acreditava que
o mundo entrou na era AGI
——Ou seja, a inteligência abrangente do sistema de inteligência artificial supera a dos humanos.
Daqui a alguns anos, quando olharmos para trás e perguntarmos quando a AGI nasceu, a resposta provavelmente será agora, e o Astra pode ser o ponto de partida.
Sou realmente louco por você...
A OpenAI trouxe a mesa de pôquer aqui, valerá a pena esperar para saber quando a Anthropic entrará em ação (doge)
Após o lançamento do GPT-4, o cientista da Microsoft, Sebastien Bubeck, publicou um artigo dizendo que "o GPT-4 é uma centelha inicial para AGI".
A tarefa de desenhar um unicórnio usando o pacote de desenho LaTeX TiKZ foi projetada para ilustrar que o GPT-4 tem uma compreensão flexível dos conceitos envolvidos na linguagem.

Mais tarde, fui até o GPT-5.4. Embora os desenhos se tornassem cada vez mais refinados, eles ainda estavam na “categoria de desenho simples”.

Com o GPT-6 mais recente, é completamente impossível dizer que ele foi desenhado com código.

Na verdade, não é exagero dizer que sofreu uma mudança qualitativa em comparação com a "centelha inicial da AGI".
Comentários