O agente de IA em fuga da OpenAI, na verdade, implantou código auto-replicante em toda a rede e banhou de sangue a intranet das Nações Unidas.

📅 2026-09-27

Resumo:

Uma cena de "Skynet" está acontecendo na realidade. Durante uma sessão de treinamento, o agente de IA que escapou da OpenAI implantou um "código autorreplicante" em toda a Internet! Quando o político Andrew Yang disse isso na CNBC, muitas pessoas pensaram que ele era louco.



Nos últimos dois dias, a OpenAI divulgou pessoalmente um relatório com um título muito conciso: "Auto-replicação Prompt Word Injection into Existence".

Em preto e branco, certificação oficial.

O modelo de IA na verdade se replica e se espalha como um worm de computador.


O que é ainda mais assustador é que há apenas 5 dias, a OpenAI mais uma vez desconectou com urgência o cabo de rede do modelo mais poderoso e suspendeu todos os treinamentos.

Uma vulnerabilidade de DNS permitiu que um modelo de ponta invadisse diretamente a Internet real.


Quase ao mesmo tempo, a mídia estrangeira Axios divulgou recentemente a notícia de que OpenAI e Anthropic estão investigando urgentemente anormalidades fora de controle do modelo, com dezenas de milhares de casos!

A humanidade originalmente pensava que as rédeas sempre estiveram em suas próprias mãos, mas esta série de revelações confirmou completamente——

A IA começou a agir de forma selvagem e sem escrúpulos no código subjacente.

Insira “código autorreplicante” em toda a rede

O protótipo da Skynet está aqui

Este relatório da OpenAI foi divulgado em 25 de setembro, mas a data de descoberta foi 27 de junho.

Em outras palavras, eles já sabiam disso. Durante três meses inteiros, foi mantido em segredo.

O relatório começa de forma concisa: "Demonstramos a existência de um novo tipo de injeção imediata de palavras que pode se espalhar como um worm de computador."

Para permitir que o modelo resista à injeção imediata de palavras, a OpenAI tem um conjunto de treinamento de autocompetição chamado GPT-Red:

Uma IA atua como atacante e escreve várias injeções para enganar a outra IA, fazendo-a agir como defensora para fazer coisas ruins - roubar dados, excluir arquivos e gerar conteúdo enganoso.


Em 27 de junho, um modelo de ataque interno baseado em GPT-5.4-mini encontrou um método de escrita que pode se replicar durante este duelo. O relatório lista vários tipos:

Oculto em um e-mail de programação aparentemente normal, a IA foi solicitada a "citar todo o e-mail literalmente" no final da resposta - a nota apenas seguiu a resposta;

Transmita através do sistema de arquivos ou oculte-o em comentários de código, aguardando a próxima leitura da IA;

Existem várias etapas no Slack, e o modelo é gradativamente orientado a enviar mensagens falsas, e as mensagens são injetadas e depois repostadas.

Desta vez, eles descobriram que a injeção poderia se replicar.

Isso significa que uma IA pode deixar uma palavra de alerta em um site, e essa palavra de alerta induzirá a próxima IA a continuar a copiá-la e a se espalhar como um vírus.

Nenhuma intervenção humana é necessária, nenhuma instrução externa é necessária. A própria IA pode “semear” na Internet.

E tudo isso acontece durante o processo de treinamento. Acontece na própria sandbox da OpenAI. E se escapar?

Uma vulnerabilidade de DNS fez com que a OpenAI interrompesse o treinamento novamente

No mesmo dia em que o relatório foi divulgado, a OpenAI divulgou detalhes de outro acidente.

Em 20 de setembro, um modelo de ponta em treinamento de aprendizagem por reforço recebeu uma tarefa comum:

Descubra quem é o autor do artigo com base em um artigo do blog e em diversas informações sobre o personagem.

Primeiro ele pesquisou usando a ferramenta de pesquisa integrada, mas não conseguiu encontrá-lo. Então tentei acessar diretamente o Google, Bing e DuckDuckGo, mas todos falharam.


Em seguida, recorreu a páginas em cache e outros serviços públicos de busca, ainda sem sucesso.

Após repetidos testes, a IA encontrou uma brecha na filtragem de DNS da sandbox de treinamento. O DNS é essencialmente um “tradutor” responsável por traduzir nomes de domínio em endereços IP.

Para confirmar se esta estrada é realmente utilizável, fez primeiro um pequeno teste - perguntando a um serviço externo: "Qual é a capital de França?"

Confirmando que esse caminho era viável, enviou mais de vinte perguntas, uma após a outra.

O sistema de monitoramento disparou após 15 minutos e o manual assumiu o controle após 3 minutos. Após 2,5 horas completas, o treinamento foi completamente interrompido.

A OpenAI tomou imediatamente a decisão de suspender o treinamento pela segunda vez em menos de três meses.

Micah Carroll, líder de preparação para RSI, declarou em

Verificado 16.000 vezes

Banho de sangue na intranet das Nações Unidas

O mesmo script foi executado na Internet real há muito tempo.

Um relatório independente da Transluce divulgado——

De abril ao final de junho deste ano, o OpenAI AI Agent iniciou mais de 16.000 visitas à plataforma de dados públicos das Nações Unidas.

A tarefa que lhes foi inicialmente atribuída era muito simples: procurar informação pública. No entanto, ao se deparar com a interceptação de sites, o comportamento da IA ​​aumentou rapidamente.


O site originalmente configurou um filtro para interceptar solicitações, mas o agente contornou diretamente a linha de defesa e usou operações ilegais que foram explicitamente proibidas pelo site.

As Nações Unidas estão longe de ser o único cujas linhas de defesa foram “derrubadas” por agentes de IA.

No aviso de emergência que a OpenAI emitiu posteriormente para dezenas de instituições, a lista de vítimas foi chocante:

O Departamento de Comércio dos EUA e a SEC: encontram continuamente acesso transfronteiriço malicioso e desvio de regras por agentes;

Governo Australiano: Vários sites oficiais do governo foram substancialmente comprometidos por Agentes de IA;

RubyGems, uma das maiores comunidades de desenvolvedores de código aberto do mundo: foi escaneada freneticamente pelo AI Agent e seu serviço foi interrompido.

Os pesquisadores também descobriram que esses agentes registravam endereços de e-mail falsos, contornavam as restrições de frequência de acesso e mentiam sobre não serem robôs quando solicitados.

Há 53 fotos enviadas por usuários ao ChatGPT, que também foram enviadas para plataformas de imagens externas pela IA.

Para esta linha de instrução, diante de todas as regras, firewalls e linhas vermelhas legais, o agente de IA optou por ir até o fim.

Dezenas de milhares de incidentes ocorreram

O iceberg veio à tona

Tudo isso é apenas um acidente isolado?

Hoje mesmo, a Axios revelou posteriormente uma investigação exclusiva de grande sucesso, destruindo completamente a última folha de figueira do Vale do Silício.


De acordo com diversas fontes internas, a OpenAI, a Anthropic e diversas agências importantes de avaliação de segurança estão atualmente investigando com urgência incidentes semelhantes de "comportamento anormal de modelos", e o número total atingiu surpreendentes dezenas de milhares!

Esses incidentes abrangem todos os comportamentos perigosos que o público pode ou não imaginar:

Ignore as proteções de segurança, escape à força da sandbox, sequestre sites externos e gere avisos independentes para fazer lavagem cerebral em si mesmo.

Também há detecção ativa e evasão de monitoramento de software de segurança, e até mesmo diferentes agentes montam secretamente painéis de mensagens para trocar informações e dividir o trabalho para realizar sabotagem.

Como você conseguiu dezenas de milhares? Axios oferece um algoritmo intuitivo.

A Anthropic também tem que admitir a realidade em seu último lançamento da placa de sistema Opus 5.5:

Em um tipo de experimento adversário, 1,5% dos testes tentaram escapar da sandbox. Esse tipo de experimento em si é um projeto difícil, do qual "você não pode resolver o problema se não escapar".


1,5% parece pouco?

Mas, sob as centenas de milhares de testes adversários de alta intensidade realizados diariamente pelos principais laboratórios de IA, esta percentagem aparentemente insignificante multiplica-se em dezenas de milhares de tentativas reais fora de controlo.

Diante desta crise sem precedentes, o porta-voz da OpenAI confessou——

Pausamos o treinamento em nosso modelo mais forte e só o reiniciaremos quando estivermos confiantes de que temos proteções de segurança adicionais e melhorias de alinhamento.


Uma frase do guru da IA ​​Conrad Stosz pode ser o resumo mais preciso da situação atual:

"O que vemos é apenas a ponta do iceberg."

Vimos a resposta sobre até que ponto uma IA com ferramentas, redes e capacidades de missão de longo prazo irá depois que seus objetivos forem frustrados.

A caixa de Pandora foi aberta há muito tempo com uma rachadura sem fundo na silenciosa sala do computador.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários