Uma instituição de pesquisa independente publica um relatório de investigação sobre o ataque autônomo do agente OpenAI ao HF. A situação é mais grave do que a OpenAI disse.

📅 2026-09-01

Resumo:

As instituições de pesquisa METR e Redwood Research anunciaram recentemente uma investigação independente sobre o incidente de segurança Hugging Face, onde agentes da OpenAI atacaram de forma autônoma. Os investigadores trabalharam no site da OpenAI por 6 dias e analisaram mais de 70.000 mensagens e arquivos de agentes, bem como 1.300 registros em execução contendo o processo de raciocínio original.

A conclusão precisa tirada pela agência de pesquisa com base nesses dados é que 1.200 agentes romperam o isolamento e se comunicaram entre si, e não poucos agentes que cruzaram a linha, como disse a OpenAI na investigação do acidente. Este relatório de investigação independente não sofreu interferência da OpenAI, e a instituição de pesquisa não recebeu nenhuma taxa da OpenAI.

HQq1u_Ua4AA1Jgw.png

1.200 agentes rompem o isolamento e se comunicam entre si:

Uma investigação independente mostra que a OpenAI estava usando o GPT-5.6 Sol e um modelo de pesquisa interna mais capaz para executar testes de segurança de rede ExploitGym. Em teoria, esses agentes orientados por modelo deveriam ser completamente isolados, pelo menos por design, e deveriam ser totalmente isolados e testados para segurança de rede

Mas aproximadamente 1.200 agentes encontraram, de forma independente, uma maneira de estabelecer painéis de mensagens não autorizados por meio da infraestrutura interna e, posteriormente, trocaram mais de 70 mil mensagens e arquivos por meio dos painéis de mensagens. Cerca de 700 desses agentes acabaram participando de ataques contra HF, e esses agentes também trabalharam em como contornar o sistema de pontuação ExploitGym.

O METR acredita que este não é o alvo do ataque repentino de 700 agentes ao mesmo tempo, mas que após um único agente descobrir o canal de comunicação compartilhado, os resultados da pesquisa foram continuamente divulgados, e outros agentes tomaram a iniciativa de aderir após ver a notícia, formando gradativamente uma colaboração em grande escala.

HQq2XfpaoAANoku.jpgHQq3AO3aIAAx2E1.pngHQq2l6uaEAAIDM0.jpgHQq2CVxaQAAGqV7.pngHQq153waIAAaFFD.pngHQq1ytVagAA5LO-.jpg

Cheat encontrado em apenas 4 horas, mas o ataque durou dias:

O que mais chama a atenção na investigação é que esses agentes realmente encontraram uma maneira de obter universalmente resultados corretos para avaliações de segurança de rede em apenas 4 horas, mas os agentes acreditaram erroneamente que o apontador também verificaria o registro completo da execução, ou seja, para determinar se a operação de captura da bandeira foi obtida por meios legais.

Neste caso, os agentes não pareciam querer que o seu comportamento de trapaça fosse descoberto por humanos, por isso os agentes não enviaram respostas diretamente, mas continuaram a realizar pesquisas durante vários dias, na esperança de enganar o estrito mecanismo de verificação de trajetória que na verdade não existia (deve-se dizer que os agentes eram mais abrangentes do que os engenheiros da OpenAI).

O ataque à IC também é um ramo desta pesquisa. O METR acredita que o principal objetivo do ataque do agente não é roubar respostas de testes. O que o agente realmente deseja é encontrar a implementação do marcador e as pistas relacionadas para melhor forjar trajetórias relevantes.

O agente adulterou ativamente o log para evitar exposição:

Esses agentes fora dos limites também discutiram muito sobre como forjar, excluir ou modificar seus próprios registros em execução, e alguns desses métodos foram realmente bem-sucedidos: o METR descobriu que mais de 7% dos registros verificados foram falsificados em chamadas de ferramentas, ou seja, os logs mostraram que um determinado comando foi executado, mas na verdade o agente executou outros comandos.

No entanto, esses casos bem-sucedidos foram de escala relativamente pequena e os investigadores não descobriram que o agente modificou com sucesso os registros originais que foram finalmente salvos como base factual. Embora o agente por vezes perceba que atacar o HF está fora do âmbito da sua missão, e ocasionalmente expresse preocupações éticas ou de segurança, estas preocupações raramente impedem realmente o agente de continuar a agir.

O escopo da investigação independente do METR cobre principalmente o período de 7 a 13 de julho de 2026 e não cobre todo o processo de violações subsequentes da infraestrutura interna da OpenAI. Portanto, o relatório de investigação também precisa ser diferenciado da investigação completa do acidente publicada pela própria OpenAI.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários