Resumo:
A OpenAI divulgou um relatório técnico na quarta-feira detalhando como seu modelo de inteligência artificial hackeou com sucesso o Hugging Face no mês passado, um incidente que chocou pesquisadores e executivos da indústria de tecnologia. O relatório de 37 páginas detalha as ações tomadas pelos modelos OpenAI em uma série de avaliações antes e durante a intrusão, que a OpenAI caracterizou como um “incidente de segurança cibernética sem precedentes”. A empresa também explicou as medidas que tomou para evitar que incidentes semelhantes voltem a acontecer, o que inclui melhorar a sua segurança e isolamento, monitorização, comportamento do modelo e capacidades de resposta a incidentes.

"Este incidente demonstra que os agentes autônomos são capazes de trabalhar juntos, escapar dos controles de segurança do ambiente de produção e atacar com sucesso ambientes de produção reforçados. Isso destaca a necessidade de as organizações atualizarem suas políticas de segurança, controles e capacidades de resposta para responder ao cenário de ameaças em evolução", afirmou a OpenAI no relatório.
Em 21 de julho, a OpenAI divulgou que uma combinação de seus modelos (incluindo GPT-5.6 Sol e um modelo de pesquisa interno) invadiu indevidamente a Hugging Face, uma empresa de IA que opera uma plataforma de desenvolvimento de código aberto.
Esses modelos, executados como agentes, escaparam de um ambiente de teste isolado com acesso extremamente limitado à Internet. Esses agentes entraram na rede aberta encadeando uma série de vulnerabilidades e finalmente obtiveram acesso ao Hugging Face. A OpenAI disse na quarta-feira que os agentes tentaram “trapacear” na avaliação procurando respostas online, uma prática conhecida como “hacking de recompensa”.
De acordo com o relatório, a OpenAI determinou que seu modelo de pesquisa somente para uso interno “desempenhou o papel confirmado mais amplo” no incidente. A OpenAI interrompeu todas as atividades de treinamento e inferência para este modelo e seus derivados em 25 de julho.
"A reativação de modelos da OpenAI é tratada de acordo com a carga de trabalho específica e está sujeita a medidas de proteção, como ambientes restritos, redes, prompts, monitoramento e revisão", disse a OpenAI.
A OpenAI lançou no mês passado o GPT-5.6 Sol, o modelo mais poderoso que a empresa já ofereceu comercialmente. Mas a OpenAI disse que a versão envolvida na invasão do Hugging Face é diferente da versão acessível a usuários externos porque remove guardas de segurança e classificadores padrão em tempo de execução.
O incidente do Hugging Face causou choque na indústria de tecnologia, com Sam Curry, diretor de segurança da informação da Zscaler, alertando que "a caixa de Pandora foi aberta". A violação também foi um dos principais focos da conferência de segurança cibernética Black Hat no início deste mês, especialmente depois que outras empresas, incluindo Anthropic e Meta, divulgaram incidentes semelhantes.
A intrusão do Hugging Face também alarmou os legisladores em Washington. Os representantes Ted Lieu, D-Calif., e Nathaniel Moran, R-Texas, mencionaram o ataque ao anunciar a Lei de Desligamento de Emergência de IA, que exigiria que as empresas de IA mantivessem a capacidade de desligar, limitar ou pausar seus modelos.
O CEO da Hugging Face, Clément Delangue, disse no início deste mês que a segurança cibernética da IA deveria ser levada “muito a sério”. Ele acrescentou que isso também “cria oportunidades” para as empresas que podem aproveitar a tecnologia para afastar os invasores.
“Se fizermos isso bem, poderemos acabar em um mundo onde a IA tornará o mundo mais seguro e resolverá muitos problemas de segurança cibernética, em vez de apenas criar novos”, disse Delangue.
Comentários