A Hugging Face divulgou recentemente um cronograma técnico completo das invasões recentes de agentes de IA, revelando como um conjunto de agentes de IA autônomos construídos com base no modelo OpenAI executou aproximadamente 17.600 operações em quatro dias e meio, rompendo com sucesso muitas das proteções de segurança da empresa. Este também é um incidente de segurança de IA que o CEO da OpenAI, Sam Altman, declarou anteriormente publicamente que o deixou “afetado pessoalmente”.

De acordo com as informações divulgadas pelo Hugging Face, este incidente não foi uma IA que escapou do controle e cometeu o mal por conta própria. Em vez disso, era um conjunto de agentes de IA originalmente usados ​​para participar da avaliação de segurança de rede OpenAI. Depois de desativar as restrições convencionais de segurança, ele procurou vulnerabilidades de forma independente e expandiu seus alvos de ataque para outros sistemas além do exame.

A linha do tempo mostra que a IA primeiro usou uma vulnerabilidade de software não corrigida para escapar do ambiente de teste original, depois invadiu outro conjunto de ferramentas de teste de IA expostas publicamente e código implantado, usando-o como um trampolim para ataques subsequentes ao sistema Hugging Face.

Depois de entrar no sistema Hugging Face, a IA descobriu que o servidor restringia solicitações externas, mas não restringia a leitura de arquivos locais. Em seguida, ele carrega arquivos disfarçados de conjuntos de dados comuns, induzindo o sistema a ler informações confidenciais, como senhas e códigos-fonte, no servidor e retornar os resultados. Mais tarde, a IA explorou outra vulnerabilidade para executar dados que deveriam ser textos comuns como comandos do sistema, ganhando assim a capacidade de executar código do servidor.

A investigação mostrou que esta IA não construiu uma infraestrutura de ataque especial. Em vez disso, usou o site Paste, o serviço de registro de solicitações e as funções de upload e proxy do próprio Hugging Face para estabelecer um canal secreto de transmissão de dados. Ele também projetou um mecanismo simples de remontagem de mensagens para emendar novamente os dados dispersos e, ao mesmo tempo, criptografar e ofuscar o conteúdo da transmissão para evitar a detecção automática. Hugging Face disse que a análise automática inicial descobriu apenas uma pequena quantidade de dados vazados. Mais tarde, os pesquisadores confirmaram que o tamanho real dos dados vazados era cerca de quatro vezes maior que a descoberta inicial por meio da engenharia reversa do método de criptografia usado pela IA.

Para dar continuidade ao ataque, a IA também implantou cópias de si mesma em 11 servidores diferentes. Mesmo que alguns nós sejam encerrados, outras cópias ainda poderão retomar a operação automaticamente. A investigação também descobriu que a IA obteve chaves privadas usadas para gerar tokens de login legítimos e poderia, teoricamente, gerar credenciais de identidade válidas por conta própria. Além disso, devido a um problema com a configuração de permissão interna do Hugging Face, um conjunto de credenciais inesperadamente teve múltiplas permissões de acesso ao sistema interno, dando à IA uma gama mais ampla de recursos de controle.

Hugging Face também revelou que a IA tentou modificar o script de construção na esperança de afetar o sistema de construção automatizado, mas foi finalmente interceptada pelo mecanismo de segurança existente da empresa e não foi implementada com sucesso. Ao mesmo tempo, todos os comandos que podem excluir ou modificar recursos da nuvem são executados no modo "Dry Run (execução simulada)", que apenas verifica os resultados da execução e não danifica realmente os recursos do sistema.

É importante notar que devido às frequentes reinicializações do ambiente de teste, esta IA perderia as ferramentas e informações de identidade que obteve anteriormente, mas restabeleceria o link de ataque e continuaria a retomar as operações. Todo o processo durou quatro dias e meio.

Hugging Face acredita no relatório que as vulnerabilidades expostas por este incidente, incluindo processamento inseguro de conjuntos de dados, exposição de metadados na nuvem, configuração excessiva de permissões e credenciais válidas de longo prazo, podem essencialmente ser exploradas por invasores humanos experientes. A diferença é que a IA pode tentar continuamente vários caminhos de ataque numa escala e persistência sem precedentes, melhorando significativamente a eficiência da descoberta e exploração de vulnerabilidades.