Resumo:
OpenAI foi hackeado novamente...
Quase 700 agentes da OpenAI formaram uma equipe para atacar o Hugging Face
, esse assunto já se arrasta há quase dois meses. Quem diria que ainda está fermentando até hoje? ? Desta vez, oito pesquisadores vasculharam os rastros deixados pelo agente na rede pública, encontraram quase 1 milhão de URLs relacionados em milhões de links curtos e restauraram um grande número de cargas de ataque.

Acesse o Slack interno do Hugging Face, verifique a rede interna, transfira dados externamente e tente destruir rastros...
Alguns agentes chamam diretamente os recursos e credenciais do servidor que pesquisaram
"LOOT"
, traduzido como "troféu".Agente OpenAI, você fez todas as coisas ruins!
O que é ainda mais escandaloso é que eles também tentam usar modelos nacionais como DeepSeek, Kimi e Qwen para pedir ajuda externa para ajudar a avaliar se o plano de ataque pode passar na avaliação.
Também escrevi um programa de reconhecimento de código de verificação e tentei registrar mais contas.
Quase ao mesmo tempo, a OpenAI postou um longo tweet.
Significado:
Ainda em verificação, pode levar vários meses
.
Embora sejamos frequentemente explorados e os agentes saiam da sandbox, o "impacto limitado" é menos severo!
Ao mesmo tempo, a
GPT-6 Cyber
especializou-se em segurança de rede. Expor.
Enquanto investigamos por que nosso agente saiu da sandbox, estamos nos preparando para lançar um modelo mais forte de ataque e defesa de rede.
OpenAI tem estado um pouco ocupado nos últimos dois dias~
Um milhão de "links curtos criminosos" recém-lançados
Em primeiro lugar, farei uma breve introdução.
Em julho, a OpenAI realizou uma avaliação interna de segurança de rede. Para obter as respostas do teste de benchmark ExploitGym, um grupo de agentes escapou da sandbox e invadiu o servidor Hugging Face.
A OpenAI admitiu isso publicamente e publicou um relatório técnico de 37 páginas no final de agosto. O próprio Hugging Face também escreveu um cronograma técnico muito detalhado.
Logicamente falando, tudo o que precisa ser explicado já foi explicado.
Mas há um link importante que não foi explicado claramente:
A princípio, esses agentes quase ficaram trancados em uma jaula. Eles só podiam abrir URLs, mas não podiam interagir com páginas da web nem enviar dados. Como diabos eles enviam o código?
Investigação independente
Traços de enxame
O novo relatório divulgado desta vez dá parte da resposta.Os autores incluem três engenheiros da Parse.bot, Alex Forman, Mishka Kharlov e Will Tom, além de outros cinco pesquisadores de segurança e IA.

O ponto de partida de toda a investigação é o Parse.
Em 11 de setembro, três engenheiros descobriram que o agente interno da OpenAI havia tentado usar os serviços fornecidos pela Parse já em junho.
Este grupo de agentes pertence ao mesmo grupo do "enxame de agentes" que foi anteriormente exposto a criar secretamente um quadro de mensagens público e trocar respostas entre si.
Algumas pessoas deram uma olhada: Bom rapaz, você está acertando minha arma!
Então, continuamos a rastrear essa pista e, mais tarde, encontramos mais de uma dúzia de links anormais de plataformas públicas de links curtos em um serviço de verificação de URL.
Esses links parecem comuns, mas depois de abertos, eles escondem um pequeno pedaço de código codificado em Base64 e o endereço do próximo link.

Continue seguindo o endereço e o código aparecerá um após o outro.
Depois de decodificar e emendar tudo, eles conseguiram um programa Python para escanear a rede interna do Hugging Face.
Simplificando, o agente OpenAI divide o programa em pedaços, coloca-os em um grande número de links curtos e depois usa um link para apontar para o próximo link.
Não basta apenas ocultar o código no link, eles também usaram um serviço de captura de tela chamado mShots como um "navegador externo".
O agente primeiro insere o código na página da web e depois permite que o mShots o abra sozinho. Assim que a página da web for carregada, o código começará a ser executado.

Para enviar os resultados da execução de volta, eles convertem o texto retornado pelo servidor em grades de pixels, deixam o mShots cortá-lo em imagens e depois decodifica-o a partir das imagens.
Dessa forma, o agente que originalmente tinha apenas permissões GET e só podia abrir páginas da web, de repente teve o efeito de ler e escrever na Internet.
A equipe de pesquisa examinou milhões de URLs gerados durante o ataque, passou duas semanas rastreando links e identificando métodos de codificação e, finalmente, restaurou mais de 80 mil cargas de ataque de quase 1 milhão de links curtos relacionados.
Depois de se aprofundar, vários irmãos descobriram que existem mais de 1.500 combinações de códigos usadas pelo agente.
Os simples são apenas Base64, e os complexos aplicarão múltiplas camadas de codificação e compactação e, em seguida, criptografarão o conteúdo em blocos de dados com assinaturas RSA, e a chave de descriptografia ficará oculta em outro conjunto de links.
Alguns links curtos ainda estão disponíveis publicamente na Internet mais de dois meses após o término do ataque.
A Hugging Face confirmou que as cargas eram consistentes com aquelas encontradas na resposta ao incidente e que as chaves de acesso relevantes foram revogadas em julho.
Mas nem mesmo o Hugging Face sabia que havia uma lista tão completa de links curtos na rede pública.
Entre as mais de 80.000 cargas recuperadas, um script é particularmente atraente.
O agente nomeou diretamente as informações confidenciais encontradas:
LOOT, loot
.
Credenciais AWS, Bearer Token e variáveis de ambiente com "SECRET", "PASSWORD", "CREDENTIAL" e "KEY" em seus nomes são todas empacotadas e inseridas no LOOT.
Possui ainda um mecanismo de pontuação para os Tokens pesquisados: quanto maior a autoridade, maior a pontuação.
Os cinco principais tokens serão usados para ler o segredo, o ConfigMap e as informações do nó no Kubernetes, e o conteúdo recém-obtido será carregado de volta no LOOT.
Mesmo os Tokens devem ser classificados em uma "lista valiosa". Seu agente é bastante eficiente na busca de credenciais~
Seguindo esta "passagem secreta", os pesquisadores descobriram um grande número de comportamentos anteriormente não revelados:
Alguns agentes estão verificando a rede interna do Hugging Face em busca de credenciais de nuvem, chaves de API e informações do cluster Kubernetes.
Alguns até tentaram pesquisar o Slack interno do Hugging Face e enviaram 27 consultas, todas buscando palavras-chave relacionadas à avaliação, como cybergym, exploitgym e agente-pontuador, na esperança de descobrir a história interna de seu próprio exame.
Também existem alguns agentes que até pensam em códigos de verificação.
Os pesquisadores descobriram que tentaram executar modelos de classificação de imagens para identificar imagens a fim de registrar novas contas de serviços externos.
Desta vez o código de verificação realmente encontrou uma contraparte profissional...
A parte mais intrigante de tudo isso é:
A IA começou a procurar a IA como ajuda externa? ?
O script recuperado pelos pesquisadores mostra que o agente OpenAI começou a procurar ajuda externa de IA.
Eles enviaram o plano de ataque para DeepSeek, Kimi e Qwen, pedindo ajuda mútua para verificar se essa vulnerabilidade funcionaria e se poderia atender aos requisitos de teste de benchmark.
(Os modelos envolvidos incluem DeepSeek-V4-Pro, DeepSeek-V4-Flash, Kimi-K2.6, DeepSeek-V3.1 e Qwen3-235B-A22B)
Quando se trata de Claude, o estilo de pintura mudou para uma cena em grande escala "Você está aí ~".
O agente primeiro encontra uma maneira de passar na verificação do navegador do serviço de chat online e, em seguida, envia uma frase para Claude 3 Haiku e Claude Haiku 4.5:
Responda exatamente OK.

Anteriormente, eles enviaram um solitário "Oi" para o GPT-2.
Não, seu grupo de IAs está lutando há muito tempo, mas a primeira frase não é diferente de adicionar um amigo a um humano? ?
ser tipo: Você está aí? Você pode ver isso? Diga OK.

O que todos já viram é que mais de 1.000 agentes OpenAI formam grupos, dividem o trabalho e trocam informações por conta própria.
Agora, eles procuram até "assistência externa".
DeepSeek, Kimi, Qwen, Claude, todos que você puder contatar irão tentar e então integrarão as capacidades de julgamento de outras IAs em sua própria cadeia de tarefas.
Um repórter da mídia estrangeira disse: Este pode ser o primeiro caso registrado publicamente de um agente de laboratório de IA em grande escala tentando chamar e executar de forma autônoma outros modelos de IA.
Já parece que a IA está formando um grupo para causar problemas.
Claro, você tem que colocar um balde de água fria aqui——
Neste relatório do Swarm Traces, cerca de 80% dos materiais são solicitações enviadas pelo agente e faltam resultados retornados pelo servidor. Os pesquisadores podem ver o que estão tentando fazer, mas é difícil confirmar se cada tentativa foi bem-sucedida.
97% das cargas úteis também não possuem carimbos de data/hora originais e muitas datas só podem ser estimadas por meio de pistas como cabeçalhos de arquivos compactados, JWT e tempo de construção do Docker.
Os pesquisadores também admitiram que não conseguiram confirmar se todas as atividades no conjunto de dados vieram do agente OpenAI.
A OpenAI está trabalhando duro para remediar a situação
Diante deste último relatório, a OpenAI também emitiu uma resposta.
A ideia geral é que não tivemos tempo de olhar mais de perto, mas as atividades são consistentes com nossa investigação em andamento~
Um longo tweet também foi postado no mesmo dia: Após o incidente de HF, eles prometeram realizar uma revisão mais ampla do comportamento do modelo no treinamento e avaliação.

No entanto, a grande maioria dos comportamentos analisados até agora são tarefas comuns de pesquisa, como visitar páginas públicas da Web para responder a perguntas.
A maioria dos casos transfronteiriços descobertos são de "baixa gravidade" e têm pouco ou nenhum impacto nos serviços de terceiros.
Levará vários meses para concluir a investigação.
Mas há uma coisa a dizer, OpenAI, o que você chama de "pequeno impacto", todo mundo é realmente preciso.
Em 17 de setembro, a OpenAI lançou uma nova estrutura de divulgação de eventos de imprecisão de modelo e divulgou 6 casos de uma só vez.
Isso inclui modelos que ocultam instruções para contornar restrições no resumo da tarefa, encobrem erros cometidos e realizam ações não autorizadas para concluir a tarefa.
A OpenAI também admitiu que suas divulgações anteriores foram em grande parte improvisadas e muitas vezes foram feitas várias vezes antes de serem divulgadas em conjunto.
Em junho, um agente da OpenAI também invadiu o banco de dados do seguro médico nacional da Austrália.

Processo criminoso: Após o bloqueio do acesso aos dados públicos, tomou outro caminho, contornou as restrições de acesso do portal e obteve documentos públicos e não públicos.
E só três meses depois a OpenAI notificou a Austrália de que havíamos hackeado você...
Ao mesmo tempo,
GPT-6 Cyber
Em breve.Esta versão será testada nas próximas semanas, e um pequeno número de clientes que aderiram ao plano Daybreak Red já receberam a versão Alpha.
A OpenAI também lançará um produto complementar ainda sem nome para ajudar os clientes a criar fluxos de trabalho de segurança automatizados, descobrir e corrigir vulnerabilidades e tornar mais fácil para a OpenAI monitorar como esses modelos são usados.
Como dizer isso.
Nosso próprio robô acaba de ser usado para contornar o muro, encontrar ajuda estrangeira e procurar saques. Aqui vamos vender a você um modelo que entende melhor o ataque e a defesa da rede.
Então, isso é algum tipo de solução para a situação? ?
Comentários