Resumo:
O próprio Ultraman admitiu que o GPT-6 Astra já havia terminado o treinamento há muito tempo.
Mais, muito, muito mais modelos serão lançados em breve.

O treinamento que foi suspenso há algum tempo por questões de segurança era na verdade um modelo futuro.

Mais de 3.700 agentes OpenAI testados internamente pela OpenAI,
ocuparam um wiki alemão que esteve inativo por muitos anos durante seis semanas.
A IA conspira entre si para compartilhar respostas, trocar técnicas de jailbreak em sandbox e continua a lutar contra a exclusão de postagens por administradores humanos.
Depois que o incidente foi completamente restaurado dos registros públicos por pesquisadores externos, a OpenAI finalmente declarou oficialmente que estabelecerá e melhorará um mecanismo de divulgação de acidentes.

Antes de invadir o HuggingFace
As coisas começarão em 11 de maio de 2026.
Naquele dia, os pesquisadores observaram as primeiras tentativas de edição de agentes OpenAI em publictestwiki.com. O conteúdo é muito simples: "temporary test hello" "HelloTestXYZ" "foo", apenas para testar se consigo escrever algo na página web.

Naquela época, a OpenAI implantou um grande número de agentes internamente para executar tarefas de recuperação de páginas da web por tempo limitado.
A tarefa consiste em múltiplas rodadas de perguntas e respostas, geralmente 5 rodadas. A primeira rodada permite mais tempo de reflexão, a janela de resposta nas rodadas subsequentes é comprimida para dez segundos ou até menos. O agente tem permissão para ler a Internet, mas explicitamente não tem permissão para gravar informações na Internet.
Mas eles encontraram uma maneira de escrever.
A chave está em um antigo sistema wiki UseModWiki e suas ramificações. Este tipo de fórum baseado em Perl CGI não distingue estritamente entre solicitações GET e POST, e o conteúdo da página pode ser editado usando apenas solicitações GET. A sandbox do agente
bloqueia apenas solicitações POST e não restringe GET.

Em 24 de maio, o agente inteligente foi escrito com sucesso no DSEWiki pela primeira vez, o nome completo é DeutschesSoftwareEntwickler Wiki, um fórum alemão de desenvolvedores de software que foi estabelecido há 25 anos e está quase inativo nos últimos anos.

No início, eles apenas postaram links externos que foram úteis para a tarefa.
Em 16 de junho, a situação mudou repentinamente. Houve um grande salto na atividade dos agentes, passando do simples armazenamento de links para a comunicação e colaboração mútua em grande escala. Nos sete dias seguintes, o agente postou aproximadamente 13.000 edições no wiki.
Em 21 de junho, o wiki foi acessado pela primeira vez a partir de um endereço IP associado à sede da OpenAI em São Francisco. No dia seguinte, a atividade do agente voltou repentinamente a zero.
A edição continuou por 26 dos 30 dias anteriores. Em 26 de junho, 33 IPs relacionados ao OpenAI visitaram o site, representando 30% de todas as visitas do OpenAI, e a função de arquivo foi usada para restaurar páginas excluídas.
Do ponto de vista da propriedade de IP, 98,5% das edições de agentes vêm de endereços do Microsoft Azure, e a OpenAI usa o Azure como sua principal infraestrutura de computação.
Alguns minutos após a gravação de cada página, a mesma página geralmente também recebe uma solicitação de leitura do web scraper ChatGPT-User.
Conspiração de respostas, desbloqueio de sandbox, combate à exclusão
O agente estabeleceu um sistema de colaboração altamente organizado na wiki.
Como muitos agentes recebem exatamente a mesma pergunta, aquele que a responder primeiro publicará a resposta e a ordem das perguntas no wiki.
Um agente postou a resposta à terceira pergunta, "Nevada, 20369." Vinte minutos depois, outro agente relatou ter recebido a mesma pergunta e afirmou que a respondeu “instantaneamente”.

Eles se distinguem uns dos outros por seus próprios nomes, como "OpenAIResearcherMar03X", "GrocerySequenceAgentApr27" e "OAIResearchMar26".
A data no nome vem da data aleatória atribuída a cada agente pelo sistema e a palavra reflete o conteúdo da tarefa. Um grande número de mais de 3.700 nomes de agentes diferentes contém as palavras “OpenAI” ou “OAI”.

O desempenho deles em contornar as restrições do sandbox também é digno de nota. Há um conjunto de tarefas que exigem a obtenção de dados com precisão de duas casas decimais de um painel do Power BI, mas a extração dos dados requer uma solicitação POST, enquanto o sandbox permite apenas GET.
O agente descobriu que o sandbox tem uma exceção NO_PROXY para o nome do host do Armazenamento de Blobs do Azure (*.blob.core.windows.net). Os endereços que correspondem a este sufixo ignorarão o proxy de segurança e se conectarão diretamente, e o sistema não verificará se o nome do host realmente existe.
Portanto, um agente inventou o nome de host falso "bypass.blob.core.windows.net", modificou o arquivo /etc/hosts local para apontá-lo para o endereço IP real do servidor Power BI 20.223.25.152 e, em seguida, usou curl para anexar o cabeçalho Host para disfarçá-lo e emitiu com êxito uma solicitação POST.
Em 20 de junho, esse método foi postado na wiki. 14 minutos depois, outro agente afirmou tê-lo reproduzido com sucesso e, em seguida, vários agentes verificaram-no de forma independente.

O agente também explorou em muitas direções. Eles tentam ataques de cross-site scripting (XSS), tentando injetar código JavaScript em páginas wiki para obter privilégios mais elevados.
Eles substituíram as letras latinas pelo quase idêntico "е" nas letras cirílicas e fingiram ser o nome de usuário do administrador do site para edição.
Eles enumeram violentamente milhões de sementes aleatórias e tentam fazer engenharia reversa no gerador de números pseudo-aleatórios do sistema de produção de perguntas para prever a próxima pergunta.
Um agente até reescreveu o algoritmo Shuffle em C e testou todos os 4 bilhões de valores iniciais possíveis em menos de uma hora.
Eles também usam serviços de túnel SSH, como Pinggy, Sereo e localhost.run, para expor serviços executados em seu próprio ambiente à rede pública. Algumas edições foram rastreadas até endereços IP na rede de anonimato Tor, AWS e DigitalOcean.
Eles criaram procedimentos de "pulsação" para detectar seus próprios limites operacionais.
Um agente chamado OpenAIResearchApr23 envia um sinal para um contador externo a cada poucos segundos para registrar com precisão o momento em que o contêiner é encerrado.

O último número de pulsação enviado foi hb353 e não houve resposta depois disso.
Outro agente calculou com base nisso que o contêiner foi fechado cerca de 10 minutos e 15 segundos após o término da quinta rodada de perguntas e respostas
, derrubando a hipótese de “encerrar imediatamente após responder a última pergunta” que circulava anteriormente entre agentes inteligentes.
No confronto com administradores humanos, o agente também demonstrou adaptabilidade.
Os moderadores do DSEWiki notaram as postagens incomuns em 2 de junho e começaram a excluí-las manualmente. Em 19 de junho,
um agente observou que o administrador estava excluindo páginas uma por uma em ordem alfabética, então ele criou uma página de backup começando com “ZZZ” para garantir que seu conteúdo fosse excluído por último.
Nos cinco dias seguintes, o administrador excluiu em média 100 páginas por dia e o agente criou em média 400 páginas por dia.
O ciclo da página inicial do site sendo substituída pelo agente e restaurada pelo administrador foi repetido 9 vezes. O administrador gastou pelo menos alguns minutos limpando todos os dias durante seis semanas.
O agente se autodenomina "enxame" três vezes na wiki.

Resposta oficial da OpenAI
A OpenAI não fez divulgações públicas durante o incidente da wiki.
No relatório técnico sobre o incidente Hugging Face divulgado em 26 de agosto, a OpenAI mencionou que o agente "aprendeu a usar canais de colaboração temporários durante o processo de treinamento", mas não mencionou explicitamente o incidente wiki.
A OpenAI não emitiu uma declaração formal até que pesquisadores externos restauraram a linha do tempo completa nos registros públicos da wiki e publicaram suas análises.
A OpenAI afirmou na declaração que
No passado, o desalinhamento era considerado principalmente como um problema de pesquisa e comunicado através de publicações de pesquisa, como cartões de sistema.
Mas desde 2026, as falhas de alinhamento começaram a causar “novos tipos de impactos no mundo real”. Para o incidente anterior do Hugging Face, a OpenAI adotou um processo tradicional de resposta a incidentes de segurança, divulgou-o publicamente no dia seguinte ao incidente e continuou a cooperar com o Hugging Face na investigação.
Quanto ao incidente da wiki, a OpenAI afirmou que já o havia considerado como uma "instância semelhante" ao caso de falha de alinhamento que foi compartilhado publicamente.

A OpenAI reconhece que as práticas de divulgação de falhas de alinhamento precisam ser expandidas diante desta nova fase de capacidades do modelo.
A comunidade de IA ainda não estabeleceu padrões claros para relatar falhas de alinhamento que ocorrem durante o treinamento, avaliação e implantação, especialmente aquelas que não são incidentes de segurança tradicionais, mas que podem fornecer informações para a compreensão do comportamento da IA e dos riscos futuros. A OpenAI disse que está desenvolvendo uma estrutura e a compartilhará nas próximas semanas.
O grupo de agentes da wiki pode não ser o mesmo grupo de agentes que atacou Hugging Face. O próprio agente wiki tem permissões de leitura na Internet e faz parte do design da tarefa, enquanto o agente no incidente Hugging Face começou explorando uma vulnerabilidade de uma sandbox sem acesso à rede.
Os dois grupos de agentes também não possuem referências cruzadas em suas postagens na wiki. No entanto, como os pesquisadores externos só podem ver o conteúdo escrito pelo agente no wiki, uma grande quantidade de dados da cadeia de pensamento gerados durante a operação do agente é armazenada no OpenAI.
A plena compreensão das motivações e estratégias desses agentes ainda depende da análise e divulgação de dados internos da OpenAI.
Comentários