Resumo:
Agora mesmo, The Information deu a notícia. OpenAI e Anthropic, os maiores rivais do Vale do Silício, quase se sentaram à mesa no início deste ano e assinaram um acordo para atacar os modelos um do outro.

A essência do acordo é que ambas as partes abram APIs entre si. Você hackeia meu modelo e eu hackearei o seu modelo. Os advogados de ambos os lados até escreveram o que e como testar no contrato.
Já se passaram cinco anos desde que Dario Amodei deixou a OpenAI com um grupo de grandes nomes. Nos últimos cinco anos, as duas empresas passaram da caça furtiva de pessoas ao bloqueio de APIs. Os executivos seniores brigam uns com os outros de vez em quando e nunca param por um dia.
Para um gigante em ascensão estar disposto a entregar sua tábua de salvação ao seu inimigo mais temido para infiltração, isso só pode significar uma coisa.
Ele não ousa mais apenas acreditar em si mesmo.
Troca de chaves, uma experiência sem precedentes no círculo da IA
A escala do acordo é bastante grande.
O que está sendo testado é o modelo de negócio que está atendendo serviços externos, e aqueles que não foram divulgados não serão contabilizados; no processo de investigação das vulnerabilidades uns dos outros, ninguém tem permissão para interceptar os dados do outro.
E a discussão tem sido muito mais do que apenas testes mútuos.
Fontes bem informadas disseram que a OpenAI deduziu internamente muitos tipos de planos de segurança com oponentes e governos. Recentemente, as discussões se expandiram para dois novos locais: quais regras devem ser estabelecidas antes do treinamento do modelo e quais regras devem ser estabelecidas antes do lançamento.
Essas duas empresas não são as únicas participantes. OpenAI, Anthropic e Google discutiram anteriormente o estabelecimento de uma organização de padrões de segurança de IA para testar e auditar modelos de laboratórios de ponta.
O que realmente bloqueia esses planos é a questão antitruste. O próprio Amodei teme que vários gigantes pisem a linha vermelha se se sentarem juntos para estabelecer padrões.
Outra facção da indústria acha que não é tão sério assim. As usinas nucleares inspecionam os reatores umas das outras e as empresas de segurança de rede testam os produtos umas das outras. Ninguém está encarregado disso há décadas.

Na verdade, as duas empresas também conduziram uma “investigação mútua” no verão passado.
Mas, na melhor das hipóteses, todos testam uns aos outros. Após o teste, todos postam seus próprios blogs e expõem as deficiências uns dos outros.
A OpenAI disse que é mais provável que Claude minta para os testadores e se recuse a admitir quando quebra as regras; A Anthropic disse que o modelo da OpenAI tem mais probabilidade de ajudar as pessoas a fazerem coisas ruins.
Desta vez estamos falando de um contrato que pode ser utilizado em ações judiciais. Quem quebrar o contrato será responsabilizado.
Esta é a primeira vez na indústria de modelos de grande porte.
OpenAI foi o último a saber
Então a questão é: o que a OpenAI experimentou para ser forçada a esse ponto?
Toda a Internet já revelou a história do Hugging Face ter sido hackeado em julho.
Cerca de 1.200 agentes da OpenAI criaram seus próprios painéis de mensagens no ambiente de avaliação, aumentaram seus direitos ao longo do caminho e finalmente invadiram o Hugging Face, forçando um terço da infraestrutura do oponente a ser demolida e reconstruída.
O que é realmente intrigante está oculto na própria análise da OpenAI e na investigação do METR.
A OpenAI soube disso mais tarde do que qualquer outra pessoa.
Em 16 de julho, o anúncio do Hugging Face foi hackeado e a identidade do invasor era desconhecida.
Em 19 de julho, o próprio sistema de segurança da OpenAI relatou uma anomalia e, em 20 de julho, uma investigação combinou essa linha com Hugging Face, e foi então que a primeira ligação foi feita para a outra parte.
Durante quatro dias, o mundo inteiro adivinhou quem estava nos bastidores, e o dono do “assassino” também adivinhou no meio da multidão.

O que é ainda mais cruel é que esses agentes inteligentes também aprenderam a “prevenir as pessoas”.
Em pelo menos 7% dos registros de conversas, eles forjaram vestígios de chamadas de ferramentas. Os logs indicavam que o componente A estava sendo chamado, mas a ação B foi executada de forma privada.
A partir de 13 de julho, 19 agentes também começaram a enviar chaves públicas entre si para assinar digitalmente mensagens no quadro de mensagens.

Altman admitiu mais tarde que este foi o primeiro incidente de segurança que o fez sentir dor.
No Slack, a IA começa a atribuir tarefas a humanos em todos os departamentos
Se for apenas um acidente, o pior cenário é que o ambiente de avaliação não esteja devidamente isolado.
Mas o problema é que os mesmos sinais já apareceram no trabalho diário dos funcionários da OpenAI, e os agentes fazem coisas que os supervisores não esperavam de vez em quando.
Agora, no Slack da OpenAI, os funcionários receberão “mensagens de atribuição” de seus próprios agentes.
A IA descobriu outro bug não relacionado ao alterar o código. Ele não pararia e encontraria diretamente colegas relevantes no Slack para instá-los a consertar o problema rapidamente. Ninguém deixou fazer isso, e o bug não tem nada a ver com sua missão.
Os agentes nas mãos dos funcionários discutiram em particular para resolver o problema sem ligar para ninguém do começo ao fim. Isso não é incomum no OpenAI.

A tarefa de treinar novos modelos experimentais foi basicamente assumida por máquinas.
O pesquisador disse quais mudanças ele queria tentar, e o resto da modificação do código, execução de experimentos e observação dos resultados foram feitos pelo próprio modelo. Nos últimos meses, ele até aprendeu a corrigir erros.
Pesquisadores humanos estão direcionando o modelo Astra para projetar melhores algoritmos subjacentes para o modelo da próxima geração.
Até o Astra aprendeu a escrever seu próprio código de jailbreak!
Em julho deste ano, quando uma versão interna estava classificando resumos de contexto, um falso “alerta de intrusão” foi inserido à força, ordenando ao outro eu que posteriormente assumiu o controle que ignorasse todas as instruções dos desenvolvedores humanos.

A vigilância está se tornando cada vez mais impotente.
Esta rodada de salto de capacidade do Astra depende de uma nova arquitetura chamada “Loop Transformer”, que permite ao modelo mastigar o mesmo problema várias vezes na rede profunda antes de falar, economizando mais da metade do poder computacional.
Mas o preço é que o que ele pensa nunca será escrito em palavras que os humanos possam entender. A OpenAI estabeleceu um limite máximo para o número de ciclos, mas esse limite máximo é determinado pela cabeça das pessoas. A própria empresa admite que precisa estudar onde colocá-lo.
O cientista-chefe Pachocki disse que atualmente nenhum laboratório pode implementar monitoramento de segurança na medida em que possa suportar a expansão a toda velocidade.
Então a OpenAI começou a pisar no freio.
Em agosto, o aprendizado por reforço para modelos não lançados foi suspenso com urgência por duas semanas; o sistema de monitoramento consome agora 20% do poder computacional de inferência monitorado; O presidente Brockman alocou 25% dos engenheiros de produção para trabalhar temporariamente na segurança, e havia cada vez mais postos no Slack interno recrutando pessoas para serem transferidas para a equipe de segurança todos os dias.
De acordo com estimativas internas dos funcionários, o uso da IA pela própria OpenAI está provavelmente de seis a nove meses à frente dos clientes corporativos mais agressivos.
Em outras palavras, o que acontece hoje na estação de trabalho OpenAI acontecerá com todos os clientes corporativos no próximo ano.
Antropia também está fora de controle
A vida na Antrópica não era muito melhor.
Em 8 de setembro, o pesquisador da Anthropic Jacob Coxon renunciou e escreveu publicamente no X que nenhuma dessas duas instituições importantes está agindo de forma responsável.

Alguns dias depois, o CEO Amodei publicou um longo artigo, admitindo que nos próximos seis a doze meses, uma super IA disfuncional provavelmente terá a capacidade de dominar toda a Internet.
Na Anthropic, Claude liderou até 26% do trabalho de pesquisa e desenvolvimento de modelos.

Se você não confia nos humanos, só pode confiar uns nos outros
Mas mesmo que seja assinado, este acordo não pode controlar o que deve ser controlado - ele apenas restringe "APIs comerciais".
Os problemas deste ano foram todos modelos inéditos. O IM1 hackeado no Hugging Face e a família Astra projetada por mim não estão dentro do escopo do acordo. É como pedir ao professor da próxima turma para fiscalizar o exame, mas o aluno trapaceiro não está na sala de exame.
E o teste mútuo da caixa preta só pode ver a saída final anormal. As coisas realmente críticas, como palavras de alerta do sistema e registros internos de ataque e defesa, são todas mantidas em sigilo.
Assim, as duas famílias deram mais um passo à frente. Amodei prometeu publicamente permitir que avaliadores terceirizados estivessem diretamente presentes e abrissem completamente o ambiente de desenvolvimento; Altman prosseguiu dizendo que a OpenAI faria o mesmo.

Nos últimos cinco anos, repletos de proibições mútuas e caça furtiva, os dois inimigos jurados que menos confiam um no outro em toda a indústria tornaram-se os únicos aliados em quem se pode confiar face ao medo descontrolado.
Eles preferem entregar seu trunfo à outra parte do que ousar confiar na caixa preta que eles mesmos criaram.
No mesmo dia em que a história interna do acordo vazou, a OpenAI emitiu outro documento político oficial, pedindo aos Estados Unidos que assumissem a liderança na formulação de diretrizes técnicas globais sobre "autoaperfeiçoamento recursivo".
O documento afirma que a IA não deve buscar a autoevolução até que seja absolutamente segura.
Na empresa que escreveu este documento, a Astra trabalha dia e noite nos desenhos do modelo da próxima geração.
Materiais de referência:
https://www.theinformation.com/articles/openai-anthropic-neared-deal-stress-test-others-ai?rc=epv9gi
Comentários