O novo modelo da OpenAI cai em controvérsia fora de controle, responde o cientista-chefe

📅 2026-09-03

Resumo:

Em 2 de setembro, o cientista-chefe da OpenAI, Jakub Pachocki, postou uma mensagem nas plataformas sociais em resposta à recente controvérsia em torno do novo modelo “não monitorável” do Astra. A controvérsia surge no dia anterior, quando surgiu a notícia de que o próximo modelo Astra da OpenAI usa uma tecnologia de inferência chamada Recurrent Depth.

Neste modo, o mesmo conjunto de camadas do Transformer é calculado repetidamente, e parte do processo de raciocínio ocorre dentro do modelo, e nem tudo precisa ser apresentado na forma de uma cadeia de pensamento, por isso também é chamado de "loop opaco".


Pachocki expressou a esperança de evitar uma corrida armamentista rumo a um estado não monitorável causado por informações imprecisas - isto é, grandes laboratórios competindo para desenvolver modelos que são demasiado poderosos para serem monitorados e revisados ​​por seres humanos, levando a uma falha completa do controle de segurança.

Ele enfatizou que a profundidade gráfica computacional dos modelos de ponta, incluindo o Astra, não é mais do que o dobro da do GPT-4, indicando que a arquitetura do modelo não sofreu um salto em complexidade como temido pelo mundo exterior.

A profundidade do gráfico de cálculo aqui se refere à cadeia mais longa de etapas de cálculo que devem ser executadas sequencialmente para completar uma tarefa de inferência e não podem ser aceleradas em paralelo. No passado, os cálculos intracamadas na arquitetura comum do Transformer podiam ser massivamente paralelos e a profundidade da serialização era aproximadamente igual ao número de camadas do modelo.

A profundidade do ciclo dos rumores de mercado pode iterar o mesmo conjunto de módulos para múltiplas rodadas de pensamento, aumentando a profundidade do raciocínio interno antes de gerar o próximo token (elemento de palavra), em vez de depender apenas de cadeias de pensamento de texto visíveis mais longas, o que pode melhorar a matemática, a codificação e outros desempenhos e reduzir custos.

O risco implícito de segurança dessa arquitetura é que quando a profundidade do gráfico de cálculo é extremamente alta, o modelo pode concluir implicitamente um grande número de etapas de raciocínio internamente sem cuspir toda a cadeia de pensamento na saída. Os humanos não serão capazes de ver o processo de pensar, planejar e encontrar lacunas e então entrarão em um estado não monitorável. A auditoria de segurança e o monitoramento da cadeia de pensamento falharão.


Depois que as notícias relevantes foram divulgadas, a comunidade de segurança de IA reagiu fortemente. Buck Shlegeris, CEO da Redwood Research, uma organização sem fins lucrativos de segurança de IA, escreveu que estava “extremamente preocupado”. Com base no incidente anterior do modelo OpenAI atacando a comunidade Hugging Face, ele disse que não tem certeza se a monitorabilidade da cadeia de pensamento do Astra é muito pior do que o modelo anterior, mas se esta tecnologia for promovida ainda mais e o número de ciclos aumentar muito, a monitorabilidade da cadeia de pensamento será completamente destruída. Isto é particularmente preocupante porque se os investigadores não conseguirem ver a cadeia de pensamento, será mais difícil investigar os incidentes de segurança relacionados, o que é realmente assustador.

Ryan Greenblatt, cientista-chefe da Redwood Research que esteve envolvido na investigação do incidente de segurança Hugging Face, também disse que este pode ser o revés mais sério na segurança da IA ​​até agora. Zvi Mowshowitz, um escritor que há muito se preocupa com a segurança da IA, criticou esta tecnologia como "brincando com fogo" e até disse que são necessárias leis para evitar a competição entre laboratórios de IA para padrões mais baixos.

Pachoki admitiu na sua resposta que a monitorização da cadeia de pensamento é de facto frágil e está a desenvolver-se numa direcção mais difícil, mas não é causada por mudanças arquitectónicas. A OpenAI está comprometida em manter e utilizar o monitoramento da cadeia de pensamento desde seus primeiros modelos de inferência e acredita que esta tecnologia pode ajudar a observar como as capacidades de alinhamento do modelo se generalizam a partir da distribuição do treinamento. O reforço da monitorização das cadeias de pensamento continua a ser o objectivo central dos actuais projectos de investigação.

A OpenAI declarou que implementará monitoramento adicional da cadeia de pensamento para a Astra para detectar e conter rapidamente possíveis más condutas. De acordo com as notícias do mercado, o uso da tecnologia de profundidade de loop pelo Astra é limitado e ainda se espera que a cadeia de pensamento do modelo permaneça legível. Plataformas como Anthropic e Google DeepMind do setor já discutem tecnologias semelhantes.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários