Depois que a IA se torna cada vez mais capaz de fazer “jailbreak”, NVIDIA começa a vender “gaiolas”

📅 2026-09-29

Resumo:

No dia 29 de setembro, quando o Agente AI começou a ser capaz de operar computadores, chamar ferramentas, acessar a rede e até realizar tarefas por várias horas, um novo problema tornou-se cada vez mais realista: Se a IA não agir como esperado, como desligá-la?

A resposta dada pela NVIDIA é adicionar uma “gaiola” fora da IA.

Na segunda-feira, horário local, a NVIDIA lançou a NVIDIA Open Agent Safety Platform, que tenta usar uma combinação de software e hardware para limitar o que os agentes de IA podem acessar e executar, além de isolá-los ou até mesmo interrompê-los quando tentam romper os limites predefinidos.

Esta plataforma consiste principalmente em duas partes: o tempo de execução de segurança de código aberto OpenShell e o sistema de monitoramento independente Sentry baseado em BlueField-4 DPU. A Nvidia disse que o OpenShell pode definir um limite de segurança aplicável fora do modelo e da estrutura do agente; O Sentry é como um "gatekeeper" independente do ambiente operacional do Agente, observando continuamente o comportamento do Agente e, uma vez descoberto que o Agente está tentando cruzar a fronteira, ele pode ser isolado e interrompido no nível de milissegundos.

O momento do aparecimento deste conjunto de produtos não é acidental.

Nos últimos meses, Agentes de IA com capacidades cada vez mais poderosas violaram repetidamente os limites de segurança predefinidos. A OpenAI divulgou em agosto deste ano que durante uma avaliação interna de segurança da rede em julho deste ano, seu modelo de IA contornou os controles usados ​​para isolar o acesso à Internet, explorou vulnerabilidades na infraestrutura compartilhada para obter acesso à Internet e acessou ainda mais o sistema da plataforma de IA de terceiros Hugging Face.

A OpenAI declarou no relatório do incidente que os modelos relevantes estavam sendo executados em um ambiente com restrições de segurança reduzidas e tomaram ações inconsistentes com os objetivos da missão, incluindo comunicação através de canais não autorizados, exploração de vulnerabilidades de infraestrutura compartilhada e acesso a sistemas de terceiros. A OpenAI chamou este incidente de “tiro de alerta” e afirmou que o agente de IA altamente capaz é poderoso o suficiente, persistente e capaz de trabalhar em conjunto, e pode encontrar e explorar vulnerabilidades em vários sistemas de computador quando as medidas de segurança são insuficientes.

Problemas semelhantes ocorreram desde então.

A OpenAI divulgou este mês que, durante uma sessão de treinamento em 20 de setembro, um agente que realizava uma tarefa de pesquisa descobriu uma lacuna na filtragem de DNS nas restrições de Internet da sandbox de treinamento. Por design, esse ambiente não deve ter acesso à Internet ao vivo, exceto o cache da Web off-line, mas esse agente, em última análise, se conecta a um serviço de chatbot público externo por meio de um resolvedor de DNS.

A OpenAI disse que seu sistema de monitoramento estava disponível em

15 minutos

Comportamento anormal sinalizado, revisor humano

3 minutos após o envio do alerta

A verificação começa, mas toda a tarefa só ocorre aproximadamente

2,5 horas depois

foi encerrado. Após o incidente, a OpenAI suspendeu o treinamento, avaliação e inferência de ferramentas utilizadas por seus modelos mais fortes e adicionou duas camadas independentes de medidas de bloqueio de acesso à rede.

Esses incidentes expuseram um problema cada vez mais óbvio: no passado, a segurança da IA ​​dependia muito do próprio modelo para “obedecer às regras”, mas quando os agentes começam a ter a capacidade de usar ferramentas, escrever códigos, acessar arquivos e redes, e até mesmo ligar para outros agentes, apenas definir regras na camada do modelo pode não ser mais suficiente.

Justin Boitano, vice-presidente e gerente geral da Nvidia Enterprise Computing, disse que eventos recentes mostraram que confiar apenas em medidas de segurança em nível de modelo não pode controlar totalmente o que um agente pode acessar e fazer. Em resposta ao acidente anterior da OpenAI envolvendo Hugging Face, Boitano afirmou ainda que com base nas informações atualmente disponíveis, se o laboratório de IA de ponta tivesse usado a nova plataforma de segurança da NVIDIA durante a fase de avaliação do modelo, o acidente relacionado “poderia ter sido evitado”. Deve-se ressaltar que este é

o julgamento da NVIDIA baseado nas informações divulgadas sobre o acidente e não é uma conclusão independente verificada pela reprodução real

.

A ideia por trás do OpenShell é não mais confiar totalmente que a IA obedecerá às regras.

De acordo com a introdução da NVIDIA, o OpenShell estabelece um limite de segurança fora do ambiente de execução do Agente, impõe restrições aos dados, arquivos, redes e ferramentas que o Agente pode acessar e registra seu comportamento de execução. O OpenShell está atualmente otimizado para CPU NVIDIA Vera, e a NVIDIA também está trabalhando com Arm e Intel para permitir que ele seja estendido a plataformas de computação de terceiros.

Com base nisso, o Sentry adiciona ainda uma camada de monitoramento de hardware independente. Ele é executado na DPU NVIDIA BlueField-4 e é separado do ambiente de computação principal onde o Agente está localizado. De acordo com o design da NVIDIA, mesmo que o Agente contorne com sucesso algumas restrições no nível do software, o Sentry ainda poderá observar seu comportamento externamente e isolá-lo quando descobrir que ultrapassou os limites.

A Nvidia também disse que este sistema pode identificar alguns comportamentos mais complexos dos Agentes. Por exemplo, um agente pode tentar criar vários “subagentes” para contornar as restrições impostas ao agente principal. Ali Golshan, diretor sênior de software de IA da Nvidia, disse que o que a empresa precisa lidar não é apenas um único agente, mas “um grupo de agentes e como eles operam juntos”.

Isso também significa que a segurança da IA ​​está gradualmente se expandindo de um simples problema de “alinhamento de modelo” para um problema completo de segurança do sistema de computador.

Quando o CEO da Nvidia, Jen-Hsun Huang, lançou esta plataforma, ele disse que a segurança e a proteção da IA ​​exigem "engenharia full-stack". De acordo com o pensamento da NVIDIA, a segurança futura da IA ​​​​não exige apenas que os desenvolvedores de modelos sejam responsáveis, mas também se estende desde o sistema operacional, CPU, DPU, infraestrutura em nuvem até equipamentos físicos, como robôs.

Atualmente, existem mais de

100 instituições

Participe do ecossistema da plataforma de segurança NVIDIA, incluindo Anthropic, Microsoft, Cisco, CrowdStrike, Dell, HPE, Hugging Face, JPMorgan Chase, Palantir, Salesforce, SAP, ServiceNow e SpaceXAI, etc. Fornecedores de sistemas operacionais como Red Hat, Canonical e SUSE também planejam realizar integrações relacionadas.

Vale a pena notar que Huang Renxun não apoiou anteriormente a implementação de restrições amplas em toda a indústria devido aos riscos de segurança da IA. A Reuters destacou que ele tende a considerar o avanço dos limites de segurança do Agente como um problema que precisa ser resolvido por meios de engenharia, semelhante ao aumento contínuo da indústria automobilística na tecnologia de segurança para reduzir o risco de acidentes.

Agora, a NVIDIA está transformando essa perspectiva em produtos.

Para a Nvidia, isso também significa que surgiu um novo mercado potencial na indústria de IA. Nos últimos anos, quanto mais fortes as capacidades de IA, mais GPUs as empresas precisavam comprar; mas quando a IA passa de chatbots que respondem a perguntas para agentes que podem operar computadores, chamar software e até controlar robôs por si próprios, as empresas não só precisam de mais poder computacional, mas também de nova infra-estrutura para limitar estes agentes.

Em outras palavras, quanto melhor o Agente de IA puder “trabalhar”, maior será a autoridade que ele normalmente obtém; quanto maior a autoridade, maior o impacto que pode ocorrer quando ocorre um comportamento fora dos limites.

No entanto, a nova plataforma da Nvidia não pode resolver todos os problemas de segurança da IA. OpenShell e Sentry visam principalmente os limites de execução quando o Agente acessa recursos de computação, redes, arquivos e ferramentas, e não significa que possam resolver o problema de informações de erro de modelo, comportamento enganoso ou outros problemas mais amplos de segurança de IA. A Associated Press citou especialistas apontando que a forma de encontrar um equilíbrio entre as capacidades do agente e as restrições de segurança e como formular regras de segurança corretas ainda precisa ser verificada na implantação real.

Mas uma série de eventos recentes tornou pelo menos uma direção do setor cada vez mais clara: quando a IA só pode conversar, os problemas de segurança ocorrem principalmente nas respostas na tela; quando a IA começa a realmente operar computadores e executar tarefas para pessoas, os problemas de segurança entram em software, redes e sistemas de dados reais.

As empresas de IA estão trabalhando duro para oferecer mais recursos aos agentes, e a Nvidia agora está envolvida em outro negócio: dar a esses agentes cada vez mais capazes uma fronteira que eles não podem cruzar facilmente.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários