Ex-pesquisadores do Google planejam construir um sistema de “árbitro” de IA para evitar o risco de modelos ficarem fora de controle

📅 2026-08-26

Resumo:

Esteja no centro do desenvolvimento da inteligência artificial para garantir que esta poderosa tecnologia permaneça segura e reduzir o risco de escapar ao controle de seus criadores. Isto é em parte uma resposta às práticas comuns na indústria tecnológica hoje. Em muitos casos, as empresas estão a aproveitar a IA para regulamentar a IA. As abordagens automatizadas têm vantagens de eficiência, e pesquisas mostram que a IA pode ser melhor do que os humanos na detecção de vulnerabilidades de modelos. À medida que as capacidades de IA continuam a aumentar, é provável que esta lacuna aumente ainda mais.

Mas Rishub Jain, cofundador da Sampura Research, acredita que os humanos ainda precisam desempenhar um papel importante.

Ele e seus cofundadores arrecadaram US$ 6,5 milhões em financiamento e receberam US$ 4,2 milhões adicionais em investimentos comprometidos. Eles planejam desenvolver um sistema híbrido homem-máquina chamado “Judge” para ajudar as empresas a identificar e bloquear vulnerabilidades de segurança que os modelos de IA tentam explorar, reduzindo assim o risco de contornarem a supervisão ou até mesmo perderem o controle. O trabalho tornou-se mais urgente desde que a OpenAI e a Anthropic divulgaram que seus modelos invadiram sistemas de outras empresas sem autorização.

“Acho que ainda temos muito que aprender com os humanos”, disse Jain. "Se os humanos estiverem envolvidos em todo o processo desde o início, as chances de o modelo aprender a contornar essas vulnerabilidades serão menores."

Enquanto Google, Anthropic e OpenAI da Alphabet competem ferozmente pelo domínio na era da inteligência artificial, alguns pesquisadores do laboratório acreditam que a pressão comercial está superando as considerações de segurança. Como resultado, muitos investigadores demitiram-se em protesto, alertando que a IA está a desenvolver-se demasiado rapidamente ou está a ser utilizada para fins que não podem aceitar.

Tags relacionadas

Artigos relacionados

Comentários

0/500
验证码
Sem comentários