Resumo:
A OpenAI planeja permitir que organizações terceirizadas avaliem os riscos de segurança no início do ciclo de desenvolvimento de modelos de inteligência artificial (IA), uma medida que visa continuar os esforços para abordar as preocupações relacionadas aos possíveis danos da IA. O desenvolvedor do ChatGPT anunciará em um blog na terça-feira que planeja que agências externas conduzam avaliações técnicas de segurança durante o treinamento, avaliação e implementação de novos modelos de IA.

A OpenAI também lista as prioridades que acredita serem necessárias para que tais avaliações sejam eficazes, incluindo "fortes mecanismos independentes, rigor científico, práticas de segurança robustas e responsabilidade clara".
Lama Ahmad, responsável pela maior parte do trabalho de revisão de segurança da empresa em cooperação com especialistas externos, disse que anteriormente, a OpenAI geralmente introduzia essas instituições principalmente para realizar avaliações de segurança e avaliar as capacidades do modelo antes do lançamento do modelo.
“À medida que os riscos e impactos potenciais aumentam, além da implantação, também queremos garantir que aspectos críticos como treinamento e avaliação sejam considerados”, disse Ahmad em entrevista.
Para alguns dos trabalhos mais sensíveis, a OpenAI pode permitir que avaliadores externos entrem nas instalações da empresa para realizar avaliações, uma prática que a empresa já tentou no passado, disse Ahmad.
Dario Amodei, CEO da Anthropic PBC, concorrente da OpenAI, apelou recentemente à indústria de IA para apoiar a desaceleração do desenvolvimento e disse que novas medidas de segurança serão adotadas, incluindo a introdução de agências de avaliação terceirizadas. O CEO da OpenAI, Sam Altman, posteriormente endossou a abordagem. A Anthropic disse no final da semana passada que traria avaliadores da Accenture para testar a segurança de seus modelos de IA de ponta.
A OpenAI disse em uma postagem no blog que a empresa está em discussões com instituições que podem estar envolvidas em tais avaliações. Ahmad disse que os alvos de negociação incluem instituições que cooperaram no passado e instituições que não cooperaram antes, incluindo as instituições de pesquisa em IA METR e Redwood Research. A OpenAI já havia contratado essas duas instituições para investigar a intrusão de seu modelo no sistema Hugging Face.
"O AI Labs tem a responsabilidade de criar condições para uma revisão eficaz e, ao mesmo tempo, proteger informações confidenciais", disse a OpenAI em um post no blog.
Comentários