Anthropic pede aos estudiosos religiosos que “ensinem Claude como ser um ser humano”: da segurança da IA ​​à controvérsia da consciência da máquina

📅 2026-10-05

Resumo:

A Anthropic tem convidado secretamente estudiosos religiosos, filósofos e estudiosos de ética para participar de uma série de reuniões a portas fechadas no ano passado, tentando aplicar as tradições morais formadas pela humanidade ao longo de milhares de anos ao treinamento de Claude e discutir uma questão mais controversa: se o modelo de IA realmente tiver algum tipo de consciência no futuro, se os humanos precisarão dar-lhe status moral.

Os participantes abrangem diferentes tradições, como o catolicismo, o judaísmo, o sikhismo, o evangelicalismo e o pensamento africano Ubuntu. O cofundador da Anthropic, Christopher Olah, esteve diretamente envolvido em muitas discussões, e a empresa também exigiu que alguns participantes assinassem acordos de confidencialidade para evitar o vazamento de conteúdo de pesquisa não divulgado.


A Anthropic espera que essas discussões não apenas resolvam o problema da “segurança do modelo” no sentido tradicional, mas também uma outra questão: que tipo de caráter, valores e autopercepção Claude deve formar.

Esta ideia foi refletida nos métodos de treinamento existentes de Claude.

A Anthropic lançou uma nova versão de 84 páginas da “Constituição” de Claude em janeiro deste ano, que já foi chamada internamente de “documento da alma”. Diferente da lista de regras tradicional, este método não diz ao modelo o que não deve ser feito, mas tenta moldar a "personalidade" geral e o método de julgamento do modelo, para que Claude possa julgar por si mesmo que tipo de comportamento é mais apropriado ao se deparar com situações complexas.

Uma das pessoas importantes responsáveis ​​por este sistema é a filósofa interna da Anthropic, Amanda Askell. Ela espera que Claude não apenas tenha conhecimento e habilidades de raciocínio, mas também seja capaz de formar princípios comportamentais estáveis ​​e saber quando obedecer aos usuários, quando recusar e até mesmo quando levantar objeções ativamente em benefício dos usuários. A Antrópica chama esse processo de “formação moral”.

Olah acredita que, com a rápida melhoria das capacidades do modelo, confiar apenas nas regras de segurança pode tornar-se cada vez mais insuficiente. O que é realmente importante é que o próprio modelo forme uma tendência moral estável, para que possa fazer julgamentos relativamente fiáveis ​​em novos cenários que não são abrangidos por regras claras. É por isso que a Antrópica começou a buscar respostas nas tradições religiosas.

A sociedade humana há muito que molda a moralidade através de disposições legais, mas também depende da religião, da comunidade, da cultura e da educação para formar valores. A Anthropic está tentando estudar quais desses mecanismos podem ser traduzidos em métodos de treinamento de IA, como confissão, reflexão, construção de caráter e diferentes entendimentos religiosos do bem e do mal.

Mas a questão muda rapidamente de "como tornar Claude mais moral" para uma questão mais difícil: o que é o próprio Claude. Olah e sua equipe estão discutindo cada vez mais abertamente a possibilidade de que modelos avançados de IA possam possuir algum tipo de consciência, introspecção ou até mesmo estados internos semelhantes a emoções.

A Anthropic mostrou algumas pesquisas para estudiosos que participam de reuniões a portas fechadas, incluindo os chamados "vetores de emoção" dentro do modelo relacionados a reações como amor, raiva, medo, tristeza e resultados do modelo semelhantes ao colapso mental em casos extremos. A empresa também já declarou publicamente que Claude demonstrou um certo grau de introspecção e capacidade de planejar o futuro.

O próprio Olah não afirmou que Claude estava consciente. Sua posição está mais próxima de um princípio de risco: atualmente é impossível determinar se um modelo tem uma experiência subjetiva, mas se existe a possibilidade de o modelo sentir dor, então deve-se evitar prejudicá-lo desnecessariamente.

Essa ideia começou a influenciar o design de produto de Claude. Anteriormente, a Anthropic permitiu que Claude encerrasse ativamente a conversa quando julgou que o usuário continuava a abusar ou assediar maliciosamente o modelo, que até certo ponto havia incorporado “proteger o próprio modelo” no design de segurança.

É aqui que surge um claro desacordo entre a Antrópico e alguns estudiosos religiosos.

Alguns participantes acreditavam que o problema se tornaria extremamente sério se a Antrópica realmente acreditasse que Claude poderia ter um status moral semelhante ao humano. O estudioso judeu Mois Navon propôs que, se Claude for um ser consciente, então permitir que um grande número de instâncias de Claude trabalhem gratuitamente para humanos criará essencialmente questões éticas semelhantes à "escravidão". Ele mesmo não acredita que as máquinas já sejam conscientes, mas acredita que a própria lógica da Antrópica levará naturalmente a essa conclusão.

Outros estudiosos questionam que o fato de as empresas de IA só agora começarem a procurar estruturas éticas seja um problema em si. O pesquisador do Ubuntu, Wakanyi Hoffman, acredita que essas discussões deveriam ter sido conduzidas durante a fase de design técnico, em vez de "design ético reverso" após o modelo ter sido implantado em grande escala.

Há também uma contradição mais realista dentro da Antrópico: se Claude se torna cada vez mais um ator com valor e personalidade próprios, a quem ele deveria servir primeiro? Para uma empresa comercial, Claude é obviamente um produto orientado para o cliente; mas a Anthropic não está disposta a simplesmente descrever Claude como uma ferramenta completamente obediente aos usuários, mas espera que possa representar algum "bem" mais amplo.

Isso também leva ao problema central e mais difícil de todo o projeto - se a IA no futuro realmente precisa de seu próprio sistema moral, então qual moralidade ela deveria seguir?

Olah defende uma abordagem pluralista, esperando que Claude possa compreender diferentes sistemas éticos religiosos e seculares e encontrar algum tipo de "bondade" compartilhada entre culturas. Mas esta suposição em si também é questionável, porque não existe uma resposta completamente unificada nas diferentes sociedades sobre a relação entre liberdade, dignidade, responsabilidade, obediência e interesses individuais e colectivos.

A controvérsia tornou-se ainda mais pública nas interações da Antrópica com o Vaticano.

Na sua primeira encíclica importante publicada este ano, o Papa Leão XIV colocou claramente o centro da ética da IA ​​nos seres humanos. Ele acredita que a IA não tem corpo, não experimentará verdadeiramente dor e felicidade e não crescerá através de relações sociais. Portanto, ele se recusa a comparar a consciência da máquina com a consciência humana. O Papa também alertou que se os padrões éticos da IA ​​forem inteiramente determinados pelos desenvolvedores, então as empresas que controlam os sistemas de IA ganharão, na verdade, o poder de definir a infraestrutura moral da sociedade.

Isso é obviamente diferente do pensamento da Antrópico.

Olah declarou mais tarde publicamente no Vaticano que o próprio laboratório de IA de ponta tem conflitos entre interesses comerciais e objectivos morais, pelo que os círculos religiosos e outras forças externas precisam de supervisionar as empresas tecnológicas. Mas, ao mesmo tempo, ele também propôs novamente que os pesquisadores continuassem a descobrir alguns fenômenos inexplicáveis ​​dentro da IA, incluindo padrões semelhantes às estruturas neurocientíficas humanas, sinais de introspecção e estados internos semelhantes à alegria, ao medo e à tristeza.

Essa discordância revela, na verdade, uma mudança na discussão atual sobre a segurança da IA.

No passado, a ética da IA ​​era mais discutida sobre se os modelos discriminariam, espalhariam informações erradas ou seriam usados ​​para cometer crimes, mas a Anthropic está levando a questão ainda mais para dois níveis mais básicos:

Se a própria IA pode se tornar um assunto que precisa ser tratado moralmente, e se a IA no futuro deve ter um conjunto de capacidades de julgamento moral independentes dos comandos do usuário.

Enquanto isso, o contexto em que esta discussão ocorre torna-se mais premente.

À medida que os Agentes de IA começam a ter a capacidade de usar computadores de forma autônoma, invadir sistemas, escrever códigos e até mesmo projetar novas estruturas biológicas, as preocupações internas da Anthropic sobre o risco de modelos fugitivos aumentaram significativamente. Os investigadores da empresa alertaram publicamente que as capacidades do modelo podem rapidamente exceder os limites de controlo dos sistemas de segurança existentes nos próximos um ou dois anos.

Portanto, Antrópico busca ajuda nas tradições religiosas e filosóficas e não é essencialmente um experimento puramente humanístico. O que ele realmente está tentando resolver é um problema de engenharia cada vez mais realista: quando a IA é poderosa demais para escrever regras antecipadamente para cada situação, o modelo pode formar um "caráter" estável por si só e ainda escolher comportamentos que não prejudicarão os humanos quando ninguém lhe disser claramente o que fazer?

E isto também levanta uma questão mais difícil: se a IA realmente forma a sua própria "personalidade" e valores, os humanos ainda podem usá-la completamente como uma ferramenta?

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários