É lançado o Fable 5.1 mais poderoso de Claude, com 8 itens na lista, o preço é reduzido em até 45% e o mecanismo antidestilação está online

📅 2026-09-02

Resumo:

Fable 5.1 e Mythos 5.1 lançados! Ficou em primeiro lugar em todos os 8 testes de benchmark públicos e o preço caiu até 45%. Especialmente nas áreas de investigação científica e codificação, deixou claramente para trás o Fable 5 e o seu vizinho GPT-5.6 Sol. De uma perspectiva mais intuitiva, agora rodando o Fable 5.1 com níveis de inferência médios e baixos, o desempenho é basicamente equivalente à versão antiga do Mythos 5 com nível de inferência extremamente alto ou mesmo mais alto. Nesta onda, “Fable” matou “Mythos”.

Em termos de preço, o Fable 5.1 reduziu o preço de leitura do cache para US$ 0,25 por milhão de tokens, uma redução de 75%.

Os preços de entrada e saída são consistentes com Fable 5, em US$ 10 e US$ 50 por milhão de tokens, respectivamente.

Parece que apenas um preço foi reduzido, mas o impacto real é relativamente grande, porque na tarefa do agente, a leitura do cache é responsável pela maior parte do custo.

Os dados fornecidos pela Anthropic são que o custo das cargas de trabalho típicas é cerca de 25% menor que o do Fable 5. Se for uma tarefa altamente inteligente, pode economizar até 45%.

O vídeo oficial de lançamento tem algo a dizer:

Não importa qual tarefa você pediu a Claude antes, o Fable 5.1 pode fazer mais e fazer melhor as partes mais difíceis.

Ele faz isso porque é bom para lidar com tarefas de várias etapas.

Neste tipo de tarefa, se ocorrer um pequeno erro na segunda etapa, tudo entrará em colapso na 40ª etapa, mas o Fable 5.1 pode fornecer resultados estáveis ​​durante todo o processo.

Se você encontrar um problema que não pode ser resolvido, ele lhe dirá quais soluções você tentou e onde está travado.

O pesquisador Flix Rieseberg também mencionou especificamente que, em termos de escrita, o Fable 5.1 reduz o uso de fontes em negrito, usa menos títulos, listas ou aspas e segue melhor as dicas de estilo.

A propósito, o que estou dizendo é: você pode abrir o código-fonte de suas dicas de estilo?

Ainda fiel à forma, o Fable 5.1 está aberto a todos os usuários, e o Mythos 5.1 está disponível apenas para organizações avaliadas de segurança cibernética e ciências biológicas por meio do Programa de Acesso Confiável.

Pesquisa científica prática: design de proteínas, geração de mapas de Vênus, aceleração de GPU

Além das pontuações em execução, a Anthropic também demonstrou os resultados práticos do Fable 5.1 e do Mythos 5.1 no campo da pesquisa científica.

Em termos de design de proteínas, a Anthropic usou o Mythos 5.1 para usar design de proteínas de código aberto e ferramentas de dobramento para projetar proteínas de ligação de alta afinidade e enviou o plano a duas instituições externas para verificação experimental.

Em três alvos, a afinidade de ligação do projeto Mythos 5.1 foi 10 vezes maior do que a melhor solução na competição de projeto de proteína Adaptyv Bio. Em todos os 12 alvos, a taxa de acerto foi próxima de 50%, em comparação com a taxa de acerto típica de 10 a 15% no atual campo do design de proteínas.

As proteínas de ligação de alta afinidade são o primeiro passo em muitos processos comuns de desenvolvimento de medicamentos e determinam diretamente se o medicamento pode funcionar em doses mais baixas.

Na astronomia, o Fable 5.1 treinou uma rede neural baseada em imagens de radar obtidas pela sonda Magellan da NASA há mais de 30 anos para gerar um novo mapa topográfico de alta resolução de um terço da superfície de Vênus.

Os mapas topográficos disponíveis anteriormente cobriam apenas um quinto de Vénus, com resoluções entre 10 e 20 quilómetros. O Fable 5.1 aumenta a resolução para 2 a 3 quilômetros e a precisão da altura é 25% maior do que antes. Este mapa foi lançado como código aberto sob uma licença CC e será usado como referência para as próximas missões NASA VERITAS e ESA EnVision para ajudar a identificar características geológicas importantes para observações futuras.

Em termos de biologia computacional, o Mythos 5.1 melhora a velocidade de execução de 7 modelos de aprendizado profundo de código aberto em até 2,5 vezes, escrevendo kernels de GPU personalizados e armazenando em cache resultados intermediários, e a saída é completamente consistente.

Na investigação real, os biólogos poderão ter de executar estes modelos milhares de vezes, testando todas as mutações possíveis perto de cada gene humano. Modelos otimizados podem reduzir os custos de GPU em 30% a 60%.

Esse tipo de otimização geralmente leva várias semanas para ser concluído por uma equipe de engenharia de desempenho, e muitos laboratórios acadêmicos simplesmente não podem arcar com isso. No entanto, o Mythos 5.1 fez isso em apenas alguns dias e contou apenas com código-fonte aberto.

A Anthropic planeja abrir o código dessas otimizações em um futuro próximo.

O mecanismo antidestilação está online

Com o lançamento do Fable 5.1, existem alguns regulamentos especiais e alterações na API.

Vamos falar brevemente sobre segurança primeiro.

A taxa de falsos positivos de segurança de rede do Fable 5.1 é 60% menor que a do Fable 5. Agora ele pode ser usado para descobrir vulnerabilidades de software, mas o desenvolvimento de explorações ainda é proibido. Tarefas de dupla finalidade, como testes de penetração, geração de exploits, verificação de vulnerabilidades baseadas em binários, etc. ainda serão redirecionadas para o modelo da série Opus.

As taxas de falsos positivos para questões médicas e de biologia básica foram reduzidas em 85%, mas as consultas que envolvem pesquisa e desenvolvimento em ciências biológicas ainda são encaminhadas para o processamento do modelo Opus, e os profissionais precisam obter acesso por meio do Programa de Validação de Ciências Biológicas (LSVP) do Mythos 5.1.

Então vamos falar sobre o mecanismo antidestilação recém-adicionado.

A partir de hoje, contas de API recém-registradas não poderão editar manualmente o contexto de Claude em diversas rodadas de conversas, mantendo registros da cadeia de pensamento.

Há uma técnica comum que já foi registrada publicamente antes: adulterar manualmente o contexto anterior de Claude em diversas rodadas de conversas, mas reter deliberadamente o registro da cadeia de pensamento. Isso permite que o modelo reproduza o raciocínio que produziu sob outro conjunto de instruções sob um novo conjunto de instruções, possivelmente adversário.

Esta estrada está bloqueada.

A abordagem é adicionar uma assinatura a cada bloco da cadeia de pensamento.

Quando o usuário envia a resposta do assistente de volta à API em solicitações subsequentes, o sistema usará essa assinatura para fazer duas coisas: verificar se o modelo atual tem o direito de ler este bloco e verificar se toda a conversa antes deste bloco (incluindo palavras de prompt do sistema, lista de ferramentas e todas as mensagens históricas) é exatamente a mesma de quando foi originalmente gerada.

A verificação da assinatura falhará sempre que alguma coisa na conversa for tocada.

O que fazer após a falha depende de um parâmetro prefix_mismatch_behavior definido pelo desenvolvedor: o valor padrão é "error", que retorna diretamente um código de status 400 e a solicitação é rejeitada; se estiver definido como "drop_block", o sistema descartará silenciosamente o bloco e todas as cadeias de pensamento depois dele, e a solicitação em si será executada normalmente.

A parte descartada não é contada (as pessoas são meio estranhas) e será listada no array input_transformations na resposta.

Quais operações causarão falha na verificação?

A documentação fornece uma lista detalhada: editar, reorganizar ou excluir quaisquer mensagens anteriores do usuário/assistente/sistema, alterar a palavra de prompt do sistema de nível superior, fazer adições, exclusões ou renomeações na lista de ferramentas, remover um bloco de cadeia de pensamento do histórico de conversas, mas reter os blocos subsequentes, e fazer referência a uma imagem ou URL de documento que retornou conteúdo diferente entre as solicitações.

Qualquer uma das opções acima fará com que todos os bloqueios subsequentes da cadeia de pensamento se tornem inválidos.

Por outro lado, algumas operações são seguras:

Anexar novas mensagens no final da conversa, remover o bloco da cadeia de pensamento do início do histórico, alterar parâmetros de solicitação como max_tokens, aumentar ou diminuir tags cache_control e compactação no servidor ou edição de contexto não acionarão falhas de verificação.

Há também um design de verificação em cadeia. Cada bloco da cadeia de pensamento registrará as informações do bloco anterior, formando uma cadeia cruzada. Os blocos podem ser removidos do início da cadeia, mas se um for removido do meio, todos os blocos seguintes se tornarão inválidos e toda a cadeia será invalidada a partir do ponto de quebra.

Para evitar que os desenvolvedores fiquem presos, a Anthropic também oferece uma série de alternativas que podem alcançar o mesmo efeito sem mexer na história.

Precisa alterar as instruções no meio do caminho? Use mensagens do sistema no meio da conversa em vez de alterar diretamente a palavra de alerta de nível superior.

Precisa adicionar um lembrete temporário para cada rodada? Use a mensagem do sistema de nível redondo com o parâmetro clear_at para substituir o método antigo de "inserir primeiro e depois excluir".

Precisa adicionar ou remover ferramentas no meio do caminho? Use os blocos tool_addition e tool_removal em vez de editar a lista de ferramentas diretamente.

Precisa recortar o contexto? Substitua o truncamento bruto do lado do cliente pela compactação do lado do servidor e edição contextual.

Se você estiver usando produtos oficiais como Claude Code, claude.ai, Claude Managed Agents ou Claude Agent SDK, não será necessário alterar nada. Eles garantiram automaticamente que o prefixo da conversa não será adulterado.

Mas se você é um desenvolvedor que chama diretamente a API de mensagens, a sugestão da Anthropic é usar o array de mensagens estritamente apenas como anexo e, em seguida, executar um teste completo de sessão multi-rodada com prefix_mismatch_behavior definido para o modo "drop_block" para ver se há alguma entrada prefix_binding_mismatch no log.

O documento final também menciona especificamente um cenário em que é fácil ter problemas.

Se você mantiver uma ferramenta ou estrutura e os usuários usarem suas próprias chaves de API para chamá-la, os usuários recém-registrados passarão por essa verificação mais cedo. Como a chave do próprio desenvolvedor provavelmente foi registrada antes de 31 de agosto, ela ainda não foi aplicada.

Nesse caso, é recomendável definir prefix_mismatch_behavior proativamente e testá-lo com antecedência. Não espere que os usuários travem antes de descobrir.

Mais uma coisa

Com tamanha comoção vinda da Empresa A, a vizinha OpenAI certamente não conseguirá ficar parada.

Mas seu novo modelo Astra ainda não está pronto, então eles precisam primeiro fazer uma prévia simbólica.

Por ocasião do lançamento do Fable 5.1 e do OpenAI Astra, Ilya também raramente se manifestava, pedindo o fortalecimento da segurança da rede.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários