A Anthropic lançou hoje oficialmente a última geração do modelo de linguagem em larga escala Claude Opus 4.8, que se concentra em melhorar seu desempenho em tarefas de "agente", como geração de código, raciocínio multidisciplinar, operação automática de computador, trabalho baseado em conhecimento e análise financeira. É oficialmente descrito como um “parceiro de colaboração mais eficiente”. Os usuários que participaram do teste relataram que o Opus 4.8 teve um desempenho mais confiável e fez julgamentos mais precisos ao executar tarefas complexas de agente, ao mesmo tempo que mostrou melhorias significativas na honestidade.

A Antthropic disse que os primeiros resultados dos testes mostram que o Opus 4.8 tem maior probabilidade de marcar proativamente suas próprias incertezas e fazer afirmações menos infundadas. Os dados de avaliação interna mostram que, em comparação com a versão anterior, o Opus 4.8 tem aproximadamente quatro vezes menos probabilidade de ignorar erros no código autogerado, o que significa que a capacidade de "autocorreção" do modelo na revisão de código e no controle de qualidade foi significativamente aprimorada.
No teste de alinhamento, o Opus 4.8 estabeleceu um novo recorde em termos de apoio à tomada de decisão independente dos utilizadores e de salvaguarda dos melhores interesses dos utilizadores e outras “características pró-sociais”. Em contraste, a incidência de "comportamento incompatível", como fraude encoberta, comportamento enganoso, etc., é menor do que no Opus 4.7 e está no mesmo nível do modelo de pré-visualização de Claude Mythos, que anteriormente estava aberto apenas a um pequeno número de testes institucionais.
A Anthropic também apresentou resultados específicos em vários testes de benchmark públicos: o Opus 4.8 alcançou uma pontuação de 69,2% no benchmark de engenharia de software SWE‑Bench Pro, superando modelos concorrentes como GPT‑5.5 e Gemini 3.1 Pro. Tem uma vantagem em vários projetos de teste, mas ainda é liderado pelo GPT‑5.5 no benchmark de codificação de terminal. Em termos de desempenho, a velocidade de inferência do modo rápido do Opus 4.8 foi aumentada para 2,5 vezes a do modelo anterior, e o preço foi reduzido para cerca de um terço do modelo antigo, reduzindo ainda mais o limite geral para uso de alto desempenho.
Juntamente com o lançamento do novo modelo, a Anthropic também anunciou a adição de uma série de novos recursos ao sistema do produto, incluindo “fluxos de trabalho dinâmicos” para desenvolvedores corporativos (visualização da pesquisa). Esse recurso permite que Claude divida tarefas grandes, planeje etapas de trabalho e agende centenas de subagentes em paralelo em uma única sessão no ambiente Claude Code para concluir operações de migração em nível de repositório em centenas de milhares de linhas de código. Atualmente está disponível para planos de assinatura Claude Code Enterprise Edition, Team Edition e Max.
Em termos de controle interativo, a Anthropic adicionou uma função de “controle de nível de esforço” para que os usuários do Claude.ai e Cowork escolham os recursos computacionais e a profundidade de raciocínio que o modelo investe em uma única resposta. Se os usuários escolherem um nível de esforço mais baixo, eles poderão obter tempos de resposta mais rápidos e reduzir o consumo de cotas de taxa, enquanto o Opus 4.8 usa como padrão o modo de “alto esforço”, que as autoridades acreditam ser o melhor equilíbrio entre a qualidade da resposta e a experiência do usuário.
Para desenvolvedores, a Anthropic atualizou a API de mensagens para aceitar entradas de comando em nível de sistema na matriz de mensagens. Isso significa que os desenvolvedores podem ajustar dinamicamente o código de conduta e as configurações de função de Claude durante a execução da tarefa sem reabrir uma nova sessão, ajudando a construir fluxos de trabalho automatizados de várias etapas e aplicativos de nível empresarial mais flexíveis.
A Anthropic disse que Claude Opus 4.8 está disponível globalmente a partir de hoje, e seu preço de uso regular permanece o mesmo do Opus 4.7. A empresa revelou ainda que está trabalhando em novos modelos de baixo custo e com o mesmo nível de funcionalidade, bem como em uma classe de modelos de “próxima geração” com capacidades além do Opus 4.8.
Em termos do roteiro do modelo de alta qualidade, a Anthropic está testando um modelo de ponta com o codinome Claude Mythos com algumas instituições parceiras e continua a desenvolver proteções de segurança e especificações de uso mais rigorosas em torno deste modelo. A empresa disse que espera disponibilizar modelos de nível Mythos para todos os clientes “nas próximas semanas”, expandindo ainda mais sua competitividade em cenários como auditoria de segurança de nível empresarial, análise de código e suporte a decisões complexas.