Um novo carro-chefe leva em média 6 dias. Modelos grandes são atualizados tão rapidamente que os humanos não conseguem acompanhar.

📅 2026-09-26

Resumo:

É uma loucura. Em apenas dois dias surgiram 4 novos modelos! Na frente, o xAI de Lao Ma acaba de emitir o Grok 4.7. Imediatamente depois, a OpenAI abandonou repentinamente o GPT-6 Sol e o Luna, e o preço foi cortado pela metade. No mesmo dia, a Anthropic também colocou na mesa o Claude Opus 5.5, que é 40% mais barato que a geração anterior. No dia 22 de setembro, uma imagem animada se tornou viral no X, com quase um milhão de visualizações.


Em 2023, os modelos grandes serão atualizados a cada 73 dias e, em 2026, serão atualizados a cada 18 dias.

Desde que o ChatGPT foi lançado, OpenAI e Anthropic bombardearam 42 modelos de grande sucesso (44 incluindo GPT-6 Sol e Luna lançados naquele dia).

Algumas horas depois, Emad Mostaque, fundador da Stability AI, retuitou a imagem e adicionou uma profecia.

"Como Alex disse, nesse ritmo, haverá um por dia no início do próximo ano."

Dois gigantes lançam a "atualização semestral"

Na verdade, o número de “atualizações a cada 18 dias” é bastante conservador, pois conta apenas OpenAI e Anthropic.

Do início deste ano até 22 de setembro, a Anthropic lançou 8 modelos principais e a OpenAI lançou 6. Os 14 modelos foram distribuídos por 265 dias, com uma média de 19 dias por modelo.

Durante o mesmo período, os dez principais fabricantes nacionais de grandes modelos lançaram pelo menos mais 28 modelos emblemáticos, uma média de mais de um a cada 9 dias.

Houve momentos em que eles lançaram juntos. Na semana anterior ao Festival da Primavera, quatro empresas lançaram novos carros-chefe, um após o outro; de 20 a 24 de abril, mais quatro empresas se revezaram nos cinco dias.

Juntando os dois lados, um novo carro-chefe surge em média mais de 6 dias, o que não está longe do “um por dia” mencionado por Emad.


O aumento da velocidade do Antrópico é visível a olho nu.

No primeiro semestre do ano demorava em média 46 dias para lançar um modelo e no segundo semestre demorava 26 dias. Opus 4.8 é 28 de maio, Opus 5 é 24 de julho e Opus 5.5 é 22 de setembro.

OpenAI segue o caminho de "reter o movimento final e depois retirá-lo".

O GPT-6 Astra explodiu toda a rede em 3 de setembro e, apenas 19 dias depois, Sol e Luna fizeram o mesmo.

Haverá a conferência DevDay na próxima semana. Altman lamentou que esta seja a primeira vez em sua memória que a OpenAI gritou “há muitas coisas para divulgar” ao se preparar para uma coletiva de imprensa.


Por que o setor editorial está se tornando cada vez mais denso? A Antrópica deu a resposta em um relatório. A IA já está ajudando a criar a próxima geração de IA.

Em fevereiro deste ano, Claude poderia liderar de forma independente menos de 1% do trabalho de P&D em IA. Depois disso, melhorou quase todos os meses, chegando a 12% em maio, 22% em julho e 26% em agosto.


Na OpenAI, em meados de agosto, o número de dias de trabalho investidos pelos agentes de IA foi 3,1 vezes maior que o dos pesquisadores humanos (com base em 8 horas por dia).

Na Anthropic, um quarto do trabalho de confecção de maquetes foi entregue ao próprio Claude. Os próximos modelos virão um após o outro.

A fila já chegou à porta. Mike Krieger da Anthropic revelou que o Sonnet 5.5 e o Haiku 5.5 chegarão nas próximas semanas.


O Gemini 4 do Google iniciou "o pré-treinamento mais ambicioso até o momento" já em julho, e o mundo exterior geralmente aposta que ele será lançado no final do ano. Pelo menos duas empresas nacionais anunciaram oficialmente seus carros-chefe da próxima geração, faltando apenas uma data de lançamento.

A "metafísica" conquistada com dificuldade

Ele será descartado imediatamente após dois meses

Quanto mais rápido o modelo grande é executado, mais embaraçoso ele se torna para as pessoas que escrevem o código downstream.

Você ficou acordado algumas noites no final de julho e acabou de mudar o aplicativo para o Opus 5. Cada parâmetro foi ajustado tão suavemente quanto a seda. Dois meses depois, o Opus 5.5 foi lançado e você felizmente mudou a interface - clique e algumas solicitações relataram erros diretamente.

Olhando os recentes guias oficiais de alertas dessas duas empresas, você descobrirá que elas estão transmitindo o mesmo fato. Muitas das instruções ancestrais que você escreveu para o modelo da geração anterior tornaram-se resíduos de papel.

A primeira coisa é fazer a subtração.

A OpenAI afirma claramente no guia Astra que as instruções do processo que eram muito detalhadas no passado agora serão um obstáculo. Palavras como “leia o documento cuidadosamente antes de alterar o código” e “lembre-se de executar testes” podem ser excluídas.


O guia da Antrópico também significa isso.

No passado, as palavras de alerta muitas vezes precisavam adicionar a frase "Verifique depois de concluído", mas o Opus 5 já pode verificar isso sozinho. Se esta frase não for excluída, será uma verificação excessiva.

No Opus 5.5, é recomendado excluir a frase PUA "pense bem antes de responder" na cena do chat. Depois de excluí-lo, a resposta é mais rápida e a qualidade não cai significativamente.

Depois de deletar os antigos, é preciso adicionar novos, pois cada geração tem um temperamento novo.

Opus 5.5 sempre gosta de voltar e pensar em questões que já foram respondidas durante múltiplas rodadas de diálogo, o que é um desperdício de poder computacional. O patch oficial foi dado: "O que foi respondido já passou."


Os parâmetros e valores padrão também estão mudando silenciosamente.

No Opus 5.5, desligar o modo de pensamento reporta diretamente um erro 400; sem escrever o parâmetro de esforço, a marcha padrão é reduzida de alta para média, e o custo e o efeito são embaralhados de acordo.

Nesse sentido, a sugestão oficial é executar novamente o teste de esforço e não transferir diretamente as configurações antigas do Opus 5.

Um conjunto de palavras de alerta mais um conjunto de parâmetros, cada geração tem que descascar camadas de pele. Caso o reajuste não tenha sido feito, a conta pode variar bastante.

Lance Martin, da Anthropic, demonstrou no vídeo que um prompt antigo escrito para o Opus 4.8 custava 2,45 centavos por ordem de serviço e custava 2,02 centavos para substituí-lo diretamente pelo Opus 5.5. Depois de lavá-lo novamente com as ferramentas oficiais, a taxa de precisão aumentou para 92,0% e o custo foi reduzido para 1,83 centavos.


Além disso, a vida útil do próprio modelo também é reduzida.

A OpenAI emitiu nove anúncios de descontinuação este ano, envolvendo mais de 40 modelos e funções.

Entre eles, o GPT-5.5, que acaba de ser lançado em 23 de abril, será removido do ChatGPT e do Codex em 14 de outubro e sobreviveu por menos de meio ano.

Até a plataforma de avaliação Evals da OpenAI será encerrada no final de novembro.

Escovar a lista? Um novo conjunto de questões do teste foi elaborado em meio ano

Não importa se as pessoas não conseguem acompanhar, agora mesmo as “provas de exame” não são suficientes.

Em março deste ano, foi lançado o ARC-AGI-3, que afirma ser especializado em IA e testar o QI sem memorizar perguntas. O Gemini 3.1 Pro, que ocupava o primeiro lugar na época, obteve apenas 0,37%, enquanto os humanos obtiveram 100%.

No dia 3 de setembro, o GPT-6 Astra entrou na sala de exames, com pontuação de 62,7% no teste padrão, e atingiu diretamente 99,9% ao usar uma estrutura específica. Em 96% dos níveis, deu menos passos que um humano.


Um novo conjunto de perguntas do teste foi dividido em meio ano e os funcionários da ARC começaram a pensar em como produzir a próxima geração de avaliações.

Na lista de codificação (Next.js), Sol, Opus 5.5 e Fable 5.1 pontuaram 97%, empatados em primeiro lugar; na lista de redatores, Opus 5.5 Fault lidera o segundo lugar com 307 pontos.

Esta pontuação é o maior salto único na história da lista. O blogueiro disse que era ultrajante depois de lê-lo e quase pensou que havia um bug em seu próprio benchmark!


Cada vez que um novo modelo é lançado, os desenvolvedores precisam reiniciar o processo de testes, como no Sísifo.

De acordo com o ritmo atual, se no próximo ano realmente atingir o ponto de "uma atualização por dia", as palavras de alerta e os links de agente que você ajustou hoje poderão não durar mais do que uma semana.

Pela primeira vez, a velocidade de substituição de modelos excedeu completamente a velocidade de adaptação humana a ele.

Os corredores mais lentos hoje são, na verdade, aqueles que usam IA.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários