Gemini 4 Pro é suspeito de vazamento e "desaceleração da IA" é conversa fiada novamente

📅 2026-09-19

Resumo:

Nos últimos meses, a OpenAI e a Anthropic se revezaram no desenvolvimento de seus principais modelos, mas o Google parecia estranhamente quieto. O Flash é atualizado quase a cada três semanas, com 3,6, 3,7 e 3,8 avançando continuamente, mas não houve nenhum movimento para o Pro, que representa o limite de capacidade mais alto. Até esses dois dias, um modelo com o nome gemini-3.8-flash apareceu de repente na grande arena de testes cegos de modelos Arena.


Assim que os desenvolvedores começaram, eles perceberam que algo estava errado. O verdadeiro Gemini 3.8 Flash foi lançado. Todo mundo sabe que nível deveria ser. Mas com este "Flash 3.8", o desempenho de escrever código, criar SVG e executar o Agent obviamente aumentou um pouco.



Após várias rodadas de testes reais, um palpite se espalhou rapidamente:

Este modelo provavelmente será o carro-chefe da próxima geração do Google escondido atrás do rótulo: o Gemini 4 Pro.

Imediatamente depois, uma imagem de comparação de benchmark ainda mais exagerada começou a se tornar viral. Codificação, Agente, Raciocínio, pontuações múltiplas classificadas como GPT-6 Astra e Claude Fable abaixo.


Há poucos dias, várias das mais importantes empresas de IA discutiam abertamente se era hora de desacelerar. Agora, o som da desaceleração ainda não chegou ao solo e uma nova rodada de competição começou.

Por trás desse suposto “modelo de nível divino” do Gemini 4 Pro, existe uma palavra-chave mais perigosa:

RSI.


Suspeita-se que Gemini 4 Pro tenha vazado

Em 2 de setembro, o Google acaba de lançar oficialmente o Gemini 3.8 Flash. De acordo com autoridades, esta é a última geração de Flash da série Gemini 3, que melhorou significativamente a engenharia de software, as tarefas dos agentes e o raciocínio complexo em várias etapas; do 3.7 Flash para o 3.8 Flash, apenas três semanas se passaram.

Então, quando outro modelo com o mesmo nome gemini-3.8-flash apareceu no Arena, os desenvolvedores rapidamente perceberam a anomalia.

O Flash 3.8 real já está aí e todos têm uma referência pronta. E este modelo parece obviamente mais forte, e é claramente a força que só pode ser encontrada no modelo Pro.


O primeiro lote de testes reais que desencadearam a disseminação se concentrou em SVG, páginas da web e cenas 3D.

O desenvolvedor Harshith pediu que ele desenhasse um gato doméstico de lado usando SVG e juntasse os resultados com o GPT-6 Astra Max e a versão oficial do Gemini 3.8 Flash. Esta versão no Arena tem uma lacuna visível com o Flash 3.8 oficial em termos de contorno, proporção e integridade de detalhes.


Da esquerda para a direita: "4 Pro", Astra, 3.8 Flash

X internauta @thtbee_ testou continuamente este suposto modelo Gemini 4 Pro de vários ângulos.

Um pagode estilo Voxel, o modelo durou 8 minutos e gerou diretamente um conjunto completo de cenas 3D interativas.



Um helicóptero Airbus H145, levou apenas cerca de 10 minutos para construir uma página de exibição 3D completa, que é muito detalhada. No entanto, este internauta disse que os elementos da interface do usuário na parte inferior da página “parecem um pouco ruins”.



Em termos de web design, a modelo levou cerca de 14 minutos para criar um site com tema monocromático, que no geral era muito limpo e completo. Os problemas de gosto de design dos quais Gemini costumava reclamar no passado parecem ter sido finalmente resolvidos desta vez.



Outro internauta @Mr_Salio usou diretamente esse modelo suspeito do Gemini 4 Pro para fazer jogos. Os gráficos finalizados são bastante suaves e a geração do mundo e o design do jogo também são muito completos.



Uma pista mais crítica vem do desenvolvedor Qwinah.

Ele alegou que fez um "roteamento fantasma" com sucesso para o backend do Gemini 4 Pro e postou uma captura de tela de informações suspeitas do terminal interno.

Segundo ele, G4P-ARGON e VIA_3.8_FLASH aparecem diretamente na logo interna deste modelo. A saída máxima atinge 256K, a janela de contexto excede 10 milhões de tokens e também possui memória permanente entre sessões, rede sem API, compilação automática de back-end e execução de scripts e até recursos físicos de controle de robô.


Se esta informação for verdadeira, então obviamente não se trata mais de uma atualização comum do Flash.

Ao mesmo tempo, uma tabela comparativa de benchmark Gemini 4 Pro também começou a circular na comunidade.


De acordo com os dados da imagem, o Gemini 4 Pro obteve 88,7% no teste de engenharia de software DeepSWE v1.1, 95,3% no teste Terminal-Bench 2.1 no agente terminal, 72,1% no teste de raciocínio de conhecimento de nível especializado HLE-Verified e 86,8% no teste de agente de operação de computador OSWorld 2.0.

O que é ainda mais exagerado é que no GDPval-AA v2, que mede o trabalho de conhecimento real, está escrito como 2064 Elo, quebrando diretamente a marca de 2000.

Se esses dados forem verdadeiros, o Gemini 4 Pro pode simplesmente “dar um soco no Fable e chutar o Astra”, ficando no topo dos modelos de última geração de uma só vez.

Mas quanto mais exagerado, mais cuidado você precisa ter.

Vale a pena notar que esta tabela de benchmark não é completamente consistente com a suspeita captura de tela de back-end "escavada" por Qwinah; a pontuação do Astra, que é utilizada como item de comparação na tabela de benchmark, não está em conformidade com os dados oficiais; ambos os materiais não são endossados ​​oficialmente pelo Google, Arena ou benchmarks relacionados, e ainda são apenas informações que circulam na comunidade.

O único modelo que pode ser confirmado é o modelo denominado gemini-3.8-flash, que é completamente inconsistente com o desempenho do Gemini 3.8 Flash.

Mas há outra razão muito importante pela qual todos apontam rapidamente para o Gemini 4 Pro: o modelo Pro do Google está vazio há muito tempo.

O Gemini 3.5 Pro ainda não foi lançado oficialmente e o Gemini 4 já foi confirmado para entrar em treinamento. Nos últimos meses, o Flash foi empurrado de geração em geração e nunca houve um novo modelo na linha Pro que realmente representasse o limite superior de capacidades.

Agora, um "Flash 3.8" com habilidades obviamente anormais emergiu repentinamente da Arena.

Como resultado, a especulação está se tornando cada vez mais razoável - o Google pode não ter qualquer intenção de deixar a grande atualização real para o 3.5 Pro, mas diretamente para o Gemini 4 Pro.


Por trás do Gemini 4 Pro,

A palavra-chave mais importante é RSI

Se o Gemini 4 Pro ainda é apenas um boato da comunidade, então o que é mais digno de nota é que

O Google está acelerando significativamente a velocidade da participação da IA ​​no desenvolvimento de modelos.

Neste boato sobre o Gemini 4 Pro, a palavra-chave RSI foi mencionada repetidamente.



RSI significa Autoaperfeiçoamento Recursivo, que significa autoaperfeiçoamento recursivo. Simplificando, a IA começa a participar na criação de uma IA mais forte, e uma IA mais forte acelera ainda mais o desenvolvimento de modelos de próxima geração.

Quando esse ciclo estiver em execução, não será apenas a capacidade do modelo em si que será acelerada.

Mesmo a velocidade de evolução do modelo começará a ser acelerada pelo próprio modelo.

A Reuters divulgou em agosto deste ano que o cofundador do Google, Sergey Brin, tem pressionado a Gemini a acelerar nos últimos meses e listou o autoaperfeiçoamento recursivo como uma das principais direções.

Embora o Google não tenha anunciado publicamente que alcançou esse ciclo fechado, ele está transferindo cada vez mais tarefas que originalmente pertenciam aos pesquisadores para os agentes, incluindo avaliar modelos, encontrar direções para melhorias, executar experimentos e, em seguida, alimentar os resultados de volta ao processo de desenvolvimento do modelo.

Quando o Gemini 3.8 Flash foi lançado em 2 de setembro, o Google também mencionou na descrição oficial que um loop de agente de longa duração está "avaliando e melhorando recursivamente o modelo subjacente".


O pesquisador do Google DeepMind Yao Shunyu (não Yao Shunyu da Tencent) usou as palavras de Armstrong quando pousou na Lua para descrever esta atualização após o lançamento do Flash 3.8:

"Esse é um pequeno passo para o modelo, um passo gigante para o RSI."


Recentemente, o Google também incluiu "RSI" no título de um novo artigo.

Em 14 de setembro, Google, GDM e outras equipes lançaram o Dream-RSI, que estuda especificamente como permitir que os agentes alcancem o autoaperfeiçoamento recursivo por meio da melhoria contínua das estratégias de exploração. Em engenharia de algoritmos, otimização matemática e tarefas de kernel de GPU, este método apresenta maior eficiência de exploração e menor custo de pesquisa.

É precisamente por isso que os rumores do Gemini 4 Pro foram rapidamente ligados ao RSI.

A especulação na comunidade não para em “Gemini 4 Pro é muito forte”, mas também pergunta até que ponto o Google alcançou o RSI internamente.

Obviamente, o Google não é o único a seguir o caminho do RSI.

Em 17 de setembro, horário dos EUA, a Anthropic divulgou um conjunto de dados internos de automação de P&D de IA.

As autoridades antrópicas afirmaram que a razão pela qual divulgaram esses indicadores é que acreditam que o mundo exterior precisa saber quanto da pesquisa e desenvolvimento de IA em laboratórios de ponta começou a ser concluído pela própria IA.


Os dados mostram que, em agosto deste ano, Claude foi capaz de liderar 26% das tarefas de pesquisa e desenvolvimento de IA antrópica - ou seja, os humanos só precisam fornecer metas e supervisão de alto nível, e Claude pode basicamente completar as tarefas de ponta a ponta. Essa proporção era inferior a 1% em fevereiro e março deste ano.

Ao mesmo tempo, mais de 90% das tarefas de P&D de IA dentro da Anthropic entraram pelo menos no estágio de colaboração em IA.

Na China, Tang Jie, fundador e cientista-chefe da Zhipu, também disse recentemente: "Ainda estamos longe de alcançar o autoaperfeiçoamento recursivo, mas o menor ciclo apareceu: sistema de otimização de modelo, modelo de serviço de sistema."


O longo artigo de Tang Jie sobre X, apenas o começo está truncado

Na prática de engenharia divulgada pela Zhipu, um Agente de Infra conduzido pelo GLM-5.3 participou do projeto, depuração e otimização da infraestrutura de inferência GLM-5.3-Flash. Este sistema funciona em um cluster de mais de 100.000 chips domésticos de IA. Demorou apenas duas semanas desde a primeira execução até assumir todo o tráfego de produção, aumentando o rendimento de ponta a ponta para 3,2 vezes o nível inicial.


"Desacelerar" finalmente deixa apenas um aviso

Há poucos dias, Amodei convocou as empresas de IA de ponta a se unirem para "desacelerar".

A primeira condição que ele listou para estar alerta foi a LER.

O progresso do modelo em si é, obviamente, uma coisa boa, mas o problema é que se a IA começar a participar na produção da próxima geração de IA, a velocidade do progresso do modelo poderá ser cada vez mais rápida, mas a velocidade da compreensão humana, avaliação e controlo do mesmo poderá não ser acelerada ao mesmo tempo.

Portanto, Amodei enfatizou repetidamente que a avaliação de terceiros, os padrões de segurança comuns e os mecanismos de desaceleração devem ser estabelecidos antecipadamente antes que as capacidades ultrapassem certos limites.

Porque uma vez que o RSI realmente forma um feedback positivo, o modelo pode ter cruzado a “distância segura” de frenagem.

Em termos de risco, vários laboratórios de ponta chegaram de fato a um consenso.

Altman concordou publicamente em "desacelerar o ritmo de desenvolvimento da IA ​​de ponta" e prometeu que a OpenAI também introduziria revisores independentes com direitos semelhantes aos funcionários; Musk disse que “Dario está certo”; Hassabis também disse que esta é a direção certa, mas como fazê-lo precisa continuar a ser discutido.

Mas a iniciativa também mencionava que não adianta desacelerar sozinho. Se a investigação e o desenvolvimento da IA ​​continuarem a ser acelerados pela IA, um abrandamento ou suspensão verdadeiramente eficaz no futuro exigirá o estabelecimento de um conjunto de regras comuns: tais como a introdução de avaliadores independentes e a permissão para que laboratórios de ponta estabeleçam em conjunto limiares de capacidade e medidas de segurança, e coordenem-se para abrandar o ritmo da investigação e desenvolvimento quando necessário.

Mas até agora, por diversas razões concorrenciais, não foram estabelecidas regras comuns.

Todos já podem dizer juntos que “devemos ser cautelosos”, mas quando se trata de “especificamente como desacelerar, quem deve desacelerar primeiro e se outros países devem desacelerar”, o consenso desaparece rapidamente.

Há a competição de modelos mais direta entre laboratórios e há maior competição de IA entre países. Se algum país abrandar sozinho, correrá o risco de ceder a janela de liderança aos seus oponentes; se algum país impor restrições sozinho, ficará preocupado com a possibilidade de o outro lado continuar a acelerar.

Vários laboratórios de IA de ponta, portanto, comportam-se de forma um tanto inconsistente com suas palavras e ações.

Do lado do Google, existe o Gemini 4 Pro mencionado acima, que é suspeito de ter sido testado anonimamente na Arena.

Do lado antrópico, vestígios em tons de cinza do Opus 5.2 também começaram a aparecer na comunidade recentemente. Alguns usuários do Claude Code disseram que viram o novo logotipo do modelo claude-opus-5-2 através do status de execução e solicitaram informações de roteamento, e suspeitaram que algumas solicitações foram colocadas em escala de cinza para a próxima geração do Opus.


Quanto ao OpenAI, algumas pessoas disseram que viram o nome do modelo gpt-6-sol na lista de modelos de fundo, e algumas pessoas disseram que suspeitavam que haviam sido escaladas para um novo modelo. De acordo com notícias amplamente divulgadas, o GPT 6 Sol pode ser lançado na próxima semana, ou pode ser no Dev Day, em 29 de setembro, horário dos EUA... Resumindo, não está longe.


A próxima rodada de modelos dos três laboratórios de IA de ponta começou a mostrar vestígios de testes na comunidade.

O resultado mais certo desta rodada de “iniciativa de desaceleração” até agora não é que alguma empresa tenha realmente desacelerado, mas que as empresas de IA mais importantes tenham falado publicamente sobre os riscos com antecedência.

O modelo não está desacelerando.

Mas pelo menos, se algo acontecer um dia, eles poderão dizer: nós os avisamos.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários