O Google lança seu primeiro modelo de inferência híbrido Gemini 2.5 Flash, que suporta uma função ajustável de “orçamento de pensamento” e pode ativar ou desativar a profundidade.raciocíniomodo para reduzir custos de uso. Atualmente, a versão prévia do Gemini 2.5 Flash foi integrada aos produtos Gemini e o acesso à API está aberto aos desenvolvedores.

Segundo relatos, quando o modo de pensamento está desligado, o preço de saída do Gemini 2.5 Flash é tão baixo quanto US$ 0,6/milhão de tokens, o que é 600% menor do que o modo de pensamento (US$ 3,5/milhão de tokens). O Google afirma que mesmo quando o pensamento está desligado, o novo modelo ainda tem um desempenho melhor do que a geração anterior Gemini 2.0 Flash.

Este modelo quebrou recordes SOTA em vários testes de benchmark. Gemini 2.5 Flash (versão de pré-visualização) ocupa o segundo lugar no ranking de modelos grandes com uma pontuação ELO de 1392, perdendo apenas para a pré-visualização do GPT-4.5, e seu desempenho está no mesmo nível do Grok-3.
Na tarefa de perguntas e respostas de conhecimento do GPQA, o modelo que define um orçamento de reflexão de 24k pode melhorar o desempenho em 6%; no benchmark de código LiveCodeBench, o desempenho tem melhor desempenho com um orçamento de pensamento de 16k.
Em tarefas como matemática (AIME 2025/2024), raciocínio multimodal (MMMU) e resposta a perguntas de conhecimento (GPQA), o Gemini 2.5 Flash supera claramente o Claude 3.7 Sonnet, e seu desempenho geral é comparável ao mais recente modelo o4-mini da OpenAI.
Além disso, o Gemini 2.5 Flash ficou atrás apenas do o4-mini, com uma pontuação alta de 12,1% no benchmark comum "O Último Teste para a Humanidade".