Google lança Gemini 3.5 Transcribe para melhorar ainda mais a precisão da fala para texto

📅 2026-08-27

Resumo:

O Google lançou recentemente o Gemini 3.5 Transcribe, o mais recente modelo de conversão de fala em texto da série Gemini, considerando-o o modelo de reconhecimento de fala mais preciso da série. Este modelo está aberto a desenvolvedores, empresas e usuários comuns e se concentra em melhorar as capacidades de transliteração em ambientes barulhentos, termos profissionais complexos e expressões faladas naturais.

De acordo com relatórios, o Gemini 3.5 Transcribe consegue lidar melhor com ruídos de fundo e vocabulário complexo em áreas profissionais. O Google afirmou que o novo modelo trouxe melhorias de desempenho ao aplicativo Gemini na plataforma macOS e à função Rambler do teclado Gboard na plataforma Android. Os desenvolvedores podem usar esse modelo para criar aplicativos como agentes de voz, ferramentas de legenda em tempo real e processos de análise pós-chamada.

O Google disse que o Gemini 3.5 Transcribe foi projetado para capturar os padrões naturais de fala dos usuários para compreender com mais precisão a intenção semântica, identificar vocabulário personalizado e ajudar os usuários a concluir tarefas por voz.

No nível funcional, o novo modelo adiciona vários recursos de otimização, incluindo autocorreção automática, exclusão de palavras de preenchimento faladas, como "um" e "ah", e formatação automática do texto de saída. Ao mesmo tempo, também pode delegar tarefas mais complexas, como análise de arquivos e geração de imagens, a outros modelos Gemini para formar uma experiência de colaboração multimodelo mais completa.

Em termos de precisão, o Google apontou que a taxa média de erro de palavras do Gemini 3.5 Transcribe é de 4,0% em cenários de reconhecimento de fala de streaming e pode ser reduzida para 2,6% em cenários sem streaming. O modelo tem melhor desempenho de transcrição em ambientes ruidosos e pode identificar com mais precisão informações importantes compostas por letras e números, como números de pedidos e códigos postais.

Em termos de suporte a idiomas, o Gemini 3.5 Transcribe atualmente cobre 85 idiomas e oferece suporte a sotaques regionais e dialetos diferentes. Para áudio pré-gravado, ele pode realizar reconhecimento de atribuição de fala com carimbo de data e hora para até três alto-falantes; além disso, o modelo pode se adaptar a vocabulários definidos pelo usuário para identificar termos profissionais, grafias especiais e nomes industriais.

O Gemini 3.5 Transcribe está atualmente disponível em visualização pública por meio da API Gemini no Google AI Studio e no Google Antigravity. Usuários comuns podem experimentar funções relacionadas nas plataformas Android e macOS. O Google também planeja apresentá-lo ao navegador Chrome, onde os usuários podem inserir texto diretamente por voz na caixa de entrada de qualquer página da web.

Recentemente, o Google continuou a acelerar o avanço da linha de produtos Gemini. A empresa lançou anteriormente o Gemini 3.7 Flash para se juntar à concorrência cada vez mais acirrada de preços para modelos de IA; O Gemini no Chrome para Android também foi aberto a todos os usuários nos Estados Unidos, e o Gemini Assistant também entrou na nova geração de táxis autônomos da Waymo.

Tags relacionadas

Artigos relacionados

Comentários

0/500
验证码
Sem comentários