Alibaba lança Qwen3.8-Omni-Flash, com múltiplas performances aproximando-se do Gemini 3.8 Flash

📅 2026-09-18

Resumo:

A equipe Qwen do Alibaba lançou recentemente uma nova geração do modelo nativo totalmente modal Qwen3.8-Omni-Flash, que combina ainda mais a compreensão de áudio e vídeo com recursos de agente de IA.

O modelo suporta quatro formas de entrada: texto, imagem, áudio e vídeo, e fornece uma janela de contexto de 1 milhão de Tokens. Em comparação com a geração anterior Qwen3.5-Omni-Plus, os funcionários da Qwen afirmam que sua pontuação média em 29 testes de benchmark aumentou mais de 25%, ao mesmo tempo que reduziu significativamente os custos de processamento de áudio e áudio.

1789705181_banner-latest.en.webp

Uma das maiores mudanças no Qwen3.8-Omni-Flash é que ele não simplesmente une reconhecimento de fala, reconhecimento de imagem e outros recursos, mas processa nativamente diferentes tipos de informações no nível do modelo. Alibaba espera usar isso para permitir que o modelo não apenas “entenda” ou “entenda” o conteúdo de áudio e vídeo, mas também planeje tarefas, chame ferramentas e conclua o trabalho real após compreender essas informações.

Em termos de recursos de áudio, o desempenho do Qwen3.8-Omni-Flash é particularmente notável. Segundo dados divulgados pela Qwen, este modelo superou o Gemini 3.8 Flash em alguns testes de benchmark de áudio. Por exemplo, no teste de chamada de ferramenta multimodal WildClawBench-MM, Qwen3.8-Omni-Flash obteve 71,0 pontos, enquanto Gemini 3.8 Flash obteve 58,9 pontos; no teste DailyOmni, Qwen marcou 85,1 pontos e Gemini marcou 84,0 pontos; no SpotSoundBench, os dois marcaram 67,2 pontos e 39,7 pontos respectivamente; na prova MMAU obtiveram 81,8 pontos e 76,9 pontos.

O reconhecimento de fala de conferência com vários alto-falantes também é o foco desta atualização. Os dados de teste AliMeeting divulgados por Qwen mostram que a taxa de erro do alto-falante DER do Qwen3.8-Omni-Flash é 3,35, e a taxa de erro de palavra cpWER com atribuição de alto-falante é 17,18, enquanto a geração anterior Qwen3.5-Omni-Plus é 88,11 e 89,61 respectivamente. Isso significa que o novo modelo muda significativamente neste teste.

No entanto, o Qwen3.8-Omni-Flash não está à frente do Gemini 3.8 Flash em todos os projetos. Por exemplo, no teste AgenticVBench, Gemini 3.8 Flash marcou 45,0 pontos e Qwen marcou 36,8 pontos; no OmniGAIA, obtiveram 78,6 e 74,0 pontos respectivamente. Em alguns testes de compreensão de vídeo, o Gemini também manteve a vantagem. Portanto, a ênfase de Qwen na "aproximação de Gêmeos" se reflete mais nas capacidades gerais de áudio e áudio e vídeo, e não significa uma liderança geral em todos os projetos multimodais.

Outra mudança importante no Qwen3.8-Omni-Flash é o preço. Qwen diz que seu custo estimado por hora para entrada de áudio caiu mais de 98% e o custo por hora para entrada de áudio e vídeo caiu mais de 93% em comparação com o modelo anterior. Pelo método de cálculo oficial, o chamado custo “horário” é calculado multiplicando-se o preço de processamento de dois minutos de material por 30, em que o vídeo adota a condição de entrada de 720p e 1 quadro por segundo.

O preço regional internacional atual anunciado pelo Alibaba Cloud é de US$ 0,15 por milhão de entrada de token, o token de entrada que atinge o cache é de US$ 0,016 e o ​​token de saída por milhão é de US$ 0,47. Os preços na China continental e em algumas outras regiões podem variar. Como o áudio e o vídeo podem ser usados ​​diretamente como entradas do modelo, essa estrutura de preços é particularmente adequada para cenários como gravação de reuniões, análise de áudio longa, revisão de vídeo, geração de legendas e processamento de grandes quantidades de conteúdo de mídia.

A janela de contexto de 1 milhão de tokens amplia ainda mais essa vantagem. O comprimento máximo de entrada do Qwen3.8-Omni-Flash é próximo a 992.000 Tokens, o comprimento máximo de entrada no modo de pensamento é de aproximadamente 984.000 Tokens e o comprimento máximo de saída atinge 131.000 Tokens. Isso significa que os desenvolvedores podem entregar diretamente conteúdo de áudio ou vídeo em grande escala ao modelo para processamento, sem ter que fatiar e extrair quadros com frequência como no passado, e então usar vários modelos para completar o reconhecimento de fala, a compreensão visual e o raciocínio de texto, respectivamente.

As informações oficiais do Alibaba Cloud mostram que o Qwen3.8-Omni-Flash pode lidar com entrada de áudio em 113 idiomas e dialetos e oferece suporte à análise espacial de áudio. Através de parâmetros relevantes, o modelo pode lidar com áudio estéreo de dois canais e áudio espacial de quatro canais. Ao mesmo tempo, o modelo oferece suporte a chamadas de funções, pesquisa de rede, cache de contexto e outros recursos, e pode ser usado diretamente em fluxos de trabalho de agentes mais complexos.

Do ponto de vista da direção do aplicativo, a equipe Qwen se concentra na "entrega inteligente" desta vez. Por exemplo, o modelo pode analisar vídeos longos, localizar conteúdos importantes e outras ferramentas de chamada para concluir tarefas como edição de vídeo, organização de conteúdo, resumo de reuniões e geração de legendas. Qwen também anunciou Qwen-MM-Plugins para desenvolvimento de agentes multimodais e planeja lançar Qwen-Live-Harness para ajudar os desenvolvedores a construir ainda mais aplicativos de agentes inteligentes baseados em entrada de áudio e vídeo.

Em comparação com a geração anterior Qwen3.5-Omni, o foco desta atualização não é apenas melhorar a precisão do reconhecimento no sentido tradicional, mas tentar mudar a forma como a IA de áudio e vídeo é usada. No passado, as aplicações multimodais geralmente exigiam a extração de quadros de vídeo e a transcrição de áudio e, em seguida, a entrega dos diferentes resultados ao modelo de linguagem para processamento; Qwen3.8-Omni-Flash tenta unificar esses links em um modelo nativo totalmente modal, tanto quanto possível, e usa 1 milhão de contextos de token para processar diretamente conteúdo original mais longo.

Qwen3.8-Omni-Flash atualmente fornece serviços através do Alibaba Cloud Bailian, apoiando regiões como Pequim, Cingapura, Hong Kong, China, Tóquio, Japão, Frankfurt, Alemanha, e Virgínia, nos Estados Unidos. O modelo em si não abre diretamente os pesos como alguns modelos anteriores do Qwen. Desta vez, o Alibaba abre principalmente plug-ins multimodais de suporte e ferramentas de desenvolvimento relacionadas.

No geral, o núcleo desta atualização Qwen3.8-Omni-Flash não é apenas melhorar as pontuações de execução do modelo, mas reduzir simultaneamente os custos de processamento de vídeo grave, expandir a escala de contexto e combinar a compreensão de áudio e vídeo com a invocação de ferramentas. Em particular, o custo da entrada de áudio foi reduzido em mais de 98%. Se o custo real de uso puder atingir o nível de cálculo oficial, isso tornará mais fácil a análise automática em grande escala de gravações de reuniões de longo prazo, podcasts, transmissões ao vivo e materiais de vídeo, e intensificará ainda mais a competição entre Qwen e modelos multimodais como o Google Gemini.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários