Microsoft lança modelo de transcrição e síntese de fala em tempo real MAI-Transcribe-2-Streaming, ocupando o primeiro lugar na lista de reconhecimento de streaming

📅 2026-10-02

Resumo:

A Microsoft lançou três novos modelos para interação de voz em tempo real, nomeadamente o modelo de fala para texto MAI-Transcribe-2-Streaming e os modelos de texto para fala MAI-Voice-2.1 e MAI-Voice-2.1-Flash. A Microsoft espera que os desenvolvedores os combinem para criar assistentes de voz e agentes de conversação que possam processar enquanto ouvem e responder instantaneamente com fala natural.

MAI-Transcribe-2-Streaming é diferente do MAI-Transcribe-2 anterior, que só pode processar arquivos de gravação. Ele pode receber fluxos de áudio de entrada contínua e começar a gerar texto preparado antes que o palestrante termine de falar. Ele continuará a ser revisado à medida que mais contexto surgir e, finalmente, apresentar resultados estáveis. A Microsoft disse que o modelo suporta 60 idiomas e pode reconhecer idiomas de forma contínua e automática; Presume-se que o primeiro lote de reconhecimento apareça um pouco mais de 100 milissegundos após o recebimento do áudio e é adequado para cenários como agentes de voz, atendimento ao cliente, legendas em conferências e salas de aula e entrada de voz. Os testes internos de ditado e legendas da Microsoft mostram que o texto aparece duas vezes mais rápido que o concorrente mais próximo, uma comparação baseada nas análises da própria empresa.

O benchmark de transcrição de streaming da Artificial Analysis classifica o modelo em primeiro lugar em termos de precisão do texto final e encenado. Os resultados do teste publicados foram que a taxa de erro da palavra final transcrita foi de cerca de 2,5%, e o texto final foi fornecido cerca de 0,13 segundos após a detecção do final do discurso. A lista comparou 38 modelos da época, testou cerca de 8 horas de áudio e cobriu três tipos de corpus: AA-AgentTalk, VoxPopuli e Earnings22, representando 50%, 25% e 25% do peso abrangente respectivamente. Quanto menor a taxa de erro de palavras, melhor. Este resultado ilustra o desempenho do modelo neste conjunto de benchmarks e não significa que a mesma precisão possa ser alcançada em todas as linguagens, ambientes ruidosos e aplicações do mundo real.

MAI-Transcribe-2-Streaming está atualmente à venda por US$ 0,54 por hora de áudio e a oferta dura até o final de 2026; em comparação, o MAI-Transcribe-2 sem streaming foi anunciado anteriormente por US$ 0,10 por hora. A versão em tempo real é mais adequada para interação contínua, enquanto a versão em lote é para gravação de transcrição de áudio. Os preços dos dois não podem ser simplesmente considerados uma comparação direta sob o mesmo método de utilização.

O novo modelo de síntese de voz MAI-Voice-2.1 suporta 23 idiomas e 26 variantes regionais, permitindo que a mesma voz sintetizada alterne entre diferentes idiomas, mantendo a identidade do locutor e adotando o sotaque local do idioma correspondente. O preço é de US$ 22 por 1 milhão de caracteres. MAI-Voice-2.1-Flash para solicitações de baixa latência e grande escala suporta o mesmo idioma. A Microsoft diz que pode gerar 45 segundos de áudio com um atraso ponta a ponta de cerca de 150 milissegundos. A velocidade de inferência do modelo aumentou 55% e o preço é cerca de 60% menor que modelos comparáveis. O preço é de US$ 15 por 1 milhão de caracteres. Este último conjunto de vantagens de velocidade e preço está entre as comparações publicadas pela Microsoft.

Ambos os modelos de voz suportam clonagem de voz em tempo real entre idiomas, mas apenas com o uso de vozes de referência autorizadas e consentidas. A documentação da Microsoft lista o recurso como acesso restrito, com recomendação de áudio de referência de 5 a 60 segundos e proteções contra abuso. MAI-Voice-2.1 é adequado para conteúdos mais longos, narrações e audiolivros, enquanto o Flash é mais adequado para cenários em tempo real, como agentes de voz, assistentes e atendimento ao cliente.

Todos os três modelos podem ser usados ​​através do Microsoft Foundry, MAI Playground e Vercel; os dois modelos de voz também foram conectados ao OpenRouter e podem ser chamados através do Azure Voice Live. Espera-se que o suporte ao LiveKit seja lançado posteriormente. A documentação do Microsoft Azure atualmente rotula esses modelos como versão prévia pública, afirmando que não há acordo de nível de serviço e que eles não são recomendados para uso direto em cargas de trabalho de produção.

Saiba mais:

https://microsoft.ai/news/our-first-streaming-transcription-model/

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários