Google lança função de interação humana digital Gemini 3.8 Live Live Avatar, dando face de vídeo em tempo real à IA

📅 2026-09-25

Resumo:

O Google anunciou que lançou oficialmente a função "Live Avatar" (humano digital em tempo real) na plataforma empresarial Gemini Enterprise. Esta tecnologia está profundamente integrada com a mais recente arquitetura de modelos grandes Gemini 3.8 Live do Google. Com base no atraso original quase zero e na conversação por voz altamente suave, ele introduz pela primeira vez recursos de geração de vídeo generativos quase em tempo real, permitindo que a inteligência artificial conversacional tenha uma imagem visual dinâmica que pode "ouvir, assistir e falar ao mesmo tempo".

De acordo com a introdução oficial, o Gemini 3.8 Live Live Avatar foi projetado para criar um assistente de serviço virtual mais intuitivo e envolvente para clientes corporativos. Ao sincronizar com precisão o fluxo de áudio com o modelo de geração de vídeo subjacente, o sistema pode obter sincronização labial de alta precisão, mudanças naturais na expressão facial e conversão suave de diálogos entre idiomas. Atualmente, o sistema humano digital suporta nativamente até 97 idiomas e não haverá distorção de vídeo ou desvio facial ao alternar entre idiomas no meio de uma conversa.

Além das inovações visuais, a plataforma também está equipada com poderosos recursos de chamada assíncrona de ferramentas. Ao mesmo tempo em que mantêm uma conversa natural e coerente com os usuários, os humanos digitais podem chamar silenciosamente várias APIs externas e interfaces de dados corporativos em segundo plano para lidar com negócios complexos de várias etapas, como registro de check-in em hotéis e preenchimento de documentos de reclamações de seguros, dizendo adeus completamente ao fenômeno de "travamento" ou longa espera silenciosa que ocorreu quando a IA processava tarefas em segundo plano no passado. Ao mesmo tempo, combinado com a função de câmera e compartilhamento de tela do dispositivo terminal, o humano digital também pode fornecer compreensão visual em tempo real e orientação interativa dos objetos físicos ou interfaces de software exibidas pelo usuário.

Em termos de segurança e conformidade, para evitar o risco de deepfakes de inteligência artificial e roubo de identidade, o Google criou diversas linhas de defesa de segurança para o Live Avatar. Por padrão, o sistema abre apenas para usuários corporativos a biblioteca digital de imagens humanas que foi predefinida por revisão oficial, enquanto a permissão para personalizar imagens de marcas exclusivas ou rostos específicos é colocada sob um mecanismo estrito de revisão de lista de permissões. Além disso, todos os fluxos de voz e vídeo dinâmicos em tempo real gerados pelo sistema foram incorporados com marcas d’água digitais SynthID invisíveis e invioláveis ​​para garantir a transparência e rastreabilidade do conteúdo gerado por IA.

Atualmente, as funções Gemini 3.8 Live e Live Avatar foram oficialmente abertas para clientes de assinatura de nível empresarial por meio de nós de serviço de data center nos EUA e na Europa, e o suporte de acesso à API do desenvolvedor é fornecido simultaneamente. Analistas da indústria apontaram que a integração da tecnologia de vídeo generativa diretamente no modelo de fala subjacente não apenas elimina a alta latência causada pelos conjuntos tradicionais de renderização de vídeo, mas também marca que o atendimento ao cliente virtual de IA e os terminais interativos inteligentes estão entrando em uma nova era de "diálogo visual com pessoa real e em tempo real".

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários