OpenAI abre o mesmo modelo de fala GPT-Live-1 que ChatGPT para desenvolvedores. O preço da API é de US$ 0,05 por minuto.

📅 2026-09-11

Resumo:

A OpenAI anunciou recentemente que o GPT-Live-1, atualmente usado para a função de voz ChatGPT, será oficialmente aberto aos desenvolvedores. Os desenvolvedores agora podem integrar esse modelo de voz em seus próprios aplicativos e processos de negócios por meio de APIs para criar assistentes de voz full-duplex que possam ouvir os usuários em tempo real e responder ao mesmo tempo. O preço do front-end de voz deste modelo é de US$ 0,05 por minuto, e o modelo usado em segundo plano para raciocínio complexo precisa ser cobrado separadamente de acordo com o preço do modelo correspondente.

1789093911_chatgpt_voice.webp

GPT-Live-1 é uma nova geração de modelo de fala em tempo real lançada pela OpenAI este ano. Sua maior característica é a arquitetura full-duplex. A IA de voz tradicional geralmente precisa completar as três etapas de reconhecimento de fala, inferência de modelo de linguagem e síntese de fala em sequência. Somente após o usuário terminar de falar o sistema pode iniciar o processamento e gerar respostas. O GPT-Live-1, por outro lado, pode gerar saída de fala enquanto ouve o usuário falar, para que possa lidar com interrupções, pausas, ecos e conversas rápidas de ida e volta com mais naturalidade.

Isso significa que os usuários não precisam esperar que a IA termine de falar completamente antes de continuar a falar. Caso o usuário mude de ideia, adicione informações ou interrompa diretamente, o GPT-Live-1 pode ajustar seu comportamento a tempo de acordo com a conversa em andamento. O modelo também pode dizer quando continuar falando, quando fazer uma pausa, quando continuar ouvindo e quando recorrer a ferramentas.

A OpenAI afirmou que esta arquitetura pode reduzir significativamente o atraso na interação de voz e resolver os problemas de conexão que tendem a ocorrer em conversas reais no pipeline tradicional de "reconhecimento de fala + modelo de linguagem grande + síntese de fala". Como o próprio GPT-Live-1 lida com áudio de entrada e saída, os desenvolvedores não precisam mais coordenar a comutação complexa entre vários modelos independentes.

No teste publicado pela OpenAI, o desempenho do GPT-Live-1 no teste Full Duplex Bench foi 30 pontos percentuais superior ao do GPT-Realtime-2.1, especialmente em termos de atraso na tomada de turnos e comportamento interativo. Quando emparelhado com o GPT-6 Astra em intensidade de inferência média, o GPT-Live-1 também alcançou o primeiro lugar no teste Tau3. Tau3 é usado principalmente para avaliar a capacidade dos agentes de voz de concluir tarefas ponta a ponta.

Outra característica importante do GPT-Live-1 é que ele não é responsável por todo o trabalho de raciocínio complexo. OpenAI separa o modelo de fala responsável pela audição, fala e interação em tempo real do modelo de fundo responsável pelo raciocínio profundo. Quando os usuários fazem perguntas que exigem pesquisa, análise complexa ou tarefas longas, o GPT-Live-1 pode transferir essas tarefas para o modelo de segundo plano enquanto continua a manter a comunicação de voz natural com o usuário.

Portanto, os desenvolvedores são livres para escolher modelos de back-end com base nas necessidades específicas do negócio. Por exemplo, para um grande número de tarefas simples, como reservas e atualizações de pedidos, podem ser utilizados modelos mais rápidos e de menor custo; para problemas complexos do cliente, eles podem ser tratados por modelos de inferência mais fortes. Essa arquitetura permite que os desenvolvedores encontrem um equilíbrio entre capacidade de resposta, capacidade de raciocínio e custo de uso.

A OpenAI afirmou que esse design desacoplado também permite que o GPT-Live-1 continue a se comunicar com os usuários enquanto executa tarefas em segundo plano, em vez de permitir que os usuários enfrentem um longo período de espera silenciosa. O modelo pode continuar uma conversa natural enquanto conclui um trabalho mais complexo em segundo plano e, em seguida, trazer os resultados de volta à conversa atual quando a tarefa for concluída.

Aplicações práticas já estão começando a surgir. Os primeiros exemplos demonstrados pela OpenAI incluem serviços de voz, como Yelp Host e Hatch, e a plataforma de aprendizagem de idiomas Speak. O Speak descobriu nas primeiras avaliações que, em comparação com os sistemas de fala anteriores baseados em turnos, o GPT-Live-1 pode dar aos alunos mais tempo para pensar, reduzindo o número de interrupções proativas do sistema para os usuários em quase 80%.

Para empresas, esse recurso é especialmente adequado para atendimento ao cliente, atendimento telefônico ao cliente, reservas e outros cenários que exigem interação de voz contínua. O GPT-Live-1 oferece suporte nativo a cenários telefônicos, para que os desenvolvedores possam usá-lo para criar agentes de voz full-duplex que possam atender e gerenciar chamadas telefônicas, como reservas em restaurantes, suporte ao cliente e outros negócios que exigem comunicação em tempo real.

O GPT-Live-1 também fornece texto transcrito com reconhecimento de fala automático nativo e texto de resposta de modelo e melhora a compreensão de combinações alfanuméricas, ao mesmo tempo em que oferece suporte a funções de polarização de palavras-chave. Embora não seja um modelo baseado em turnos no sentido tradicional, ele ainda oferece suporte nativo à detecção de turnos. Portanto, se os desenvolvedores precisarem controlar claramente quando o usuário termina de falar e quando o sistema começa a responder, eles ainda podem projetar seus aplicativos em torno de diálogos claros.

O GPT-Live-1 também foi otimizado para cenas com ambientes de fundo barulhentos. O modelo consegue distinguir melhor entre a fala do usuário, ruído de fundo e silêncio. Ele não interromperá frequentemente as conversas por causa dos sons do ambiente ao redor, nem lembrará constantemente os usuários quando eles estão apenas pensando brevemente. Esse recurso é especialmente importante para chamadas telefônicas, atendimento ao cliente e assistentes de voz móveis em ambientes do mundo real.

OpenAI também expandiu a seleção de sons disponíveis para GPT-Live-1. Em comparação com o número relativamente limitado de vozes em tempo real disponíveis anteriormente, a nova versão oferece vozes mais diversificadas e abrange uma gama mais rica de sotaques, dialetos e idiomas. A OpenAI afirma que continuará adicionando vozes e idiomas disponíveis nos próximos meses.

Em termos de implantação do modelo, os desenvolvedores não precisam entregar todas as tarefas ao GPT-Live-1. A OpenAI espera usá-lo como front-end responsável pela interação de voz em tempo real, assumindo trabalhos mais complexos por meio de modelos de segundo plano e estruturas de agentes. Essa abordagem também permite que os desenvolvedores combinem diferentes modelos de acordo com as necessidades reais das diferentes tarefas.

Por exemplo, os desenvolvedores podem deixar o GPT-Live-1 ser responsável por receber solicitações de voz do usuário, manter conversas naturais e lidar com interrupções e, em seguida, entregar perguntas que exigem raciocínio complexo ao modelo de segundo plano; depois que o modelo de fundo conclui o trabalho, o GPT-Live-1 converte os resultados em respostas de voz naturais. Este mecanismo também se aplica a aplicações que necessitam chamar ferramentas externas.

A OpenAI também demonstrou como combinar o GPT-Live-1 com ferramentas como o Codex. Os desenvolvedores podem permitir que o modelo de fala receba as tarefas propostas pelo usuário, depois transfira o contexto relevante para ferramentas de segundo plano, como o Codex, para processamento e, em seguida, retorne os resultados do processamento ao GPT-Live-1, que continuará a se comunicar com o usuário por voz.

Em termos de preço, o GPT-Live-1 agora está oficialmente disponível por meio da API OpenAI, e o front-end de voz cobra US$ 0,05 por minuto. É importante observar que este é apenas o custo da camada de voz em tempo real. Se o desenvolvedor equipar o GPT-Live-1 com um modelo de inferência em segundo plano, o custo de chamar o modelo em segundo plano deverá ser calculado separadamente com base no preço do modelo correspondente.

Isso significa que para aplicativos de negócios que exigem um grande número de chamadas de voz, o custo real não é apenas US$ 0,05 por minuto, mas é composto pelo tempo de conexão de voz e pelo consumo de inferência do modelo de segundo plano. No entanto, os desenvolvedores podem controlar o custo geral de acordo com a complexidade da tarefa, escolhendo diferentes modelos de back-end.

A abertura do GPT-Live-1 também significa que a OpenAI está ampliando ainda mais a tecnologia central por trás do modo de voz ChatGPT, dos produtos de consumo ao ecossistema de desenvolvedores. Anteriormente, o GPT-Live-1 existia principalmente como o recurso de interação de voz do ChatGPT. Agora os desenvolvedores podem usar tecnologias semelhantes diretamente para criar seus próprios aplicativos e agentes de voz.

Do ponto de vista técnico, a OpenAI espera que o GPT-Live-1 não apenas resolva "permitir que a IA fale", mas também permita que a IA participe verdadeiramente de conversas naturais contínuas, em tempo real e interrompíveis. Ao dividir a audição, a fala, a interação em tempo real e o raciocínio profundo, a OpenAI tenta obter menor latência de voz, uma experiência de conversa mais natural e recursos mais fortes de processamento de tarefas em segundo plano ao mesmo tempo.

À medida que os agentes de voz mudam gradualmente de simples perguntas e respostas de voz para tarefas complexas, como atendimento telefônico ao cliente, reservas, ensino de idiomas, processamento de negócios e a capacidade de chamar ferramentas de forma autônoma para concluir tarefas, a importância dos modelos de fala em tempo real também está aumentando. A API aberta do GPT-Live-1 significa que os desenvolvedores agora podem incorporar diretamente a atual geração de tecnologia de voz em tempo real usada pelo ChatGPT em seus próprios produtos, e o preço da camada de voz de US$ 0,05 por minuto também permite que esse recurso entre oficialmente no estágio de aplicação comercial.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários