Na prática

GPT-Live-1 chega à API: a voz da IA começa a conversar sem esperar a vez

O novo modelo de voz consegue ouvir e falar ao mesmo tempo, lidar melhor com interrupções e delegar ações a outros modelos. O atendimento automático fica mais natural e exige controles mais sérios.

2 min de leitura
Ilustração de um microfone e fones de ouvido com ondas sonoras em azul e rosa.
Ilustração editorial gerada por IA.

O que você precisa saber

  • O GPT-Live-1 processa entrada e saída de áudio ao mesmo tempo.
  • Ele pode delegar raciocínio e uso de ferramentas a um modelo de texto no back-end.
  • A camada de voz custa US$ 0,05 por minuto; modelos e ferramentas usados no back-end são cobrados à parte.

Entenda a notícia

A OpenAI lançou o GPT-Live-1 na API com uma mudança perceptível para quem fala com assistentes: o modelo consegue ouvir e responder ao mesmo tempo. Isso permite interromper, hesitar ou mudar de direção sem esperar o robô terminar uma fala inteira.

Os sistemas de voz tradicionais costumam encadear três etapas: transcrição, raciocínio e síntese de fala. Cada passagem adiciona atraso e aumenta a chance de perder o ritmo da conversa. O novo modelo concentra a camada de voz e pode encaminhar decisões mais complexas ou chamadas de ferramentas para um modelo de texto no back-end.

Na prática, a tecnologia se encaixa em reservas, agendamentos, pedidos e atendimento telefônico. A empresa pode ajustar tom, velocidade e estilo de fala e conectar o assistente aos sistemas que já consultam disponibilidade, cadastro ou status de uma solicitação.

O preço anunciado para a camada frontal de voz é de US$ 0,05 por minuto. Essa não é necessariamente a conta completa: o modelo de raciocínio, as ferramentas e a infraestrutura conectados por trás da conversa também podem gerar custo.

Naturalidade aumenta a responsabilidade. É preciso avisar que a pessoa fala com uma IA, proteger gravações e transcrições, confirmar ações importantes e oferecer saída rápida para atendimento humano. Uma voz convincente não pode esconder limites nem criar uma falsa sensação de certeza.

O que isso significa para o seu negócio: atendimento por voz deixou de ser apenas um menu falado e se aproximou de uma conversa real. Teste primeiro uma tarefa estreita, como confirmar horários, e acompanhe interrupções, erros, transferências para humanos e custo por resolução.

Na fonte

  1. Build more natural voice experiences with GPT-Live-1 in the API

    OpenAI · Fonte primária · publicado em 10 set 2026 · consultado em 11 set 2026

Texto produzido com apoio de IA e verificado pela Rensen a partir da fonte primária listada.

Encontrou algo que precisa de correção? Veja como avisar a Rensen.

Mais para ler