LiveLingoLiveLingoTry free

Tradução com GPT-Live: Recursos, Limites e Latência Medida (2026)

O GPT-Live-1 e o GPT-Live-1 mini são os modelos de voz full-duplex da OpenAI: escutam e falam ao mesmo tempo, e a tradução ao vivo é uma das capacidades de destaque. Eles estrearam no ChatGPT em 8 de julho de 2026 e chegaram à API da OpenAI em 10 de setembro de 2026, o que finalmente permite medir a promessa de tradução em vez de presumi-la. Este guia cobre o que foi lançado, como a tradução realmente funciona e o que a medição independente mostra agora sobre seus limites.

Conflito de interesse

Este guia é publicado pelo LiveLingo (Lunana Global Inc.), um produto de tradução por voz que concorre com a tradução por voz do ChatGPT. Temos interesse financeiro na adoção do LiveLingo. As afirmações factuais sobre o GPT-Live têm como fonte o anúncio, o system card e a documentação para desenvolvedores da OpenAI, além da cobertura independente do lançamento, tudo linkado no texto e na seção de Fontes. As medições da Seção 5 são do próprio LiveLingo, feitas pela API da OpenAI contra o mesmo áudio entregue a todos os outros sistemas, com os dados por clipe publicados em livelingo.io/research/gpt-live-1-interpreter-test para verificação independente.

Resposta Rápida: O GPT-Live faz tradução de voz em tempo real?

Sim, e ele mantém o papel de intérprete de forma confiável, mas fica progressivamente para trás em fala contínua. No ChatGPT, inicie uma sessão de Voz e diga algo como "traduza simultaneamente tudo o que eu disser para o espanhol". Como os modelos são full-duplex, a tradução flui enquanto você ainda está falando. Contas gratuitas recebem o GPT-Live-1 mini; os planos pagos Go, Plus e Pro recebem o GPT-Live-1. Desde 10 de setembro de 2026, desenvolvedores também podem chamá-lo diretamente como gpt-live-1 em v1/live/sessions, a $0.05 por minuto mais o uso do modelo de backend. Medido ao longo de uma sessão de 452 segundos, seu atraso de conclusão subiu de 5,7 segundos a um platô de 10 a 14 segundos de inglês para espanhol e, de inglês para japonês, ele traduziu apenas 17% das frases dentro de 30 segundos.

1. O Que a OpenAI Lançou, e o Que Mudou em Setembro

A OpenAI anunciou o GPT-Live na quarta-feira, 8 de julho de 2026, em um post de blog e uma transmissão ao vivo (Introducing GPT-Live). Dois modelos foram lançados: o GPT-Live-1, o novo modelo de voz padrão dos planos pagos Go, Plus e Pro, e o GPT-Live-1 mini, o novo padrão das contas gratuitas (segundo o MacRumors e o The Decoder). Ambos substituem o Advanced Voice Mode como padrão do ChatGPT Voice, com o modo antigo permanecendo selecionável nas configurações de voz.

Em 10 de setembro de 2026, os modelos chegaram à API da OpenAI, a mudança mais importante desde o lançamento. O GPT-Live-1 agora é chamável como gpt-live-1 no endpoint v1/live/sessions, a $0.05 por minuto de conversa para a camada de voz, com o modelo de backend que cuida do raciocínio cobrado separadamente (referência do modelo). Até então, a promessa de tradução se apoiava na demonstração da OpenAI e em relatos da imprensa. Agora ela pode ser medida diretamente, e é exatamente o que a Seção 5 faz.

O recurso que o define é o áudio full-duplex: o modelo processa o que ouve enquanto está falando, tomando decisões de interação muitas vezes por segundo, de modo que pode ser interrompido naturalmente, responder com sinais de escuta ("mhmm", "entendi") enquanto você fala, ou ficar em silêncio enquanto você pensa (MarkTechPost). Para qualquer coisa que exija busca na web, raciocínio mais profundo ou trabalho de agente, o GPT-Live delega ao GPT-5.5 em segundo plano e mantém a conversa em andamento enquanto o resultado chega. Os usuários podem escolher três níveis de raciocínio (Instant, Medium, High); os níveis mais altos são roteados para o GPT-5.5 Thinking.

As avaliações publicadas pela OpenAI focam em capacidade, não em velocidade: no raciocínio High, o GPT-Live-1 marca 84.2% no GPQA contra 45.3% do Advanced Voice Mode, e 75.2% no BrowseComp contra 0.7%. Em testes de preferência humana, o GPT-Live-1 foi preferido ao Advanced Voice Mode em 75.7% das conversas, e o mini em 69.2% (The Decoder, citando o anúncio da OpenAI). De forma independente, a Artificial Analysis coloca o GPT-Live-1 em segundo lugar geral em seu índice de fala para fala, com 81.5 pontos e 1,34 segundo até o primeiro áudio. A OpenAI continua sem publicar números de latência específicos de tradução.

2. Como Funciona a Tradução ao Vivo no GPT-Live

A tradução ao vivo é uma das capacidades que a OpenAI nomeia explicitamente nos materiais de lançamento: a arquitetura full-duplex permite ao modelo "engajar em idas e vindas mais naturais, manter uma melhor noção de tempo e até realizar tradução ao vivo" (anúncio da OpenAI). Em briefings de imprensa, a OpenAI demonstrou o modelo falando uma tradução contínua enquanto o apresentador falava.

É um prompt, não um modo

Não há botão de tradutor, seletor de par de idiomas nem interface dedicada de tradução. Você inicia uma sessão de Voz e instrui o assistente: "Quero que você traduza simultaneamente tudo o que eu estiver dizendo para o hindi." O modelo então produz uma tradução falada enquanto você fala, e continua até você mandar parar ou trocar. É o mesmo padrão invocado por prompt que o ChatGPT Voice tem desde o lançamento Realtime de maio de 2026; o que mudou foi a entrega full-duplex, que permite à tradução se sobrepor à sua fala em vez de esperar seu turno terminar.

O papel se mantém, o que não é óbvio

A falha esperada de um modelo conversacional instruído a interpretar é que ele responda ao falante em vez de traduzi-lo. Isso não aconteceu. Ao longo de 27 minutos de áudio interpretado nos testes medidos, cobrindo inglês para espanhol, inglês para japonês e chinês para inglês, ele nunca respondeu ao falante no lugar de traduzir: nenhuma pergunta de esclarecimento, nenhum comentário, nenhum retorno ao comportamento de assistente. Não é no seguimento de instruções que isso falha.

O custo de ser assistente antes de tradutor

O GPT-Live é um assistente conversacional geral que traduz sob demanda, não um intérprete dedicado, e esse formato tem consequências para o ritmo, não para a obediência. Um modelo conversacional fala em um ritmo natural e não comprime nem descarta conteúdo quando fica para trás. A interpretação tem o requisito oposto: o falante continua de qualquer forma, então um sistema que não consegue acompanhar precisa resumir, pular ou aceitar atraso sem limite. No app de consumo, o comportamento de sinais de escuta que torna a conversa natural ("mhmm", "é") também injeta áudio que não é tradução dentro de uma sessão de tradução, e usuários do primeiro dia relataram amplamente isso como intrusivo (BigGo).

3. GPT-Live vs. o Tradutor Dedicado da OpenAI

A OpenAI oferece duas superfícies diferentes de tradução ao vivo, e são pilhas distintas. Em 7 de maio de 2026, a OpenAI lançou o gpt-realtime-translate na Realtime API: um modelo de tradução de fala para fala em streaming, construído para esse fim, treinado em milhares de horas de áudio de intérpretes profissionais e configurado para permanecer somente em tradução e esperar contexto suficiente antes de produzir fala (anúncio da OpenAI). O GPT-Live é o assistente full-duplex de propósito geral que traduz quando pedimos. Os dois já estão disponíveis para desenvolvedores, o que torna possível, pela primeira vez, uma comparação direta.

As duas superfícies de tradução ao vivo da OpenAI em 16 de setembro de 2026. Fatos conforme os anúncios e a documentação para desenvolvedores da OpenAI; medições conforme a LiveLingo Research.
GPT-Live (gpt-live-1)gpt-realtime-translate
O que éAssistente de voz full-duplex; tradução por promptModelo dedicado de tradução de fala para fala em streaming
LançamentoChatGPT em 8 de julho de 2026; API em 10 de setembro de 20267 de maio de 2026
AcessoApp do ChatGPT mais o endpoint de API /v1/live/sessionsRealtime API, endpoint /v1/realtime/translations
PreçoIncluído nos planos do ChatGPT; $0.05/min via API mais o modelo de backend$0.034 por minuto de áudio
IdiomasNão publicados; "a maioria dos idiomas falados", lacunas de sotaque divulgadas70+ idiomas de entrada; 13 idiomas de saída (documentados)
Permanece no papel de tradutorSim quando instruído; zero quebras de papel em 27 minutos de testeSim; somente tradução por design, sem prompts de sistema
Atraso de conclusão, en→esMediana de 11,72 s, subindo a um platô de 10 a 14 sMediana de 2,65 s, estável
Cobertura do japonês em até 30 s17%98%
TranscriçõesDeltas de transcrição da origem e da saídaDeltas de texto da fala de origem e traduzida

Os 13 idiomas de saída documentados do gpt-realtime-translate: inglês, espanhol, português, francês, alemão, italiano, russo, chinês, japonês, coreano, hindi, indonésio e vietnamita (OpenAI Cookbook). A OpenAI continua sem publicar uma lista de idiomas do GPT-Live, então o comportamento medido é o único guia, e ele varia enormemente conforme o idioma.

Duas correções da semana de lançamento que merecem ficar explícitas, porque a cobertura inicial confundiu as duas superfícies: o GPT-Live não tem o preço de API que circulou em julho (os valores de "$32 por milhão de tokens de entrada de áudio, $64 de saída" presentes em alguns posts pertencem ao gpt-realtime-2, um modelo diferente), e a afirmação de que o GPT-Live não estaria disponível via API deixou de valer em 10 de setembro de 2026: o modelo é gpt-live-1, o endpoint é v1/live/sessions e o preço é $0.05 por minuto para a camada de voz, mais o modelo de backend.

4. Limites Que a OpenAI e os Testes Independentes Divulgam

  • O atraso se acumula em fala contínua. O atraso de conclusão medido subiu de 5,7 segundos a um platô de 10 a 14 segundos em três minutos, de inglês para espanhol, e ficou nesse patamar pelo resto da sessão.
  • O japonês degrada gravemente. 17% das frases traduzidas dentro de 30 segundos, contra 98% do mesmo modelo para o espanhol, com 20 das 90 frases nunca traduzidas.
  • Os limites de uso existem, mas não são publicados. A central de ajuda da OpenAI declara que os limites de uso de voz variam por plano e por opção de Voz e podem mudar. Relatos de terceiros com números específicos se contradizem; trate qualquer valor específico como não verificado.
  • Nenhum número oficial de latência. A OpenAI divulgou benchmarks de capacidade (GPQA, BrowseComp, taxas de preferência), mas nenhuma medição de primeiro áudio ou de atraso para tradução.
  • A cobertura de idiomas não é documentada. "A maioria dos idiomas falados", com sotaques não nativos e lacunas de fluência divulgados para os demais.
  • Os sinais de escuta não podem ser totalmente desativados no app de consumo, embora uma instrução explícita de somente tradução tenha se mantido sem exceção nos testes pela API.
  • O monitoramento de segurança pode interferir. Segundo o system card do GPT-Live, o monitoramento em tempo real pode direcionar ou interromper uma resposta, reproduzir uma mensagem de segurança falada ou encerrar conversas de alto risco.

5. O Que a Medição Independente Mostra

O que medimos (e o que não medimos)

Estes números vêm do gpt-live-1 pela API da OpenAI, instruído a atuar como intérprete simultâneo, medido em 15 de setembro de 2026. Não são medições da experiência de consumo do ChatGPT: contas gratuitas rodam o GPT-Live-1 mini, e o app acrescenta detecção de voz no cliente e um prompt próprio que nenhum harness consegue isolar. Todos os sistemas da comparação receberam áudio idêntico no mesmo ritmo de tempo real, e os dados por clipe estão publicados em livelingo.io/research/gpt-live-1-interpreter-test.

O atraso de conclusão é o momento em que a tradução de uma frase termina de ser entregue, menos o momento em que o falante terminou de dizê-la. Um fluxo contínuo de 452 segundos, 90 frases, áudio idêntico para todos os sistemas. Metodologia completa: /research/gpt-live-1-interpreter-test.
SistemaAtraso en→esAtraso en→jaCobertura do japonês em até 30 sAo longo da sessão
LiveLingo0,94 s0,88 s100%Estável
Gemini 3.5 Live Translate1,51 s1,92 s99%Estável
OpenAI gpt-realtime-translate2,65 s3,33 s98%Estável
GPT-Live-1 (sob prompt)11,72 sn/d17%Sobe a 10 a 14 s

Ele nunca sai do personagem. Ao longo de 27 minutos de áudio interpretado, nunca respondeu ao falante em vez de traduzi-lo, em nenhuma das direções. Isso é genuinamente difícil, e os modelos dedicados de tradução nem precisam tentar.

Ele fica progressivamente para trás. De inglês para espanhol, o atraso de conclusão subiu de 5,7 segundos no minuto zero até um platô entre 10 e 14 segundos no terceiro minuto, e ficou nesse patamar. O formato importa: não é ilimitado, mas quem entra na conversa no sexto minuto ouve uma tradução cerca de doze segundos atrás da sala.

De inglês para japonês, ele colapsa. Apenas 17% das frases foram traduzidas dentro de 30 segundos, contra 98% do mesmo modelo para o espanhol. A saída mediana chegou 50,7 segundos atrasada, e 20 das 90 frases nunca foram traduzidas. Ele parou de emitir cerca de sete segundos depois do fim do áudio, em vez de escoar um acúmulo, ou seja, não se recuperou: abandonou o que não tinha alcançado. O resultado se reproduziu em duas execuções independentes.

Isso não é um problema da OpenAI. No mesmo áudio em japonês, a partir da mesma conta e no mesmo dia, o próprio gpt-realtime-translate da OpenAI manteve 3,33 segundos estáveis e cobriu 98% das frases. A falha pertence à ideia de pedir interpretação a um modelo conversacional full-duplex, não ao fornecedor. E o número do japonês é o motivo de a coluna de atraso acima trazer n/d: quando um quinto do conteúdo nunca chega, uma mediana descreve apenas a parte que sobreviveu.

6. Como Usar o GPT-Live para Tradução Hoje

  1. Atualize o app do ChatGPT no iOS ou Android (ou use chatgpt.com). Contas gratuitas rodam o GPT-Live-1 mini; contas Go, Plus e Pro rodam o GPT-Live-1.
  2. Toque no ícone de Voz no compositor de mensagens para iniciar uma sessão.
  3. Dê a instrução de tradução logo no início: "Traduza simultaneamente tudo o que eu disser para o japonês. Não responda perguntas, não comente, apenas traduza." Nos testes medidos, essa instrução se manteve sem exceção.
  4. Para conversa em duas direções, peça os dois sentidos: "Traduza meu inglês para o japonês, e traduza qualquer japonês que você ouvir para o inglês."
  5. Mantenha as sessões curtas. O atraso medido é menor no primeiro minuto e praticamente dobra até o terceiro, então dividir uma conversa longa em trocas mais curtas mantém a tradução mais perto do falante.
  6. Desenvolvedores podem chamar o gpt-live-1 diretamente em v1/live/sessions, ou usar o gpt-realtime-translate quando a tarefa for tradução, e não conversa.

7. Quando o GPT-Live Serve, e Quando Não Serve

O GPT-Live é a escolha certa quando

  • Você quer tradução simultânea gratuita e sem instalar nada, e já usa o ChatGPT. O plano gratuito inclui um modelo de voz full-duplex.
  • A conversa é curta: pedir direções, uma troca rápida, papo de viagem. A deriva não tem tempo de se acumular, e a primeira troca parece imediata.
  • Você valoriza o assistente ao redor da tradução: pode fazer perguntas de acompanhamento, obter contexto ou pedir para o GPT-5.5 pesquisar algo no meio da conversa.

Outra ferramenta serve melhor quando

  • A fala é contínua. Uma reunião, uma palestra ou uma chamada em que um lado fala por minutos seguidos é onde o platô medido de 10 a 14 segundos vira a experiência inteira.
  • Você está traduzindo para o japonês, ou para qualquer idioma cujo comportamento você não verificou. A cobertura variou de 98% a 17% entre dois idiomas no mesmo modelo.
  • Você precisa de uma transcrição legível nos dois idiomas enquanto escuta. O GPT-Live entrega um registro de chat, não uma visão lado a lado de origem e tradução que nunca se reescreve.
  • Você precisa de chamadas telefônicas traduzidas. Nenhuma das superfícies da OpenAI disca para um número de telefone. O LiveLingo faz chamadas de saída para números de telefone comuns com a tradução rodando na linha, sem que o destinatário precise de nenhum app.

Uma concessão honesta. O LiveLingo (que publica este guia) está na categoria de tradutor dedicado, então leia a comparação com isso em mente. A naturalidade conversacional do GPT-Live é um avanço real, sua alternância de turnos full-duplex está à frente de todo app de tradutor dedicado, incluindo o nosso, seu plano gratuito o torna a forma mais fácil de qualquer pessoa experimentar tradução de voz em tempo real hoje, e ele manteve o papel de intérprete por 27 minutos sem um único deslize. O que ele não faz é acompanhar um falante que não espera. Especificações lado a lado: /compare/chatgpt-translation. Medições completas: /research/gpt-live-1-interpreter-test.

8. Perguntas Frequentes

O que é o GPT-Live?

O GPT-Live é a família de modelos de voz full-duplex da OpenAI, estreada no ChatGPT em 8 de julho de 2026. Dois modelos foram lançados: o GPT-Live-1 (padrão dos planos pagos Go, Plus e Pro) e o GPT-Live-1 mini (padrão dos usuários gratuitos). Diferente do Advanced Voice Mode que ele substitui, o GPT-Live escuta e fala ao mesmo tempo, então pode ser interrompido naturalmente, emitir sinais de escuta enquanto você fala e realizar tradução ao vivo enquanto você ainda está falando. Ele delega consultas complexas ao GPT-5.5 em segundo plano. Funciona no iOS, Android e chatgpt.com e, desde 10 de setembro de 2026, também está disponível para desenvolvedores como gpt-live-1 na API da OpenAI.

O GPT-Live consegue traduzir em tempo real?

Sim, e nos testes medidos ele nunca abandonou o papel de intérprete ao longo de 27 minutos de áudio. A tradução é invocada por prompt, não por um botão de modo: diga ao assistente para "traduzir simultaneamente tudo o que eu disser para o japonês" e ele fala uma tradução contínua enquanto você conversa. A limitação é o ritmo, não a obediência: o atraso de conclusão subiu de 5,7 segundos a um platô de 10 a 14 segundos de inglês para espanhol ao longo de uma sessão de 452 segundos.

O GPT-Live tem API?

Sim, desde 10 de setembro de 2026. O GPT-Live-1 está disponível como o modelo gpt-live-1 no endpoint v1/live/sessions, a $0.05 por minuto de conversa para a camada de voz, com o modelo de backend que cuida do raciocínio cobrado separadamente. Isso mudou em relação à estreia de 8 de julho no ChatGPT, quando o GPT-Live era exclusivo do ChatGPT. A OpenAI também oferece um modelo de tradução separado e construído para esse fim, o gpt-realtime-translate, a $0.034 por minuto, com 70+ idiomas de entrada e 13 idiomas de saída.

Quanto atraso o GPT-Live acrescenta ao traduzir?

Medido pela API em 15 de setembro de 2026: uma mediana de 11,72 segundos para terminar de entregar uma frase de inglês para espanhol, subindo ao longo da sessão de 5,7 segundos no minuto zero até um platô de 10 a 14 segundos no terceiro minuto. No mesmo áudio, o próprio gpt-realtime-translate da OpenAI marcou 2,65 segundos, o Gemini 3.5 Live Translate 1,51 segundo e o LiveLingo 0,94 segundo, todos estáveis ao longo dos mesmos 452 segundos, sem derivar.

Por que o GPT-Live tem dificuldade com a tradução para o japonês?

Ele fica para trás a ponto de não conseguir mais se recuperar. Apenas 17% das frases em japonês foram traduzidas dentro de 30 segundos após serem ditas, contra 98% do mesmo modelo para o espanhol; a saída mediana chegou 50,7 segundos atrasada e 20 das 90 frases nunca foram traduzidas. O resultado se reproduziu em duas execuções. O gpt-realtime-translate dedicado da OpenAI cobriu 98% das frases a 3,33 segundos estáveis no mesmo áudio, então isso é específico de pedir tradução a um modelo conversacional, e não uma limitação do japonês da OpenAI.

O GPT-Live é gratuito?

No ChatGPT, sim, com uma divisão por plano. O GPT-Live-1 mini é o modelo de voz padrão das contas gratuitas; os planos pagos Go, Plus e Pro recebem o GPT-Live-1, maior. Nenhuma assinatura nova foi introduzida, e os limites de uso de voz variam por plano, sem tetos de minutos publicados. A API é separada e medida por consumo, a $0.05 por minuto para a camada de voz, mais o uso do modelo de backend.

Quais idiomas o GPT-Live suporta para tradução?

A OpenAI não publicou uma lista de idiomas. Os materiais de lançamento dizem que a voz é otimizada para "a maioria dos idiomas falados" e divulgam lacunas de sotaque e fluência para os demais. O comportamento medido varia muito conforme o idioma: o mesmo modelo cobriu 98% das frases em espanhol dentro de 30 segundos, mas apenas 17% das frases em japonês. O modelo de tradução voltado a desenvolvedores da OpenAI, o gpt-realtime-translate, documenta 70+ idiomas de entrada e 13 idiomas de saída: inglês, espanhol, português, francês, alemão, italiano, russo, chinês, japonês, coreano, hindi, indonésio e vietnamita.

Como o GPT-Live se compara ao Gemini Live na tradução?

Apostas arquitetônicas diferentes, e agora os dois são mensuráveis. O GPT-Live é um assistente conversacional full-duplex que traduz sob demanda. O Gemini 3.5 Live Translate do Google é um modelo dedicado de tradução de fala para fala em streaming. No mesmo áudio de 452 segundos, o Gemini manteve um atraso de conclusão estável de 1,51 segundo de inglês para espanhol e 1,92 segundo para o japonês, enquanto o gpt-live-1 subiu a um platô de 10 a 14 segundos no espanhol e cobriu apenas 17% das frases em japonês dentro de 30 segundos. Um caminho dedicado de tradução mantém um deslocamento constante em vez de acumular atraso.

Como voltar ao Advanced Voice Mode a partir do GPT-Live?

Abra as configurações de voz do ChatGPT e selecione o Advanced Voice Mode. O GPT-Live o substituiu como padrão em 8 de julho de 2026, mas a OpenAI manteve o modo antigo selecionável para usuários que precisam de recursos que o GPT-Live não suporta, como vídeo e compartilhamento de tela.

Como impedir que o GPT-Live interrompa ou diga "mhmm"?

Não é possível desativar totalmente o comportamento de sinais de escuta no app de consumo. A solução alternativa é uma instrução explícita no início da sessão, como "apenas traduza o que eu disser, não acrescente nada". Nos testes medidos pela API, essa instrução se manteve por completo, com zero quebras de papel ao longo de 27 minutos, então o papel de intérprete em si é confiável, mesmo que as interjeições conversacionais continuem possíveis no ChatGPT. Se o comportamento inviabiliza seu caso de uso, o Advanced Voice Mode continua selecionável nas configurações de voz.

Qual ferramenta usar para tradução simultânea de conversas agora?

Para trocas curtas, o GPT-Live é bom e gratuito dentro do ChatGPT. Para fala contínua, como uma reunião, uma palestra ou uma chamada longa, use um caminho construído para esse fim. Medido no mesmo áudio de 452 segundos, o atraso de conclusão foi de 0,94 segundo no LiveLingo, 1,51 no Gemini 3.5 Live Translate e 2,65 no próprio gpt-realtime-translate da OpenAI, todos estáveis, contra 10 a 14 segundos crescentes no gpt-live-1 sob prompt. Para chamadas traduzidas a números de telefone comuns, nenhuma das superfícies da OpenAI disca; essa é outra categoria de produto.

9. Fontes

Atualizado em 16 de setembro de 2026 para refletir a chegada do GPT-Live-1 à API da OpenAI em 10 de setembro de 2026 e para acrescentar as primeiras medições independentes do seu comportamento de tradução. Nomes dos modelos, mapeamento de planos, endpoint e preços verificados contra a documentação para desenvolvedores da OpenAI em 16 de setembro de 2026. As medições são do modelo de API, e não da experiência de consumo do ChatGPT; a OpenAI pode mudar planos, limites, cobertura de idiomas e comportamento do modelo rapidamente.