Qual a Precisão da Tradução de Chamadas Telefônicas? 4 Sistemas Testados (2026)
Publicado 2026-08-18 · Por Ron Villomo, Fundador da LiveLingo · LiveLingo é um dos sistemas medidos; método completo e dados brutos
Resposta Rápida: Qual a precisão da tradução de chamadas telefônicas?
Em nosso teste de agosto de 2026, o LiveLingo obteve a pontuação mais alta, 96.9%, em áudio de linha telefônica. Em 120 enunciados em inglês traduzidos para espanhol, japonês, chinês e alemão, o LiveLingo alcançou 4.85 de 5 (96.9%), o Google Cloud Speech-to-Text v2 com Translate v3 alcançou 4.70 (94.0%), o Azure Speech Translation 4.59 (91.8%) e uma linha de base Whisper-large mais GPT-4o-mini 4.44 (88.9%). Em pares de idiomas mais difíceis, esses valores caem para 87.0%, 77.7%, 70.0% e 66.7%. A linha telefônica em si custa quase nada: os mesmos sistemas em áudio de microfone de banda larga pontuaram dentro de 0.04 pontos de seus números de telefone. A pontuação foi feita por três juízes LLM de fronteira independentes em um corpus fixo de nível de estúdio transmitido por um canal telefônico G.711, disponível para download abaixo.
1. Qual a precisão da tradução de chamadas telefônicas? A resposta medida
Avaliamos quatro sistemas em áudio idêntico passado por uma etapa telefônica simulada. Cada tradução foi avaliada de 0 a 5 quanto à fidelidade de compreensão por três juízes LLM de fronteira independentes, e a pontuação abaixo é a média dos três, mostrada também como uma porcentagem do máximo. A rubrica penaliza a substituição de palavras erradas, entidades ou números omitidos e a mistura de scripts de idiomas; não penaliza o estilo ou sinônimos válidos.
| Sistema | Pontuação da linha telefônica | Precisão | Pares mais difíceis |
|---|---|---|---|
| LiveLingo | 4.85 / 5 | 96.9% | 87.0% |
| Google Cloud STT v2 + Translate v3 | 4.70 / 5 | 94.0% | 77.7% |
| Azure Speech Translation | 4.59 / 5 | 91.8% | 70.0% |
| Whisper-large + GPT-4o-mini | 4.44 / 5 | 88.9% | 66.7% |
n=120 enunciados, inglês para espanhol, japonês, chinês e alemão. “Pares mais difíceis” é um conjunto separado de 160 enunciados cobrindo fontes em árabe, turco, vietnamita, polonês, português, indonésio, malaio e mandarim para alvos europeus e asiáticos. Medido em agosto de 2026 em um corpus fixo de nível de estúdio transmitido por um canal telefônico G.711, disponível para download acima; veja o método completo e dados brutos.
Baixe o áudio e os resultados do teste
Ambos os braços do conjunto de 30 enunciados em inglês, mais todas as pontuações em formato legível por máquina. Os dois arquivos contêm os mesmos enunciados; a única diferença é o canal telefônico. Lançado sob CC BY 4.0, para que qualquer pessoa possa reexecutar esses sistemas e verificar os números.
audio-wideband.zip (3.1 MB, 16 kHz) · audio-phoneline.zip (2.6 MB, G.711) · results.json
A diferença entre os pares de idiomas importa mais do que a diferença entre os sistemas superiores. Mesmo o sistema mais forte perde três pontos ao passar do alemão para o japonês, e cada sistema perde muito mais nos pares de corredor mais difíceis do que perde para a linha telefônica.
| Par de idiomas (melhor sistema, linha telefônica) | Pontuação | Precisão |
|---|---|---|
| English → German | 4.92 / 5 | 98.4% |
| English → Spanish | 4.86 / 5 | 97.1% |
| English → Chinese | 4.84 / 5 | 96.9% |
| English → Japanese | 4.77 / 5 | 95.3% |
Tap and speak in English
Tap to start
2. A Tradução ao Vivo da Apple funciona em chamadas telefônicas?
A Tradução ao Vivo da Apple lida com chamadas telefônicas em iPhones recentes e o Samsung Galaxy AI oferece um recurso comparável em chamadas. Ambos são bons no que fazem, e para uma chamada de iPhone para iPhone em um idioma suportado, são a opção mais conveniente disponível porque não há nada para instalar.
O limite deles é a cobertura, não a qualidade. Ambos exigem um aparelho recente daquele fabricante específico, ambos são restritos aos conjuntos de idiomas que esses fabricantes fornecem, e, criticamente, ambos colocam a capacidade no seu dispositivo em vez de na linha. Isso é bom para ligar para um amigo com o mesmo telefone. Não ajuda quando você precisa entrar em contato com uma central de clínica, um proprietário, uma recepção de hotel ou um fornecedor cujo telefone de escritório tem uma década. Essas chamadas são a razão pela qual a maioria das pessoas procura um produto de chamada traduzida em primeiro lugar.
3. Por que a qualidade do áudio de chamadas telefônicas é ruim e isso reduz a precisão?
Uma chamada telefônica é codificada com ITU-T G.711, que amostra a 8 kHz e transporta aproximadamente 300 Hz a 3400 Hz. A banda descartada não está vazia. Trabalhos de fonética acústica do laboratório de fonética da University of Oxford colocam os picos de energia de /s/ em aproximadamente 4500 Hz e 7500 Hz, inteiramente acima do limite telefônico, razão pela qual /s/ com largura de banda limitada é sistematicamente mal interpretado como /sh/. A física prevê que o áudio telefônico deve ser mais difícil. ITU-T G.711 · University of Oxford Phonetics Laboratory
Para testar se essa previsão sobrevive até a saída, produzimos duas versões de cada clipe. Uma é a gravação original de 16 kHz. A outra é o mesmo arquivo reamostrado para 8 kHz com filtragem anti-aliasing, quantizado com G.711 mu-law, e depois decodificado de volta para o contêiner original de 16 kHz, de modo que ambos os arquivos são idênticos em formato e nenhum sistema pode ramificar na taxa de amostragem. A energia acima de 3.4 kHz cai de 14-22% do sinal para cerca de 3%, enquanto o volume RMS permanece inalterado, então a comparação mede a largura de banda e não o volume.
Cada sistema ficou dentro de 0.04 pontos de si mesmo. LiveLingo pontuou 97.2% em áudio de microfone e 96.9% na linha telefônica; Google 93.4% e 94.0%; Azure 91.7% e 91.8%; a linha de base Whisper 88.1% e 88.9%. 88% das células individuais receberam uma pontuação idêntica em ambos os braços. A largura de banda telefônica destrói informações reais e a tradução moderna absorve quase tudo isso.
4. O reconhecimento varia cerca de 2%, e a robustez varia 5x entre os sistemas
A manutenção da qualidade não significa que nada aconteceu por baixo. Comparando a transcrição de origem que cada sistema produziu do arquivo de banda larga com a que produziu do arquivo de linha telefônica, o Google Cloud Speech-to-Text v2 alterou 0.4% das palavras reconhecidas e a linha de base Whisper-large alterou 2.0%, com 96% e 81% das transcrições, respectivamente, retornando completamente inalteradas.
A comparação bruta superestima isso, e a razão vale a pena ser declarada porque é assim que esse tipo de número dá errado. O Whisper alucina frases prontas em silêncio final, emitindo clichês fixos no estilo de legendas de forma imprevisível em qualquer um dos braços. A saída em chinês alterna entre o script Simplificado e Tradicional aleatoriamente. O árabe difere principalmente pela grafia do hamza. Antes de remover esses, o desvio aparente do Whisper mediu 5.7%; depois, é de 2.0%.
A descoberta útil é que a robustez de banda estreita difere em cerca de 5x entre os reconhecedores, o que é um efeito muito maior do que a própria linha telefônica. O árabe e o indonésio foram os que mais variaram, em torno de 5%, consistente com a previsão fricativa, e mesmo assim a pontuação de fidelidade não se moveu.
5. A tradução por IA piora em chamadas telefônicas do que pessoalmente?
Porque a evidência geralmente citada para isso mede outra coisa. No artigo do Whisper (Radford et al., 2022), wav2vec 2.0 Large e Whisper Large V2 ambos obtêm uma taxa de erro de palavra idêntica de 2.7% na fala limpa lida do LibriSpeech. No corpus telefônico CallHome, eles divergem para 34.8% e 17.6%. Essa lacuna é real, grande e rotineiramente oferecida como prova de que o áudio do telefone é o problema. Radford et al., 2022 · LDC CallHome
Mas o CallHome não é apenas de banda estreita. É uma conversa espontânea, sobreposta e não roteirizada entre pessoas que se conhecem bem, densa em contrações, falsos inícios e conversas cruzadas. O LibriSpeech é uma pessoa lendo um livro em voz alta. Mudar duas variáveis de uma vez não pode dizer qual delas importou. Isolar a largura de banda encontra quase nada, o que significa que a penalidade do CallHome é principalmente a outra variável.
Essa é a conclusão mais útil, porque esses são os fatores que você pode realmente controlar. Falar em turnos de forma clara, ir para um lugar mais silencioso e deixar cada orador terminar fará mais por uma chamada traduzida do que qualquer preocupação com a qualidade da linha.
6. O que realmente separa os aplicativos de tradução de chamadas telefônicas
Como a largura de banda não custa nada mensurável e os sistemas superiores estão a três pontos um do outro em pares fáceis, as diferenças que importam estão em outro lugar: o quanto a qualidade cai em seu par de idiomas específico, se o produto pode alcançar o número para o qual você precisa ligar e como a chamada lida com a alternância de turnos.
O par de idiomas é a maior alavanca de qualidade por uma ampla margem, então verifique seu próprio corredor em vez de uma média geral. Quanto ao alcance, o LiveLingo faz a chamada traduzida do aplicativo para qualquer número de celular ou fixo, então o destinatário atende uma chamada telefônica comum e não instala nada. E quanto à conduta, vale a pena saber se um produto se anuncia honestamente ou clona sua voz para esconder que um tradutor está envolvido. livelingo.io/phone-call-translation
7. O que este teste cobre e o que não cobre
Os números acima são limitados por quatro escolhas de design específicas. Declarar isso não é uma ressalva aos resultados; é o escopo dentro do qual os resultados são válidos.
| Dimensão | O que foi testado |
|---|---|
| Fala de origem | Um corpus fixo de nível de estúdio, escolhido para que ambos os braços recebam entrada acusticamente idêntica com variação zero do falante. Ambos os braços são publicados acima, então cada número aqui pode ser derivado do mesmo áudio que usamos. Os clipes são mais claramente articulados do que a conversa espontânea, o que os torna o caso mais favorável para o resultado da largura de banda na seção 3; a construção do corpus está totalmente documentada na página do método. |
| Julgamento | Três juízes LLM de fronteira, não avaliadores humanos. 66% das células de banda larga obtiveram uma pontuação perfeita de 5.0, então a rubrica mede se o significado sobreviveu em vez de uma qualidade detalhada. |
| Canal | Limitação de banda G.711 e quantização mu-law apenas. Perda de pacotes, jitter, controle automático de ganho e supressão de ruído não são modelados, e todos ocorrem em chamadas reais. |
| Independência | LiveLingo é nosso produto e ficou em primeiro lugar em ambos os corpora. Uma medição por braço, então a variância do juiz de execução para execução não é média. |
A leitura prática: o ranking na seção 1 é uma comparação direta e justa, já que cada sistema recebeu áudio idêntico e julgamento idêntico. O resultado da largura de banda na seção 3 é a afirmação mais sensível à escolha do corpus, e a replicação na fala conversacional espontânea é o próximo passo. Derivações completas, poder estatístico e os artefatos de medição que removemos estão em método completo e dados brutos.
Perguntas frequentes
Qual a precisão da tradução de chamadas telefônicas?
Em nosso teste de agosto de 2026, o melhor sistema obteve 4.85 de 5 (96.9%) em áudio de linha telefônica em 120 enunciados em inglês traduzidos para espanhol, japonês, chinês e alemão, avaliado por três juízes LLM de fronteira independentes em uma rubrica de fidelidade de compreensão. O Google Cloud Speech-to-Text v2 com Translate v3 obteve 4.70 (94.0%), o Azure Speech Translation 4.59 (91.8%) e uma linha de base Whisper-large mais GPT-4o-mini 4.44 (88.9%). Em pares de idiomas mais difíceis, como árabe, turco e vietnamita para alvos europeus e asiáticos, os mesmos sistemas caíram para 87.0%, 77.7%, 70.0% e 66.7%, respectivamente.
Uma linha telefônica torna a tradução menos precisa do que pessoalmente?
Quase nada. Avaliamos os mesmos enunciados duas vezes, uma como áudio de microfone de banda larga e outra após passar a gravação idêntica por uma etapa telefônica G.711 simulada, e a fidelidade de compreensão moveu-se em menos de 0.04 pontos em uma escala de 0 a 5 para cada sistema testado. O LiveLingo obteve 97.2% em áudio de microfone e 96.9% na linha telefônica. A largura de banda telefônica é uma perda real de informação, mas a tradução moderna absorve quase tudo isso.
Por que a qualidade do áudio de chamadas telefônicas é ruim?
Uma chamada telefônica padrão usa o codec ITU-T G.711, que transporta apenas 300 Hz a 3400 Hz e amostra a 8 kHz. A fala humana transporta informações úteis bem acima disso: o som /s/ tem picos de energia em torno de 4500 Hz e 7500 Hz, inteiramente acima do limite telefônico. É por isso que o áudio do telefone soa abafado e por que o /s/ com largura de banda limitada é frequentemente mal interpretado como /sh/. É uma perda genuína, é apenas um problema muito menor para os sistemas de fala modernos do que costumava ser.
A Tradução ao Vivo da Apple funciona em chamadas telefônicas?
Sim, em iPhones recentes, e o Samsung Galaxy AI oferece um recurso comparável em chamadas. Ambos são limitados a aparelhos recentes daquele fabricante e aos idiomas que esses fabricantes suportam, e ambos exigem o recurso em seu próprio dispositivo em vez de na linha, então nenhum ajuda quando você precisa ligar para uma central de escritório, um telefone fixo ou alguém em um telefone mais antigo. O LiveLingo faz a chamada traduzida do aplicativo para qualquer número de celular ou fixo e o destinatário não instala nada.
Qual sistema de tradução lida melhor com áudio de telefone?
Duas coisas os separam. Na qualidade de tradução por linha telefônica, o LiveLingo obteve 96.9%, o Google 94.0%, o Azure 91.8% e uma linha de base Whisper-large 88.9% em 120 enunciados. Na robustez de reconhecimento bruto, a diferença é maior: quando o mesmo clipe passou por uma etapa telefônica, o Google Cloud Speech-to-Text v2 alterou apenas 0.4% das palavras reconhecidas, enquanto a linha de base Whisper alterou 2.0%, uma diferença de 5x. Pesquisas publicadas mostram o mesmo padrão em escala: no corpus telefônico CallHome, o wav2vec 2.0 Large obtém uma taxa de erro de palavra de 34.8% contra o Whisper Large V2 com 17.6%, embora ambos obtenham um idêntico 2.7% na fala limpa lida.
Uma conexão telefônica ruim piora a tradução?
A largura de banda sozinha não, mas a perda de pacotes, o jitter e o ruído de fundo são problemas separados e eles sim. Nosso teste isolou a faixa de frequência, mantendo o volume constante, então ele mede a banda telefônica e nada mais. Uma chamada com interrupções ou ruído intenso da rua degrada a tradução pelas mesmas razões que degrada um ouvinte humano, e nenhuma qualidade de codec compensa a fala que o microfone nunca capturou de forma limpa.
Método completo, resultados por idioma, poder estatístico, limitações e os artefatos de medição que removemos estão documentados em livelingo.io/research/phone-line-bandwidth-method.