LiveLingoLiveLingoTry free

Quelle est la précision de la traduction d'appels téléphoniques ? 4 systèmes testés (2026)

Publié 2026-08-18 · Par Ron Villomo, Fondateur de LiveLingo · LiveLingo est l'un des systèmes mesurés ; méthode complète et données brutes

Réponse rapide : Quelle est la précision de la traduction d'appels téléphoniques ?

Lors de notre test d'août 2026, LiveLingo a obtenu le score le plus élevé à 96.9% sur l'audio de ligne téléphonique. Sur 120 énoncés anglais traduits en espagnol, japonais, chinois et allemand, LiveLingo a atteint 4.85 sur 5 (96.9%), Google Cloud Speech-to-Text v2 avec Translate v3 a atteint 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%) et une base de référence Whisper-large plus GPT-4o-mini 4.44 (88.9%). Sur les paires de langues plus difficiles, ces scores tombent à 87.0%, 77.7%, 70.0% et 66.7%. La ligne téléphonique elle-même ne coûte presque rien : les mêmes systèmes sur de l'audio de microphone à large bande ont obtenu des scores à 0.04 point près de leurs chiffres téléphoniques. L'évaluation a été réalisée par trois juges LLM de pointe indépendants sur un corpus fixe de qualité studio transmis via un canal téléphonique G.711, téléchargeable ci-dessous.

1. Quelle est la précision de la traduction d'appels téléphoniques ? La réponse mesurée

Nous avons évalué quatre systèmes sur un audio identique transmis via une simulation de ligne téléphonique. Chaque traduction a été notée de 0 à 5 pour la fidélité de la compréhension par trois juges LLM de pointe indépendants, et le score ci-dessous est la moyenne des trois, également présentée en pourcentage du maximum. La grille de notation pénalise la substitution de mots erronés, les entités ou nombres omis, et le mélange de scripts linguistiques ; elle ne pénalise pas le style ou les synonymes valides.

SystèmeScore sur ligne téléphoniquePrécisionPaires plus difficiles
LiveLingo4.85 / 596.9%87.0%
Google Cloud STT v2 + Translate v34.70 / 594.0%77.7%
Azure Speech Translation4.59 / 591.8%70.0%
Whisper-large + GPT-4o-mini4.44 / 588.9%66.7%

n=120 énoncés, de l'anglais vers l'espagnol, le japonais, le chinois et l'allemand. Les « paires plus difficiles » sont un ensemble distinct de 160 énoncés couvrant des sources arabes, turques, vietnamiennes, polonaises, portugaises, indonésiennes, malaises et mandarines vers des cibles européennes et asiatiques. Mesuré en août 2026 sur un corpus fixe de qualité studio transmis via un canal téléphonique G.711, téléchargeable ci-dessus ; voir la méthode complète et données brutes.

Téléchargez l'audio et les résultats du test

Les deux versions de l'ensemble de 30 énoncés en anglais, plus chaque score sous forme lisible par machine. Les deux archives contiennent les mêmes énoncés ; la seule différence est le canal téléphonique. Publié sous CC BY 4.0, afin que chacun puisse réexécuter ces systèmes et vérifier les chiffres.

audio-wideband.zip (3.1 Mo, 16 kHz) · audio-phoneline.zip (2.6 Mo, G.711) · results.json

L'écart entre les paires de langues est plus important que l'écart entre les meilleurs systèmes. Même le système le plus performant perd trois points en passant de l'allemand au japonais, et chaque système perd bien plus sur les paires de couloirs plus difficiles qu'il n'en perd à cause de la ligne téléphonique.

Paire de langues (meilleur système, ligne téléphonique)ScorePrécision
Anglais → Allemand4.92 / 598.4%
Anglais → Espagnol4.86 / 597.1%
Anglais → Chinois4.84 / 596.9%
Anglais → Japonais4.77 / 595.3%
LiveLingo

Tap and speak in English

Tap to start

2. La traduction en direct d'Apple fonctionne-t-elle sur les appels téléphoniques ?

Apple Live Translation gère les appels téléphoniques sur les iPhones récents et Samsung Galaxy AI offre une fonctionnalité d'appel comparable. Les deux sont performants dans ce qu'ils font, et pour un appel iPhone vers iPhone dans une langue prise en charge, ce sont les options les plus pratiques disponibles car il n'y a rien à installer.

Leur limite est la couverture, pas la qualité. Les deux nécessitent un combiné récent de ce fabricant spécifique, les deux sont limités aux ensembles de langues que ces fabricants proposent, et surtout, les deux placent la capacité sur votre appareil plutôt que sur la ligne. C'est bien pour appeler un ami avec le même téléphone. Cela n'aide pas lorsque vous devez joindre un standard de clinique, un propriétaire, une réception d'hôtel ou un fournisseur dont le téléphone de bureau a dix ans. Ces appels sont la raison pour laquelle la plupart des gens recherchent un produit d'appel traduit en premier lieu.

3. Pourquoi la qualité audio des appels téléphoniques est-elle mauvaise, et réduit-elle la précision ?

Un appel téléphonique est encodé avec ITU-T G.711, qui échantillonne à 8 kHz et transmet environ 300 Hz à 3400 Hz. La bande écartée n'est pas vide. Les travaux de phonétique acoustique du laboratoire de phonétique de l'University of Oxford situent les pics d'énergie du /s/ à environ 4500 Hz et 7500 Hz, entièrement au-dessus du plafond téléphonique, ce qui explique aussi pourquoi le /s/ à bande limitée est systématiquement mal entendu comme /sh/. La physique prédit que l'audio téléphonique devrait être plus difficile. ITU-T G.711 · University of Oxford Phonetics Laboratory

Pour vérifier si cette prédiction se maintient jusqu'à la sortie, nous avons produit deux versions de chaque clip. L'une est l'enregistrement original à 16 kHz. L'autre est le même fichier rééchantillonné à 8 kHz avec filtrage anti-alias, quantifié avec la loi mu G.711, puis décodé dans le conteneur original à 16 kHz, de sorte que les deux fichiers sont identiques en format et aucun système ne peut se baser sur le taux d'échantillonnage. L'énergie au-dessus de 3.4 kHz tombe de 14-22% du signal à environ 3%, tandis que le volume RMS reste inchangé, de sorte que la comparaison mesure la bande passante et non le volume.

Chaque système a obtenu un score à 0.04 point près de lui-même. LiveLingo a obtenu 97.2% sur l'audio du microphone et 96.9% sur la ligne téléphonique ; Google 93.4% et 94.0% ; Azure 91.7% et 91.8% ; la base de référence Whisper 88.1% et 88.9%. 88% des cellules individuelles ont reçu un score identique dans les deux versions. La bande passante téléphonique détruit des informations réelles et la traduction moderne en absorbe presque la totalité.

4. La reconnaissance dérive d'environ 2%, et la robustesse varie 5x entre les systèmes

Le maintien de la qualité ne signifie pas que rien ne s'est passé en dessous. En comparant la transcription source que chaque système a produite à partir du fichier à large bande avec celle qu'il a produite à partir du fichier de ligne téléphonique, Google Cloud Speech-to-Text v2 a modifié 0.4% des mots reconnus et la base de référence Whisper-large a modifié 2.0%, avec respectivement 96% et 81% des transcriptions revenant complètement inchangées.

La comparaison brute exagère considérablement cela, et la raison mérite d'être énoncée car c'est ainsi que ce genre de chiffre devient erroné. Whisper hallucine des phrases toutes faites sur le silence final, émettant des textes passe-partout de style sous-titre de manière imprévisible dans l'une ou l'autre des versions. La sortie chinoise bascule aléatoirement entre les scripts simplifié et traditionnel. L'arabe diffère principalement par l'orthographe de la hamza. Avant de les supprimer, la dérive apparente de Whisper était de 5.7% ; après, elle est de 2.0%.

La découverte utile est que la robustesse en bande étroite diffère d'environ 5x entre les reconnaisseurs, ce qui est un effet bien plus important que la ligne téléphonique elle-même. L'arabe et l'indonésien ont le plus dérivé, autour de 5%, ce qui est cohérent avec la prédiction fricative, et même là, le score de fidélité n'a pas bougé.

5. La traduction par IA est-elle moins bonne sur les appels téléphoniques qu'en personne ?

Parce que les preuves habituellement citées mesurent autre chose. Dans l'article sur Whisper (Radford et al., 2022), wav2vec 2.0 Large et Whisper Large V2 obtiennent tous deux un taux d'erreur de mots identique de 2.7% sur la parole lue propre de LibriSpeech. Sur le corpus téléphonique CallHome, ils divergent à 34.8% et 17.6%. Cet écart est réel, important, et est régulièrement présenté comme la preuve que l'audio téléphonique est le problème. Radford et al., 2022 · LDC CallHome

Mais CallHome n'est pas seulement en bande étroite. C'est une conversation spontanée, superposée, non scénarisée entre des personnes qui se connaissent bien, dense en contractions, faux départs et chevauchements. LibriSpeech est une personne lisant un livre à voix haute. Changer deux variables à la fois ne peut pas vous dire laquelle était importante. Isoler la bande passante ne trouve presque rien, ce qui signifie que la pénalité de CallHome est principalement l'autre variable.

C'est la conclusion la plus utile, car ce sont les facteurs que vous pouvez réellement contrôler. Parler à tour de rôle clairement, se déplacer dans un endroit plus calme et laisser chaque locuteur terminer fera plus pour un appel traduit que toute préoccupation concernant la qualité de la ligne.

6. Ce qui distingue réellement les applications de traduction d'appels téléphoniques

Étant donné que la bande passante ne coûte rien de mesurable et que les meilleurs systèmes se situent à trois points les uns des autres sur des paires faciles, les différences importantes se trouvent ailleurs : dans quelle mesure la qualité diminue sur votre paire de langues spécifique, si le produit peut atteindre le numéro que vous devez appeler, et comment l'appel gère la prise de parole.

La paire de langues est le plus grand levier de qualité, et de loin, alors vérifiez votre propre couloir plutôt qu'une moyenne générale. En ce qui concerne la portée, LiveLingo passe l'appel traduit depuis l'application vers n'importe quel numéro de mobile ou de ligne fixe, de sorte que le destinataire répond à un appel téléphonique ordinaire et n'installe rien. Et en ce qui concerne la conduite, il est utile de savoir si un produit s'annonce honnêtement ou clone votre voix pour masquer l'implication d'un traducteur. livelingo.io/phone-call-translation

7. Ce que ce test couvre, et ce qu'il ne couvre pas

Les chiffres ci-dessus sont délimités par quatre choix de conception spécifiques. Les énoncer n'est pas une réserve sur les résultats ; c'est le cadre dans lequel les résultats sont valables.

DimensionCe qui a été testé
Parole sourceUn corpus fixe de qualité studio, choisi de manière à ce que les deux versions reçoivent une entrée acoustiquement identique avec zéro variation de locuteur. Les deux versions sont publiées ci-dessus, de sorte que chaque chiffre ici peut être redérivé à partir du même audio que nous avons utilisé. Les clips sont plus clairement articulés que la conversation spontanée, ce qui en fait le cas le plus favorable pour le résultat de la bande passante dans la section 3 ; la construction du corpus est entièrement documentée sur la page de méthode.
ÉvaluationTrois juges LLM de pointe, pas des évaluateurs humains. 66% des cellules à large bande ont obtenu un score parfait de 5.0, de sorte que la grille de notation mesure si le sens a survécu plutôt que la qualité fine.
CanalLimitation de bande G.711 et quantification mu-law uniquement. La perte de paquets, la gigue, le contrôle automatique du gain et la suppression du bruit ne sont pas modélisés, et tous se produisent lors d'appels réels.
IndépendanceLiveLingo est notre produit et s'est classé premier sur les deux corpus. Une mesure par version, de sorte que la variance des juges d'une exécution à l'autre n'est pas moyennée.

La lecture pratique : le classement de la section 1 est une comparaison directe et équitable, puisque chaque système a reçu un audio identique et une évaluation identique. Le résultat de la bande passante de la section 3 est l'affirmation la plus sensible au choix du corpus, et la réplication sur la parole conversationnelle spontanée est la prochaine étape. Les dérivations complètes, la puissance statistique et les artefacts de mesure que nous avons supprimés sont sur la méthode complète et données brutes.

Questions fréquemment posées

Quelle est la précision de la traduction d'appels téléphoniques ?

Lors de notre test d'août 2026, le meilleur système a obtenu 4.85 sur 5 (96.9%) sur l'audio de ligne téléphonique sur 120 énoncés anglais traduits en espagnol, japonais, chinois et allemand, évalué par trois juges LLM de pointe indépendants sur une grille de fidélité de la compréhension. Google Cloud Speech-to-Text v2 avec Translate v3 a obtenu 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%), et une base de référence Whisper-large plus GPT-4o-mini 4.44 (88.9%). Sur des paires de langues plus difficiles telles que l'arabe, le turc et le vietnamien vers des cibles européennes et asiatiques, les mêmes systèmes ont chuté à 87.0%, 77.7%, 70.0% et 66.7% respectivement.

Une ligne téléphonique rend-elle la traduction moins précise qu'en personne ?

Presque pas du tout. Nous avons évalué les mêmes énoncés deux fois, une fois comme audio de microphone à large bande et une fois après avoir fait passer l'enregistrement identique par une simulation de ligne téléphonique G.711, et la fidélité de la compréhension a bougé de moins de 0.04 point sur une échelle de 0 à 5 pour chaque système testé. LiveLingo a obtenu 97.2% sur l'audio du microphone et 96.9% sur la ligne téléphonique. La bande passante téléphonique est une réelle perte d'informations, mais la traduction moderne en absorbe presque la totalité.

Pourquoi la qualité audio des appels téléphoniques est-elle mauvaise ?

Un appel téléphonique standard utilise le codec ITU-T G.711, qui ne transmet que de 300 Hz à 3400 Hz et échantillonne à 8 kHz. La parole humaine contient des informations utiles bien au-delà : le son /s/ a des pics d'énergie autour de 4500 Hz et 7500 Hz, entièrement au-dessus du plafond téléphonique. C'est pourquoi l'audio téléphonique semble étouffé et pourquoi le /s/ à bande limitée est souvent mal entendu comme /sh/. C'est une perte réelle, mais c'est un problème beaucoup plus petit pour les systèmes de parole modernes qu'il ne l'était auparavant.

La traduction en direct d'Apple fonctionne-t-elle sur les appels téléphoniques ?

Oui, sur les iPhones récents, et Samsung Galaxy AI offre une fonctionnalité d'appel comparable. Les deux sont limités aux combinés récents de ce fabricant et aux langues prises en charge par ces fabricants, et les deux nécessitent la fonctionnalité sur votre propre appareil plutôt que sur la ligne, donc aucun des deux n'aide lorsque vous devez appeler un standard de bureau, une ligne fixe ou quelqu'un sur un téléphone plus ancien. LiveLingo passe l'appel traduit depuis l'application vers n'importe quel numéro de mobile ou de ligne fixe et le destinataire n'installe rien.

Quel système de traduction gère le mieux l'audio téléphonique ?

Deux choses les séparent. En termes de qualité de traduction sur une ligne téléphonique, LiveLingo a obtenu 96.9%, Google 94.0%, Azure 91.8% et une base de référence Whisper-large 88.9% sur 120 énoncés. En termes de robustesse de reconnaissance brute, l'écart est plus large : lorsque le même clip est passé par une ligne téléphonique, Google Cloud Speech-to-Text v2 n'a modifié que 0.4% des mots reconnus tandis que la base de référence Whisper a modifié 2.0%, soit une différence de 5x. Des recherches publiées montrent le même schéma à grande échelle : sur le corpus téléphonique CallHome, wav2vec 2.0 Large obtient un taux d'erreur de mots de 34.8% contre Whisper Large V2 à 17.6%, même si les deux obtiennent un score identique de 2.7% sur la parole lue propre.

Une mauvaise connexion téléphonique rend-elle la traduction moins bonne ?

La bande passante seule ne le fait pas, mais la perte de paquets, la gigue et le bruit de fond sont des problèmes distincts et ils le font. Notre test a isolé la plage de fréquences, en maintenant le volume constant, il mesure donc la bande téléphonique et rien d'autre. Un appel avec des coupures ou un fort bruit de rue dégrade la traduction pour les mêmes raisons qu'il dégrade un auditeur humain, et aucune qualité de codec ne compense la parole que le microphone n'a jamais capturée clairement.

La méthode complète, les résultats par langue, la puissance statistique, les limitations et les artefacts de mesure que nous avons supprimés sont documentés à livelingo.io/research/phone-line-bandwidth-method.

Quelle est la précision de la traduction d'appels téléphoniques ? 4 systèmes testés (2026) | LiveLingo