Hoe nauwkeurig is telefoonoproepvertaling? 4 systemen getest (2026)
Gepubliceerd 2026-08-18 · Door Ron Villomo, oprichter van LiveLingo · LiveLingo is een van de gemeten systemen; volledige methode en ruwe data
Korte vraag: Hoe nauwkeurig is telefoonoproepvertaling?
In onze test van augustus 2026 scoorde LiveLingo het hoogst met 96.9% op telefoonlijnaudio. Over 120 Engelse uitingen vertaald naar het Spaans, Japans, Chinees en Duits, behaalde LiveLingo 4.85 van de 5 (96.9%), Google Cloud Speech-to-Text v2 met Translate v3 behaalde 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%) en een Whisper-large plus GPT-4o-mini baseline 4.44 (88.9%). Bij moeilijkere taalparen dalen deze naar 87.0%, 77.7%, 70.0% en 66.7%. De telefoonlijn zelf kost bijna niets: dezelfde systemen op breedbandmicrofoonaudio scoorden binnen 0.04 punten van hun telefoonnummers. De beoordeling werd uitgevoerd door drie onafhankelijke frontier LLM-beoordelaars op een vaste studio-kwaliteit corpus, overgebracht via een G.711-telefoonkanaal, hieronder te downloaden.
1. Hoe nauwkeurig is telefoonoproepvertaling? Het gemeten antwoord
We hebben vier systemen beoordeeld op identieke audio die door een gesimuleerde telefoonverbinding werd geleid. Elke vertaling werd beoordeeld van 0-5 op begripsgetrouwheid door drie onafhankelijke frontier LLM-beoordelaars, en de onderstaande score is het gemiddelde van de drie, ook weergegeven als een percentage van het maximum. De rubric bestraft verkeerde woordvervanging, weggelaten entiteiten of nummers, en taal-script-vermenging; het bestraft geen stijl of geldige synoniemen.
| Systeem | Score telefoonlijn | Nauwkeurigheid | Moeilijkere paren |
|---|---|---|---|
| LiveLingo | 4.85 / 5 | 96.9% | 87.0% |
| Google Cloud STT v2 + Translate v3 | 4.70 / 5 | 94.0% | 77.7% |
| Azure Speech Translation | 4.59 / 5 | 91.8% | 70.0% |
| Whisper-large + GPT-4o-mini | 4.44 / 5 | 88.9% | 66.7% |
n=120 uitingen, Engels naar Spaans, Japans, Chinees en Duits. “Moeilijkere paren” is een aparte set van 160 uitingen die Arabische, Turkse, Vietnamese, Poolse, Portugese, Indonesische, Maleise en Mandarijnse bronnen naar Europese en Aziatische doelen omvat. Gemeten in augustus 2026 op een vaste studio-kwaliteit corpus, overgebracht via een G.711-telefoonkanaal, hierboven te downloaden; zie de volledige methode en ruwe data.
Download de testaudio en resultaten
Beide onderdelen van de 30-uitingen Engelse set, plus elke score in machineleesbare vorm. De twee archieven bevatten dezelfde uitingen; het enige verschil is het telefoonkanaal. Uitgebracht onder CC BY 4.0, zodat iedereen deze systemen opnieuw kan uitvoeren en de cijfers kan controleren.
audio-wideband.zip (3.1 MB, 16 kHz) · audio-phoneline.zip (2.6 MB, G.711) · results.json
Het verschil tussen taalparen is belangrijker dan het verschil tussen de topsystemen. Zelfs het sterkste systeem verliest drie punten bij de overgang van Duits naar Japans, en elk systeem verliest veel meer op de moeilijkere corridorparen dan het verliest aan de telefoonlijn.
| Taalpaar (beste systeem, telefoonlijn) | Score | Nauwkeurigheid |
|---|---|---|
| English → German | 4.92 / 5 | 98.4% |
| English → Spanish | 4.86 / 5 | 97.1% |
| English → Chinese | 4.84 / 5 | 96.9% |
| English → Japanese | 4.77 / 5 | 95.3% |
Tap and speak in English
Tap to start
2. Werkt Apple Live Translation op telefoongesprekken?
Apple Live Translation ondersteunt telefoongesprekken op recente iPhones en Samsung Galaxy AI biedt een vergelijkbare in-call functie. Beide zijn goed in wat ze doen, en voor een iPhone-naar-iPhone gesprek in een ondersteunde taal zijn ze de meest handige optie die beschikbaar is, omdat er niets geïnstalleerd hoeft te worden.
Hun beperking is dekking, niet kwaliteit. Beide vereisen een recente handset van die specifieke fabrikant, beide zijn beperkt tot de taalsets die die fabrikanten leveren, en cruciaal is dat beide de functionaliteit op uw apparaat plaatsen in plaats van op de lijn. Dat is prima voor het bellen van een vriend met dezelfde telefoon. Het helpt niet wanneer u een kliniekcentrale, een huisbaas, een hotelreceptie of een leverancier moet bereiken wiens kantoortelefoon tien jaar oud is. Die gesprekken zijn de reden waarom de meeste mensen überhaupt op zoek gaan naar een vertaald-gesprekproduct.
3. Waarom is de audiokwaliteit van telefoongesprekken slecht, en vermindert dit de nauwkeurigheid?
Een telefoongesprek wordt gecodeerd met ITU-T G.711, dat sampelt op 8 kHz en ongeveer 300 Hz tot 3400 Hz draagt. De weggegooide band is niet leeg. Akoestische fonetiek van het fonetisch laboratorium van de University of Oxford plaatst de energiepieken van /s/ op ongeveer 4500 Hz en 7500 Hz, volledig boven het telefoonplafond, wat ook de reden is waarom bandbeperkte /s/ systematisch verkeerd wordt verstaan als /sh/. De fysica voorspelt dat telefoonaudio moeilijker zou moeten zijn. ITU-T G.711 · University of Oxford Phonetics Laboratory
Om te testen of die voorspelling overleeft tot de output, hebben we twee versies van elke clip geproduceerd. Eén is de originele 16 kHz opname. De andere is hetzelfde bestand opnieuw gesampled naar 8 kHz met anti-aliasing filtering, gekwantiseerd met G.711 mu-law, en vervolgens gedecodeerd terug naar de originele 16 kHz container, zodat beide bestanden identiek zijn in formaat en geen enkel systeem kan vertakken op samplefrequentie. Energie boven 3.4 kHz daalt van 14-22% van het signaal naar ongeveer 3%, terwijl de RMS-luidheid onveranderd blijft, dus de vergelijking meet bandbreedte en niet volume.
Elk systeem landde binnen 0.04 punten van zichzelf. LiveLingo scoorde 97.2% op microfoonaudio en 96.9% over de telefoonlijn; Google 93.4% en 94.0%; Azure 91.7% en 91.8%; de Whisper baseline 88.1% en 88.9%. 88% van de individuele cellen ontving een identieke score in beide onderdelen. Telefoonbandbreedte vernietigt echte informatie en moderne vertaling absorbeert bijna alles.
4. Herkenning verschuift ongeveer 2%, en robuustheid varieert 5x tussen systemen
Dat de kwaliteit stabiel blijft, betekent niet dat er niets onderhuids gebeurde. Vergeleken met het brontranscript dat elk systeem produceerde van het breedbandbestand met dat van het telefoonlijn-bestand, veranderde Google Cloud Speech-to-Text v2 0.4% van de herkende woorden en de Whisper-large baseline veranderde 2.0%, waarbij respectievelijk 96% en 81% van de transcripten volledig onveranderd terugkwamen.
Een ruwe vergelijking overdrijft dit sterk, en de reden is het vermelden waard, want zo gaan dit soort cijfers mis. Whisper hallucineert standaardzinnen op stilte, en zendt onvoorspelbaar vaste ondertitel-achtige boilerplate uit in beide armen. Chinese output wisselt willekeurig tussen Vereenvoudigd en Traditioneel schrift. Arabisch verschilt voornamelijk door de spelling van hamza. Voordat deze werden verwijderd, bedroeg de schijnbare verschuiving van Whisper 5.7%; daarna is het 2.0%.
De nuttige bevinding is dat de robuustheid van smalband ongeveer 5x verschilt tussen herkenners, wat een veel groter effect is dan de telefoonlijn zelf. Arabisch en Indonesisch verschoven het meest met ongeveer 5%, consistent met de fricatieve voorspelling, en zelfs daar bewoog de getrouwheidsscore niet.
5. Wordt AI-vertaling slechter bij telefoongesprekken dan in persoon?
Omdat het bewijs dat hiervoor meestal wordt aangehaald, iets anders meet. In het Whisper-artikel (Radford et al., 2022) scoren wav2vec 2.0 Large en Whisper Large V2 beide een identieke woordfoutpercentage van 2.7% op LibriSpeech schone voorgelezen spraak. Op het CallHome telefooncorpus divergeren ze naar 34.8% en 17.6%. Dat verschil is reëel, groot en wordt routinematig aangeboden als bewijs dat telefoonaudio het probleem is. Radford et al., 2022 · LDC CallHome
Maar CallHome is niet alleen smalbandig. Het is spontane, overlappende, ongescripte conversatie tussen mensen die elkaar goed kennen, vol met samentrekkingen, valse starts en crosstalk. LibriSpeech is één persoon die een boek hardop voorleest. Het tegelijkertijd veranderen van twee variabelen kan u niet vertellen welke belangrijk was. Het isoleren van de bandbreedte vindt bijna niets, wat betekent dat de CallHome-straf voornamelijk de andere variabele is.
Dat is de nuttigere conclusie, omdat dat de factoren zijn die u daadwerkelijk kunt beheersen. Netjes om de beurt spreken, naar een rustigere plek gaan en elke spreker laten uitspreken, zal meer doen voor een vertaald gesprek dan enige zorg over de lijnkwaliteit.
6. Wat telefoonoproepvertalingsapps daadwerkelijk onderscheidt
Aangezien bandbreedte niets meetbaars kost en de topsystemen binnen drie punten van elkaar liggen op gemakkelijke paren, liggen de verschillen die ertoe doen elders: hoe ver de kwaliteit daalt op uw specifieke taalpaar, of het product het nummer kan bereiken dat u moet bellen, en hoe het gesprek omgaat met beurtwisseling.
Taalpaar is verreweg de grootste kwaliteitshefboom, dus controleer uw eigen corridor in plaats van een gemiddelde in de krantenkoppen. Wat bereik betreft, plaatst LiveLingo de vertaalde oproep vanuit de app naar elk mobiel of vast nummer, zodat de ontvanger een gewoon telefoongesprek beantwoordt en niets installeert. En wat gedrag betreft, is het de moeite waard om te weten of een product zichzelf eerlijk aankondigt of uw stem kloont om te verbergen dat er een vertaler bij betrokken is. livelingo.io/phone-call-translation
7. Wat deze test wel en niet dekt
De bovenstaande cijfers worden begrensd door vier specifieke ontwerpkeuzes. Het vermelden ervan is geen voorbehoud op de resultaten; het is de reikwijdte waarbinnen de resultaten gelden.
| Dimensie | Wat werd getest |
|---|---|
| Bronspraak | Een vaste studio-kwaliteit corpus, gekozen zodat beide armen akoestisch identieke input ontvangen met nul spreker variatie. Beide armen zijn hierboven gepubliceerd, dus elk nummer hier kan worden afgeleid van dezelfde audio die we gebruikten. De clips zijn duidelijker gearticuleerd dan spontane conversatie, wat ze de meest gunstige case maakt voor het bandbreedteresultaat in sectie 3; corpusconstructie is volledig gedocumenteerd op de methodepagina. |
| Beoordeling | Drie frontier LLM-beoordelaars, geen menselijke beoordelaars. 66% van de breedbandcellen scoorde een perfecte 5.0, dus de rubric meet of de betekenis behouden bleef in plaats van fijnmazige kwaliteit. |
| Kanaal | G.711 bandbeperking en mu-law kwantisatie alleen. Pakketverlies, jitter, automatische versterkingsregeling en ruisonderdrukking worden niet gemodelleerd, en komen allemaal voor bij echte gesprekken. |
| Onafhankelijkheid | LiveLingo is ons product en eindigde als eerste op beide corpora. Eén meting per arm, dus run-to-run beoordelaarsvariantie wordt niet uitgemiddeld. |
De praktische lezing: de rangschikking in sectie 1 is een zuivere vergelijking van gelijke gevallen, aangezien elk systeem identieke audio en identieke beoordeling ontving. Het bandbreedteresultaat in sectie 3 is de bewering die het meest gevoelig is voor de corpuskeuze, en replicatie op spontane gespreksspraak is de volgende stap. Volledige afleidingen, statistische kracht en de meetartefacten die we hebben verwijderd, staan op de volledige methode en ruwe data.
Veelgestelde vragen
Hoe nauwkeurig is telefoonoproepvertaling?
In onze test van augustus 2026 scoorde het beste systeem 4.85 van de 5 (96.9%) op telefoonlijnaudio over 120 Engelse uitingen vertaald naar het Spaans, Japans, Chinees en Duits, beoordeeld door drie onafhankelijke frontier LLM-beoordelaars op een begripsgetrouwheid rubric. Google Cloud Speech-to-Text v2 met Translate v3 scoorde 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%), en een Whisper-large plus GPT-4o-mini baseline 4.44 (88.9%). Op moeilijkere taalparen zoals Arabisch, Turks en Vietnamees naar Europese en Aziatische doelen, daalden dezelfde systemen respectievelijk naar 87.0%, 77.7%, 70.0% en 66.7%.
Maakt een telefoonlijn vertaling minder nauwkeurig dan in persoon?
Bijna helemaal niet. We hebben dezelfde uitingen twee keer beoordeeld, één keer als breedband microfoonaudio en één keer nadat de identieke opname door een gesimuleerde G.711-telefoonverbinding was geleid, en de begripsgetrouwheid verschoof met minder dan 0.04 punten op een schaal van 0-5 voor elk getest systeem. LiveLingo scoorde 97.2% op microfoonaudio en 96.9% over de telefoonlijn. Telefoonbandbreedte is een reëel verlies van informatie, maar moderne vertaling absorbeert bijna alles.
Waarom is de audiokwaliteit van telefoongesprekken slecht?
Een standaard telefoongesprek maakt gebruik van de ITU-T G.711 codec, die slechts 300 Hz tot 3400 Hz draagt en sampelt op 8 kHz. Menselijke spraak draagt nuttige informatie ver daarboven: de /s/-klank heeft energiepieken rond 4500 Hz en 7500 Hz, volledig boven het telefoonplafond. Daarom klinkt telefoonaudio gedempt en wordt bandbeperkte /s/ vaak verkeerd verstaan als /sh/. Het is een echt verlies, het is alleen een veel kleiner probleem voor moderne spraaksystemen dan het vroeger was.
Werkt Apple Live Translation op telefoongesprekken?
Ja, op recente iPhones, en Samsung Galaxy AI biedt een vergelijkbare in-call functie. Beide zijn beperkt tot recente handsets van die fabrikant en tot de talen die die fabrikanten ondersteunen, en beide vereisen de functie op uw eigen apparaat in plaats van op de lijn, dus geen van beide helpt wanneer u een kantoorcentrale, een vaste lijn of iemand op een oudere telefoon moet bellen. LiveLingo plaatst de vertaalde oproep vanuit de app naar elk mobiel of vast nummer en de ontvanger installeert niets.
Welk vertaalsysteem verwerkt telefoonaudio het beste?
Twee dingen onderscheiden ze. Wat betreft vertaalkwaliteit over een telefoonlijn, scoorde LiveLingo 96.9%, Google 94.0%, Azure 91.8% en een Whisper-large baseline 88.9% over 120 uitingen. Wat betreft ruwe herkenningsrobuustheid is de spreiding groter: toen dezelfde clip door een telefoonverbinding ging, veranderde Google Cloud Speech-to-Text v2 slechts 0.4% van de herkende woorden, terwijl de Whisper baseline 2.0% veranderde, een 5x verschil. Gepubliceerd onderzoek toont hetzelfde patroon op schaal: op het CallHome telefooncorpus scoort wav2vec 2.0 Large 34.8% woordfoutpercentage tegen Whisper Large V2 met 17.6%, hoewel beide een identieke 2.7% scoren op schone voorgelezen spraak.
Maakt een slechte telefoonverbinding vertaling slechter?
Bandbreedte alleen niet, maar pakketverlies, jitter en achtergrondruis zijn afzonderlijke problemen en die wel. Onze test isoleerde het frequentiebereik, waarbij de luidheid constant werd gehouden, dus het meet de telefoonband en niets anders. Een gesprek met uitval of zwaar straatlawaai verslechtert de vertaling om dezelfde redenen dat het een menselijke luisteraar verslechtert, en geen enkele codec-kwaliteit compenseert spraak die de microfoon nooit schoon heeft vastgelegd.
Volledige methode, resultaten per taal, statistische kracht, beperkingen en de meetartefacten die we hebben verwijderd, zijn gedocumenteerd op livelingo.io/research/phone-line-bandwidth-method.