LiveLingoLiveLingoTry free

Quanto è accurata la traduzione delle chiamate telefoniche? 4 sistemi testati (2026)

Pubblicato 2026-08-18 · Di Ron Villomo, Fondatore di LiveLingo · LiveLingo è uno dei sistemi misurati; metodo completo e dati grezzi

Risposta rapida: Quanto è accurata la traduzione delle chiamate telefoniche?

Nel nostro test di agosto 2026, LiveLingo ha ottenuto il punteggio più alto con il 96.9% sull'audio telefonico. Su 120 enunciati in inglese tradotti in spagnolo, giapponese, cinese e tedesco, LiveLingo ha raggiunto 4.85 su 5 (96.9%), Google Cloud Speech-to-Text v2 con Translate v3 ha raggiunto 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%) e un baseline Whisper-large più GPT-4o-mini 4.44 (88.9%). Su coppie linguistiche più difficili questi valori scendono all'87.0%, 77.7%, 70.0% e 66.7%. La linea telefonica stessa costa quasi nulla: gli stessi sistemi su audio a banda larga da microfono hanno ottenuto punteggi entro 0.04 punti dai loro numeri telefonici. La valutazione è stata effettuata da tre giudici LLM di frontiera indipendenti su un corpus fisso di qualità studio trasmesso su un canale telefonico G.711, scaricabile qui sotto.

1. Quanto è accurata la traduzione delle chiamate telefoniche? La risposta misurata

Abbiamo valutato quattro sistemi su audio identico passato attraverso un segmento telefonico simulato. Ogni traduzione è stata valutata da 0 a 5 per la fedeltà di comprensione da tre giudici LLM di frontiera indipendenti, e il punteggio sottostante è la media dei tre, mostrato anche come percentuale del massimo. La rubrica penalizza la sostituzione di parole errate, entità o numeri omessi e la mescolanza di script linguistici; non penalizza lo stile o i sinonimi validi.

SistemaPunteggio linea telefonicaAccuratezzaCoppie più difficili
LiveLingo4.85 / 596.9%87.0%
Google Cloud STT v2 + Translate v34.70 / 594.0%77.7%
Azure Speech Translation4.59 / 591.8%70.0%
Whisper-large + GPT-4o-mini4.44 / 588.9%66.7%

n=120 enunciati, dall'inglese allo spagnolo, giapponese, cinese e tedesco. Le “coppie più difficili” sono un set separato di 160 enunciati che copre fonti arabe, turche, vietnamite, polacche, portoghesi, indonesiane, malesi e mandarino verso destinazioni europee e asiatiche. Misurato nell'agosto 2026 su un corpus fisso di qualità studio trasmesso su un canale telefonico G.711, scaricabile sopra; vedi il metodo completo e dati grezzi.

Scarica l'audio e i risultati del test

Entrambi i rami del set di 30 enunciati in inglese, più ogni punteggio in formato leggibile dalla macchina. I due archivi contengono gli stessi enunciati; l'unica differenza è il canale telefonico. Rilasciato sotto CC BY 4.0, in modo che chiunque possa rieseguire questi sistemi e controllare i numeri.

audio-wideband.zip (3.1 MB, 16 kHz) · audio-phoneline.zip (2.6 MB, G.711) · results.json

La differenza tra le coppie linguistiche è più importante della differenza tra i sistemi migliori. Anche il sistema più forte perde tre punti passando dal tedesco al giapponese, e ogni sistema perde molto di più sulle coppie di corridoio più difficili di quanto perda sulla linea telefonica.

Coppia linguistica (miglior sistema, linea telefonica)PunteggioAccuratezza
Inglese → Tedesco4.92 / 598.4%
Inglese → Spagnolo4.86 / 597.1%
Inglese → Cinese4.84 / 596.9%
Inglese → Giapponese4.77 / 595.3%
LiveLingo

Tap and speak in English

Tap to start

2. Apple Live Translation funziona sulle chiamate telefoniche?

Apple Live Translation gestisce le chiamate telefoniche sui recenti iPhone e Samsung Galaxy AI offre una funzione di chiamata comparabile. Entrambi sono bravi in quello che fanno, e per una chiamata da iPhone a iPhone in una lingua supportata sono l'opzione più conveniente disponibile perché non c'è nulla da installare.

Il loro limite è la copertura, non la qualità. Entrambi richiedono un telefono recente di quel produttore specifico, entrambi sono limitati ai set di lingue che quei produttori spediscono, e, cosa fondamentale, entrambi mettono la capacità sul tuo dispositivo piuttosto che sulla linea. Questo va bene per chiamare un amico con lo stesso telefono. Non aiuta quando devi raggiungere un centralino di una clinica, un proprietario, un banco di hotel o un fornitore il cui telefono dell'ufficio ha dieci anni. Queste chiamate sono il motivo per cui la maggior parte delle persone cerca un prodotto per chiamate tradotte in primo luogo.

3. Perché la qualità audio delle chiamate telefoniche è scarsa e riduce l'accuratezza?

Una chiamata telefonica è codificata con ITU-T G.711, che campiona a 8 kHz e trasporta circa da 300 Hz a 3400 Hz. La banda scartata non è vuota. Il lavoro di fonetica acustica del laboratorio di fonetica dell'University of Oxford colloca i picchi di energia di /s/ a circa 4500 Hz e 7500 Hz, interamente al di sopra del limite telefonico, motivo per cui /s/ a banda limitata viene sistematicamente scambiato per /sh/. La fisica prevede che l'audio telefonico dovrebbe essere più difficile. ITU-T G.711 · University of Oxford Phonetics Laboratory

Per verificare se questa previsione sopravvive all'output, abbiamo prodotto due versioni di ogni clip. Una è la registrazione originale a 16 kHz. L'altra è lo stesso file ricampionato a 8 kHz con filtro anti-aliasing, quantizzato con G.711 mu-law, quindi decodificato nuovamente nel contenitore originale a 16 kHz, in modo che entrambi i file siano identici nel formato e nessun sistema possa ramificarsi sulla frequenza di campionamento. L'energia sopra i 3.4 kHz scende dal 14-22% del segnale a circa il 3%, mentre il volume RMS rimane invariato, quindi il confronto misura la larghezza di banda e non il volume.

Ogni sistema si è attestato entro 0.04 punti da sé. LiveLingo ha ottenuto il 97.2% sull'audio del microfono e il 96.9% sulla linea telefonica; Google 93.4% e 94.0%; Azure 91.7% e 91.8%; il baseline Whisper 88.1% e 88.9%. L'88% delle singole celle ha ricevuto un punteggio identico in entrambi i rami. La larghezza di banda telefonica distrugge informazioni reali e la traduzione moderna ne assorbe quasi tutta.

4. Il riconoscimento si sposta di circa il 2%, e la robustezza varia di 5x tra i sistemi

La stabilità della qualità non significa che nulla sia accaduto sotto. Confrontando la trascrizione sorgente che ogni sistema ha prodotto dal file a banda larga con quella prodotta dal file della linea telefonica, Google Cloud Speech-to-Text v2 ha modificato lo 0.4% delle parole riconosciute e il baseline Whisper-large ha modificato il 2.0%, con il 96% e l'81% delle trascrizioni rispettivamente che sono tornate completamente invariate.

Il confronto grezzo sovrastima gravemente questo aspetto, e il motivo merita di essere esposto perché è così che questo tipo di numero va storto. Whisper allucina frasi standard sul silenzio finale, emettendo in modo imprevedibile un boilerplate fisso in stile sottotitolo in entrambi i rami. L'output cinese passa casualmente tra script semplificato e tradizionale. L'arabo differisce principalmente per l'ortografia della hamza. Prima di rimuovere questi elementi, lo spostamento apparente di Whisper misurava il 5.7%; dopo, è il 2.0%.

Il risultato utile è che la robustezza a banda stretta differisce di circa 5x tra i riconoscitori, il che è un effetto molto più grande della linea telefonica stessa. L'arabo e l'indonesiano hanno mostrato il maggior spostamento, circa il 5%, coerentemente con la previsione delle fricative, e anche lì il punteggio di fedeltà non si è mosso.

5. La traduzione AI peggiora nelle chiamate telefoniche rispetto a di persona?

Perché le prove solitamente citate misurano qualcos'altro. Nel paper di Whisper (Radford et al., 2022), wav2vec 2.0 Large e Whisper Large V2 ottengono entrambi un identico tasso di errore di parola del 2.7% sul parlato pulito letto di LibriSpeech. Sul corpus telefonico CallHome divergono al 34.8% e 17.6%. Questo divario è reale, ampio e viene regolarmente offerto come prova che l'audio telefonico è il problema. Radford et al., 2022 · LDC CallHome

Ma CallHome non è solo a banda stretta. È una conversazione spontanea, sovrapposta, non scriptata tra persone che si conoscono bene, densa di contrazioni, falsi inizi e sovrapposizioni. LibriSpeech è una persona che legge un libro ad alta voce. Cambiare due variabili contemporaneamente non può dirti quale sia stata importante. Isolare la larghezza di banda non trova quasi nulla, il che significa che la penalità di CallHome è principalmente l'altra variabile.

Questa è la conclusione più utile, perché questi sono i fattori che puoi effettivamente controllare. Parlare a turno in modo pulito, spostarsi in un luogo più tranquillo e lasciare che ogni oratore finisca farà di più per una chiamata tradotta di qualsiasi preoccupazione sulla qualità della linea.

6. Cosa distingue realmente le app di traduzione delle chiamate telefoniche

Poiché la larghezza di banda non costa nulla di misurabile e i sistemi migliori si trovano entro tre punti l'uno dall'altro su coppie facili, le differenze che contano sono altrove: quanto la qualità diminuisce sulla tua specifica coppia linguistica, se il prodotto può raggiungere il numero che devi chiamare e come la chiamata gestisce i turni di parola.

La coppia linguistica è la leva di qualità più grande con un ampio margine, quindi controlla il tuo corridoio specifico piuttosto che una media generale. Per quanto riguarda la portata, LiveLingo effettua la chiamata tradotta dall'app a qualsiasi numero di cellulare o fisso, quindi il destinatario risponde a una normale chiamata telefonica e non installa nulla. E per quanto riguarda la condotta, vale la pena sapere se un prodotto si annuncia onestamente o clona la tua voce per nascondere che è coinvolto un traduttore. livelingo.io/phone-call-translation

7. Cosa copre questo test e cosa no

I numeri sopra sono delimitati da quattro scelte di design specifiche. Affermarle non è una riserva sui risultati; è l'ambito entro cui i risultati sono validi.

DimensioneCosa è stato testato
Discorso sorgenteUn corpus fisso di qualità studio, scelto in modo che entrambi i rami ricevano un input acusticamente identico con zero variazione del parlante. Entrambi i rami sono pubblicati sopra, quindi ogni numero qui può essere derivato dallo stesso audio che abbiamo usato. Le clip sono articolate più chiaramente rispetto alla conversazione spontanea, il che le rende il caso più favorevole per il risultato della larghezza di banda nella sezione 3; la costruzione del corpus è documentata in dettaglio nella pagina del metodo.
ValutazioneTre giudici LLM di frontiera, non valutatori umani. Il 66% delle celle a banda larga ha ottenuto un punteggio perfetto di 5.0, quindi la rubrica misura se il significato è sopravvissuto piuttosto che la qualità dettagliata.
CanaleLimitazione di banda G.711 e quantizzazione mu-law solo. Perdita di pacchetti, jitter, controllo automatico del guadagno e soppressione del rumore non sono modellati, e tutti si verificano nelle chiamate reali.
IndipendenzaLiveLingo è il nostro prodotto e si è classificato primo su entrambi i corpora. Una misurazione per braccio, quindi la varianza del giudice da esecuzione a esecuzione non è mediata.

La lettura pratica: la classifica nella sezione 1 è un confronto pulito e omogeneo, poiché ogni sistema ha ricevuto audio e valutazione identici. Il risultato della larghezza di banda nella sezione 3 è l'affermazione più sensibile alla scelta del corpus, e la replicazione sul parlato conversazionale spontaneo è il prossimo passo. Derivazioni complete, potenza statistica e gli artefatti di misurazione che abbiamo rimosso sono documentati su metodo completo e dati grezzi.

Domande frequenti

Quanto è accurata la traduzione delle chiamate telefoniche?

Nel nostro test di agosto 2026, il miglior sistema ha ottenuto 4.85 su 5 (96.9%) sull'audio della linea telefonica su 120 enunciati in inglese tradotti in spagnolo, giapponese, cinese e tedesco, valutati da tre giudici LLM di frontiera indipendenti su una rubrica di fedeltà di comprensione. Google Cloud Speech-to-Text v2 con Translate v3 ha ottenuto 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%) e un baseline Whisper-large più GPT-4o-mini 4.44 (88.9%). Su coppie linguistiche più difficili come arabo, turco e vietnamita verso destinazioni europee e asiatiche, gli stessi sistemi sono scesi rispettivamente all'87.0%, 77.7%, 70.0% e 66.7%.

Una linea telefonica rende la traduzione meno accurata rispetto a di persona?

Quasi per niente. Abbiamo valutato gli stessi enunciati due volte, una volta come audio a banda larga da microfono e una volta dopo aver passato la registrazione identica attraverso un segmento telefonico G.711 simulato, e la fedeltà di comprensione si è spostata di meno di 0.04 punti su una scala da 0 a 5 per ogni sistema testato. LiveLingo ha ottenuto il 97.2% sull'audio del microfono e il 96.9% sulla linea telefonica. La larghezza di banda telefonica è una vera perdita di informazioni, ma la traduzione moderna ne assorbe quasi tutta.

Perché la qualità audio delle chiamate telefoniche è scarsa?

Una chiamata telefonica standard utilizza il codec ITU-T G.711, che trasporta solo da 300 Hz a 3400 Hz e campiona a 8 kHz. Il parlato umano trasporta informazioni utili ben al di sopra di questo: il suono /s/ ha picchi di energia intorno a 4500 Hz e 7500 Hz, interamente al di sopra del limite telefonico. Ecco perché l'audio telefonico suona ovattato e perché /s/ a banda limitata viene spesso scambiato per /sh/. È una perdita genuina, è solo un problema molto più piccolo per i moderni sistemi di riconoscimento vocale di quanto non fosse in passato.

Apple Live Translation funziona sulle chiamate telefoniche?

Sì, sui recenti iPhone, e Samsung Galaxy AI offre una funzione di chiamata comparabile. Entrambi sono limitati ai telefoni recenti di quel produttore e alle lingue che quei produttori supportano, ed entrambi richiedono la funzione sul proprio dispositivo piuttosto che sulla linea, quindi nessuno dei due aiuta quando è necessario chiamare un centralino d'ufficio, un telefono fisso o qualcuno su un telefono più vecchio. LiveLingo effettua la chiamata tradotta dall'app a qualsiasi numero di cellulare o fisso e il destinatario non installa nulla.

Quale sistema di traduzione gestisce meglio l'audio telefonico?

Due cose li distinguono. Sulla qualità della traduzione su linea telefonica, LiveLingo ha ottenuto il 96.9%, Google il 94.0%, Azure il 91.8% e un baseline Whisper-large l'88.9% su 120 enunciati. Sulla robustezza del riconoscimento grezzo la diffusione è più ampia: quando la stessa clip è passata attraverso un segmento telefonico, Google Cloud Speech-to-Text v2 ha modificato solo lo 0.4% delle parole riconosciute mentre il baseline Whisper ha modificato il 2.0%, una differenza di 5x. La ricerca pubblicata mostra lo stesso schema su larga scala: sul corpus telefonico CallHome, wav2vec 2.0 Large ottiene un tasso di errore di parola del 34.8% contro Whisper Large V2 al 17.6%, anche se entrambi ottengono un identico 2.7% sul parlato pulito letto.

Una cattiva connessione telefonica peggiora la traduzione?

La sola larghezza di banda no, ma la perdita di pacchetti, il jitter e il rumore di fondo sono problemi separati e lo fanno. Il nostro test ha isolato la gamma di frequenze, mantenendo costante il volume, quindi misura la banda telefonica e nient'altro. Una chiamata con interruzioni o forte rumore stradale degrada la traduzione per le stesse ragioni per cui degrada un ascoltatore umano, e nessuna qualità del codec compensa il parlato che il microfono non ha mai catturato in modo pulito.

Il metodo completo, i risultati per lingua, la potenza statistica, le limitazioni e gli artefatti di misurazione che abbiamo rimosso sono documentati su livelingo.io/research/phone-line-bandwidth-method.

Quanto è accurata la traduzione delle chiamate telefoniche? 4 sistemi testati (2026) | LiveLingo