電話翻譯的準確度如何?2026 年測試了 4 個系統
發布日期 2026-08-18 · 作者:LiveLingo 創辦人 Ron Villomo · LiveLingo 是其中一個受測系統; 完整方法和原始數據
快速解答:電話翻譯的準確度如何?
在我們 2026 年 8 月的測試中,LiveLingo 在電話線音訊上的得分最高,達到 96.9%。在 120 個從英文翻譯成西班牙文、日文、中文和德文的語句中,LiveLingo 獲得 5 分中的 4.85 分(96.9%),Google Cloud Speech-to-Text v2 搭配 Translate v3 獲得 4.70 分(94.0%),Azure Speech Translation 獲得 4.59 分(91.8%),而 Whisper-large 加上 GPT-4o-mini 的基準線則為 4.44 分(88.9%)。在較困難的語言對上,這些分數分別降至 87.0%、77.7%、70.0% 和 66.7%。電話線本身幾乎不花費任何成本:相同的系統在寬頻麥克風音訊上的得分與其電話號碼的差異在 0.04 分以內。評分由三位獨立的頂尖 LLM 評審,根據透過 G.711 電話通道傳輸的固定錄音室級語料庫進行,可於下方下載。
1. 電話翻譯的準確度如何?測量結果
我們在通過模擬電話線路的相同音訊上對四個系統進行了評分。每個翻譯都由三位獨立的頂尖 LLM 評審根據理解忠實度評分 0-5 分,下方的分數是三者的平均值,也顯示為最大值的百分比。評分標準會懲罰錯誤詞語替換、遺漏實體或數字以及語言文字混合;它不懲罰風格或有效同義詞。
| 系統 | 電話線分數 | 準確度 | 較困難的語言對 |
|---|---|---|---|
| LiveLingo | 4.85 / 5 | 96.9% | 87.0% |
| Google Cloud STT v2 + Translate v3 | 4.70 / 5 | 94.0% | 77.7% |
| Azure Speech Translation | 4.59 / 5 | 91.8% | 70.0% |
| Whisper-large + GPT-4o-mini | 4.44 / 5 | 88.9% | 66.7% |
n=120 個語句,從英文翻譯成西班牙文、日文、中文和德文。「較困難的語言對」是另一個 160 個語句的集合,涵蓋阿拉伯文、土耳其文、越南文、波蘭文、葡萄牙文、印尼文、馬來文和普通話來源到歐洲和亞洲目標。於 2026 年 8 月在透過 G.711 電話通道傳輸的固定錄音室級語料庫上測量,可於上方下載;請參閱 完整方法和原始數據.
下載測試音訊和結果
30 個語句英文集的兩個分支,加上所有機器可讀形式的分數。這兩個檔案包含相同的語句;唯一的區別是電話通道。根據 CC BY 4.0 發布,因此任何人都可以重新執行這些系統並檢查數字。
audio-wideband.zip (3.1 MB,16 kHz) · audio-phoneline.zip (2.6 MB,G.711) · results.json
語言對之間的差異比頂級系統之間的差異更重要。即使是最強大的系統,從德文翻譯成日文也會損失三分,而且每個系統在較困難的走廊語言對上損失的遠比在電話線上損失的更多。
| 語言對(最佳系統,電話線) | 分數 | 準確度 |
|---|---|---|
| English → German | 4.92 / 5 | 98.4% |
| English → Spanish | 4.86 / 5 | 97.1% |
| English → Chinese | 4.84 / 5 | 96.9% |
| English → Japanese | 4.77 / 5 | 95.3% |
Tap and speak in English
Tap to start
2. Apple 即時翻譯是否適用於電話通話?
Apple 即時翻譯支援最新 iPhone 上的電話通話,而 Samsung Galaxy AI 也提供類似的通話中功能。兩者在各自的功能上都表現出色,對於支援語言的 iPhone 對 iPhone 通話,它們是最方便的選擇,因為無需安裝任何東西。
它們的限制在於覆蓋範圍,而非品質。兩者都需要特定製造商的最新手機,兩者都僅限於這些製造商提供的語言集,而且關鍵是兩者都將功能放在您的設備上,而不是線路上。這對於撥打給擁有相同手機的朋友來說很好。但當您需要聯繫診所總機、房東、飯店櫃檯或辦公電話已使用十年的供應商時,這就沒有幫助了。這些通話是大多數人最初尋找翻譯通話產品的原因。
3. 為什麼電話通話音訊品質不佳,以及它是否會降低準確度?
電話通話採用 ITU-T G.711 編碼,以 8 kHz 取樣,頻率範圍約為 300 Hz 至 3400 Hz。被丟棄的頻段並非空白。University of Oxford 語音實驗室的聲學語音學研究表明,/s/ 的能量峰值約為 4500 Hz 和 7500 Hz,完全超出電話的上限,這也是為什麼頻帶受限的 /s/ 系統性地被誤聽為 /sh/。物理學預測電話音訊應該更難處理。 ITU-T G.711 · University of Oxford Phonetics Laboratory
為了測試該預測是否在輸出中成立,我們製作了每個片段的兩個版本。一個是原始的 16 kHz 錄音。另一個是相同的檔案,經過抗混疊濾波器重新取樣至 8 kHz,使用 G.711 mu-law 量化,然後解碼回原始的 16 kHz 容器,因此兩個檔案的格式相同,沒有系統可以根據取樣率進行分支。3.4 kHz 以上的能量從訊號的 14-22% 下降到約 3%,而 RMS 響度保持不變,因此比較測量的是頻寬而不是音量。
每個系統的得分差異都在 0.04 分以內。LiveLingo 在麥克風音訊上得分 97.2%,在電話線上得分 96.9%;Google 分別為 93.4% 和 94.0%;Azure 分別為 91.7% 和 91.8%;Whisper 基準線分別為 88.1% 和 88.9%。88% 的單獨單元在兩個分支中獲得相同的分數。電話頻寬破壞了真實資訊,而現代翻譯幾乎吸收了所有這些資訊。
4. 辨識漂移約 2%,系統之間的穩健性差異達 5 倍
品質保持穩定並不意味著底層沒有發生任何事情。將每個系統從寬頻檔案生成的原始轉錄與從電話線檔案生成的轉錄進行比較,Google Cloud Speech-to-Text v2 改變了 0.4% 的辨識詞語,而 Whisper-large 基準線改變了 2.0%,分別有 96% 和 81% 的轉錄完全沒有改變。
原始比較嚴重誇大了這一點,原因值得說明,因為這就是這類數字出錯的方式。Whisper 會在結尾的靜音處產生幻覺般的固定詞組,在任一分支中不可預測地發出固定字幕風格的樣板。中文輸出會在簡體和繁體字之間隨機切換。阿拉伯文主要因 hamza 拼寫而異。在移除這些之前,Whisper 的明顯漂移測量為 5.7%;之後,則為 2.0%。
有用的發現是,窄頻穩健性在辨識器之間差異約 5 倍,這比電話線本身造成的影響大得多。阿拉伯文和印尼文的漂移最大,約為 5%,這與摩擦音預測一致,即使在那裡,忠實度分數也沒有移動。
5. AI 翻譯在電話通話中是否比面對面更糟?
因為通常引用的證據測量的是其他東西。在 Whisper 論文(Radford et al., 2022)中,wav2vec 2.0 Large 和 Whisper Large V2 在 LibriSpeech 清晰朗讀語音上的詞錯誤率均為 2.7%。在 CallHome 電話語料庫上,它們分歧到 34.8% 和 17.6%。這個差距是真實的、巨大的,並且經常被用作電話音訊是問題的證據。 Radford et al., 2022 · LDC CallHome
但 CallHome 不僅僅是窄頻。它是自發的、重疊的、無腳本的對話,發生在彼此非常熟悉的人之間,充滿了縮寫、錯誤開頭和串音。LibriSpeech 是一個人大聲朗讀一本書。同時改變兩個變數無法告訴您哪個變數更重要。隔離頻寬幾乎沒有發現任何東西,這意味著 CallHome 的懲罰主要來自另一個變數。
這是更有用的結論,因為這些是您可以實際控制的因素。清晰地輪流說話、移動到更安靜的地方,並讓每個說話者說完,對翻譯通話的幫助將大於任何對線路品質的擔憂。
6. 真正區分電話翻譯應用程式的因素
由於頻寬成本幾乎無法測量,而且頂級系統在簡單的語言對上彼此之間相差不到三分,因此重要的差異在於其他方面:您的特定語言對的品質下降程度、產品是否能撥打您需要撥打的號碼,以及通話如何處理輪流說話。
語言對是最大的品質槓桿,因此請檢查您自己的走廊,而不是標題平均值。在覆蓋範圍方面,LiveLingo 從應用程式撥打翻譯電話到任何手機或固話號碼,因此收件人接聽的是普通電話,無需安裝任何東西。在行為方面,值得了解產品是否誠實地表明自己,或者是否複製您的聲音以隱藏翻譯人員的參與。 livelingo.io/phone-call-translation
7. 本次測試涵蓋的內容,以及未涵蓋的內容
上述數字受四個特定設計選擇的限制。說明這些並非對結果的規避;而是結果成立的範圍。
| 維度 | 測試內容 |
|---|---|
| 來源語音 | 一個固定的錄音室級語料庫,選擇它的目的是讓兩個分支都能接收到聲學上相同的輸入,且說話者變異為零。兩個分支都已在上方發布,因此這裡的每個數字都可以從我們使用的相同音訊中重新推導出來。這些片段比自發性對話更清晰,這使得它們成為第 3 節頻寬結果最有利的情況;語料庫的建構在方法頁面上有完整記錄。 |
| 評分 | 三位頂尖 LLM 評審,而非人類評分員。66% 的寬頻單元獲得完美的 5.0 分,因此評分標準衡量的是意義是否保留,而非細微的品質。 |
| 通道 | 僅限 G.711 頻帶限制和 mu-law 量化。未模擬封包遺失、抖動、自動增益控制和噪音抑制,而這些都會在實際通話中發生。 |
| 獨立性 | LiveLingo 是我們的產品,在兩個語料庫中均排名第一。每個分支一次測量,因此未平均化執行間的評審變異。 |
實際解讀:第 1 節的排名是乾淨的同類比較,因為每個系統都接收到相同的音訊和相同的評分。第 3 節的頻寬結果是對語料庫選擇最敏感的主張,下一步是在自發性對話語音上進行複製。完整的推導、統計功效和我們移除的測量偽影都在 完整方法和原始數據.
常見問題
電話翻譯的準確度如何?
在我們 2026 年 8 月的測試中,最佳系統在電話線音訊上,針對 120 個從英文翻譯成西班牙文、日文、中文和德文的語句,獲得 5 分中的 4.85 分(96.9%),由三位獨立的頂尖 LLM 評審根據理解忠實度評分標準進行評分。Google Cloud Speech-to-Text v2 搭配 Translate v3 獲得 4.70 分(94.0%),Azure Speech Translation 獲得 4.59 分(91.8%),而 Whisper-large 加上 GPT-4o-mini 的基準線則為 4.44 分(88.9%)。在較困難的語言對上,例如阿拉伯文、土耳其文和越南文翻譯成歐洲和亞洲目標語言,相同的系統分數分別降至 87.0%、77.7%、70.0% 和 66.7%。
電話線是否會使翻譯比面對面更不準確?
幾乎完全不會。我們對相同的語句進行了兩次評分,一次是寬頻麥克風音訊,另一次是在將相同的錄音通過模擬 G.711 電話線路後,所有受測系統的理解忠實度在 0-5 分的量表上移動不到 0.04 分。LiveLingo 在麥克風音訊上得分 97.2%,在電話線上得分 96.9%。電話頻寬確實會損失資訊,但現代翻譯幾乎吸收了所有這些資訊。
為什麼電話通話音訊品質不佳?
標準電話通話使用 ITU-T G.711 編解碼器,它僅傳輸 300 Hz 至 3400 Hz 的頻率,並以 8 kHz 取樣。人類語音攜帶的有用資訊遠高於此:/s/ 音的能量峰值約為 4500 Hz 和 7500 Hz,完全超出電話的上限。這就是為什麼電話音訊聽起來模糊不清,以及為什麼頻帶受限的 /s/ 經常被誤聽為 /sh/。這確實是一種損失,但對於現代語音系統來說,這是一個比以前小得多的問題。
Apple 即時翻譯是否適用於電話通話?
是的,在最新的 iPhone 上,Samsung Galaxy AI 也提供類似的通話中功能。兩者都僅限於該製造商的最新手機以及這些製造商支援的語言,而且兩者都需要在您自己的設備上而非線路上啟用該功能,因此當您需要撥打辦公室總機、固話或使用舊手機的人時,兩者都無濟於事。LiveLingo 從應用程式撥打翻譯電話到任何手機或固話號碼,收件人無需安裝任何東西。
哪個翻譯系統最能處理電話音訊?
有兩件事區分它們。在電話線上的翻譯品質方面,LiveLingo 在 120 個語句中得分 96.9%,Google 94.0%,Azure 91.8%,Whisper-large 基準線 88.9%。在原始辨識穩健性方面,差異更大:當相同的片段通過電話線路時,Google Cloud Speech-to-Text v2 僅改變了 0.4% 的辨識詞語,而 Whisper 基準線改變了 2.0%,差異達 5 倍。已發布的研究顯示了相同的大規模模式:在 CallHome 電話語料庫上,wav2vec 2.0 Large 的詞錯誤率為 34.8%,而 Whisper Large V2 為 17.6%,儘管兩者在清晰朗讀語音上的得分均為 2.7%。
糟糕的電話連接會使翻譯變差嗎?
單獨的頻寬不會,但封包遺失、抖動和背景噪音是獨立的問題,它們會。我們的測試隔離了頻率範圍,保持響度恆定,因此它測量的是電話頻段,而不是其他。有斷訊或嚴重街道噪音的通話會降低翻譯品質,原因與其降低人類聽眾的品質相同,而且沒有任何編解碼器品質可以彌補麥克風從未清晰捕捉到的語音。
完整方法、各語言結果、統計功效、限制以及我們移除的測量偽影均記錄於 livelingo.io/research/phone-line-bandwidth-method.