LiveLingoLiveLingoTry free

电话翻译的准确性如何?4个系统测试(2026年)

发布于 2026-08-18 · 作者:LiveLingo 创始人 Ron Villomo · LiveLingo 是所测量的系统之一; 完整方法和原始数据

快速回答:电话翻译的准确性如何?

在我们2026年8月的测试中,LiveLingo 在电话线路音频上的得分最高,达到96.9%。在120个从英语翻译成西班牙语、日语、中文和德语的语音片段中,LiveLingo 达到5分中的4.85分(96.9%),Google Cloud Speech-to-Text v2 与 Translate v3 达到4.70分(94.0%),Azure Speech Translation 4.59分(91.8%),以及 Whisper-large 加 GPT-4o-mini 基线 4.44分(88.9%)。在较难的语言对上,这些分数分别降至87.0%、77.7%、70.0%和66.7%。电话线路本身几乎不产生费用:相同的系统在宽带麦克风音频上的得分与其电话分数相差不到0.04分。评分由三位独立的尖端LLM评委在通过G.711电话信道传输的固定录音室级语料库上进行,可从下方下载。

1. 电话翻译的准确性如何?测量结果

我们对通过模拟电话线路传输的相同音频上的四个系统进行了评分。每项翻译由三位独立的尖端LLM评委根据理解忠实度进行0-5分的评分,下方显示的分数是三者的平均值,也以最大值的百分比表示。评分标准惩罚错词替换、实体或数字遗漏以及语言脚本混用;它不惩罚风格或有效同义词。

系统电话线路得分准确性较难的语言对
LiveLingo4.85 / 596.9%87.0%
Google Cloud STT v2 + Translate v34.70 / 594.0%77.7%
Azure Speech Translation4.59 / 591.8%70.0%
Whisper-large + GPT-4o-mini4.44 / 588.9%66.7%

n=120个语音片段,英语翻译成西班牙语、日语、中文和德语。“较难的语言对”是另一个包含160个语音片段的集合,涵盖阿拉伯语、土耳其语、越南语、波兰语、葡萄牙语、印度尼西亚语、马来语和普通话源语言到欧洲和亚洲目标语言。于2026年8月在通过G.711电话信道传输的固定录音室级语料库上测量,可从上方下载;请参阅 完整方法和原始数据.

下载测试音频和结果

30个英语语音片段的两组,以及所有机器可读形式的分数。这两个档案包含相同的语音片段;唯一的区别是电话信道。根据 CC BY 4.0 发布,因此任何人都可以重新运行这些系统并检查数据。

audio-wideband.zip (3.1 MB,16 kHz) · audio-phoneline.zip (2.6 MB,G.711) · results.json

语言对之间的差异比顶级系统之间的差异更重要。即使是最强的系统,从德语到日语也会损失三分,而且每个系统在较难的走廊语言对上损失的分数远多于在电话线路上损失的分数。

语言对(最佳系统,电话线路)得分准确性
英语 → 德语4.92 / 598.4%
英语 → 西班牙语4.86 / 597.1%
英语 → 中文4.84 / 596.9%
英语 → 日语4.77 / 595.3%
LiveLingo

Tap and speak in English

Tap to start

2. Apple Live Translation 在电话通话中是否有效?

Apple Live Translation 支持在最新 iPhone 上进行电话通话,Samsung Galaxy AI 也提供类似的通话中功能。两者都表现出色,对于支持语言的 iPhone 到 iPhone 通话,它们是最方便的选择,因为无需安装任何东西。

它们的限制是覆盖范围,而非质量。两者都要求使用特定制造商的最新手机,都受限于这些制造商提供的语言集,而且关键是,两者都将功能放在您的设备上而不是线路上。这对于给拥有相同手机的朋友打电话来说很好。但当您需要联系诊所总机、房东、酒店前台或办公室电话已使用十年的供应商时,这无济于事。这些通话是大多数人最初寻找翻译通话产品的原因。

3. 为什么电话通话音频质量差,以及它是否会降低准确性?

电话通话采用 ITU-T G.711 编码,采样率为 8 kHz,传输范围约为 300 Hz 至 3400 Hz。被丢弃的频段并非空白。牛津大学语音学实验室的声学语音学研究表明,/s/ 的能量峰值大约在 4500 Hz 和 7500 Hz,完全高于电话上限,这也是为什么带宽受限的 /s/ 经常被误听为 /sh/。物理学预测电话音频应该更难处理。 ITU-T G.711 · University of Oxford Phonetics Laboratory

为了测试这一预测是否在输出中得以保留,我们制作了每个片段的两个版本。一个是原始的 16 kHz 录音。另一个是相同文件经过抗混叠滤波重新采样到 8 kHz,使用 G.711 mu-law 量化,然后解码回原始 16 kHz 容器,因此两个文件格式相同,没有任何系统可以根据采样率进行分支。3.4 kHz 以上的能量从信号的 14-22% 下降到大约 3%,而 RMS 响度保持不变,因此比较测量的是带宽而不是音量。

每个系统都与自身相差不到 0.04 分。LiveLingo 在麦克风音频上得分 97.2%,在电话线路上得分 96.9%;Google 分别为 93.4% 和 94.0%;Azure 分别为 91.7% 和 91.8%;Whisper 基线分别为 88.1% 和 88.9%。88% 的单个单元在两组中获得了相同的分数。电话带宽确实会破坏真实信息,而现代翻译几乎吸收了所有这些信息。

4. 识别漂移约 2%,系统之间的鲁棒性差异达 5 倍

质量保持稳定并不意味着底层没有发生任何变化。将每个系统从宽带文件生成的源转录与从电话线路文件生成的转录进行比较,Google Cloud Speech-to-Text v2 识别的词语改变了 0.4%,Whisper-large 基线改变了 2.0%,分别有 96% 和 81% 的转录完全没有变化。

原始比较严重夸大了这一点,原因值得说明,因为这类数字就是这样出错的。Whisper 会在尾随的静音处幻觉出常用短语,在任一分支中不可预测地发出固定的字幕式样板。中文输出会在简体和繁体脚本之间随机切换。阿拉伯语主要因 hamza 拼写而异。在移除这些之前,Whisper 的表观漂移测量为 5.7%;之后,为 2.0%。

有用的发现是,窄带鲁棒性在识别器之间差异约为 5 倍,这比电话线路本身的影响大得多。阿拉伯语和印度尼西亚语漂移最大,约为 5%,与摩擦音预测一致,即使在那里,保真度得分也没有变化。

5. AI 翻译在电话通话中是否比面对面更差?

因为通常引用的证据衡量的是其他东西。在 Whisper 论文(Radford et al., 2022)中,wav2vec 2.0 Large 和 Whisper Large V2 在 LibriSpeech 清晰朗读语音上的词错误率均为 2.7%。在 CallHome 电话语料库上,它们分别分化到 34.8% 和 17.6%。这个差距是真实存在的,而且很大,经常被用作电话音频是问题的证据。 Radford et al., 2022 · LDC CallHome

但 CallHome 不仅仅是窄带。它是自发的、重叠的、无脚本的、彼此非常熟悉的人之间的对话,充满了缩略语、假开始和串扰。LibriSpeech 是一个人大声朗读一本书。同时改变两个变量无法告诉您哪个变量更重要。隔离带宽几乎没有发现任何东西,这意味着 CallHome 的惩罚主要来自另一个变量。

这是更有用的结论,因为这些是您可以实际控制的因素。干净地轮流说话、移到更安静的地方,并让每个说话者说完,对翻译通话的帮助将大于对线路质量的任何担忧。

6. 真正区分电话翻译应用程序的因素

由于带宽成本几乎可以忽略不计,并且顶级系统在简单语言对上的差异在三分之内,因此重要的差异在于其他方面:您的特定语言对的质量下降程度、产品是否能拨打您需要拨打的号码,以及通话如何处理轮流说话。

语言对是最大的质量杠杆,因此请检查您自己的走廊语言对,而不是标题平均值。在覆盖范围方面,LiveLingo 从应用程序拨打翻译电话到任何手机或固定电话号码,因此接收方接听的是普通电话,无需安装任何东西。在行为方面,值得了解产品是诚实地宣布自己,还是克隆您的声音以隐藏翻译器的参与。 livelingo.io/phone-call-translation

7. 本次测试涵盖了什么,以及未涵盖什么

上述数字受限于四个具体的设计选择。说明这些并非对结果的推诿;而是结果成立的范围。

维度测试内容
源语音一个固定的录音室级语料库,选择它以确保两组都接收到声学上相同的输入,且说话者无变化。两组均已发布在上方,因此这里的每个数字都可以从我们使用的相同音频中重新推导出来。这些片段比自发对话更清晰,这使得它们成为第3节中带宽结果最有利的情况;语料库构建在方法页面有完整记录。
评判三位尖端LLM评委,而非人类评分员。66%的宽带单元获得了完美的5.0分,因此评分标准衡量的是意义是否保留,而非细粒度质量。
信道仅限 G.711 带宽限制和 mu-law 量化。未模拟丢包、抖动、自动增益控制和噪声抑制,而这些在实际通话中都会发生。
独立性LiveLingo 是我们的产品,在两个语料库上均排名第一。每组一次测量,因此未对运行间的评委差异进行平均。

实际解读:第1节中的排名是干净的同类比较,因为每个系统都接收到相同的音频和相同的评判。第3节中的带宽结果是对语料库选择最敏感的主张,下一步是在自发对话语音上进行复制。完整的推导、统计功效和我们移除的测量伪影记录在 完整方法和原始数据.

常见问题

电话翻译的准确性如何?

在我们2026年8月的测试中,最佳系统在电话线路音频上,对120个从英语翻译成西班牙语、日语、中文和德语的语音片段,在理解忠实度评分标准下,由三位独立的尖端LLM评委评分,获得了5分中的4.85分(96.9%)。Google Cloud Speech-to-Text v2 与 Translate v3 获得4.70分(94.0%),Azure Speech Translation 4.59分(91.8%),以及 Whisper-large 加 GPT-4o-mini 基线 4.44分(88.9%)。在较难的语言对上,例如阿拉伯语、土耳其语和越南语到欧洲和亚洲目标语言,相同的系统分别下降到87.0%、77.7%、70.0%和66.7%。

电话线路是否会使翻译不如面对面准确?

几乎没有。我们对相同的语音片段进行了两次评分,一次是宽带麦克风音频,另一次是将相同的录音通过模拟的 G.711 电话线路传输后,所有测试系统的理解忠实度在0-5分量表上移动不到0.04分。LiveLingo 在麦克风音频上得分97.2%,在电话线路上得分96.9%。电话带宽确实会损失信息,但现代翻译几乎吸收了所有这些信息。

为什么电话通话音频质量差?

标准电话通话使用 ITU-T G.711 编解码器,它只传输 300 Hz 到 3400 Hz,采样率为 8 kHz。人类语音携带的有用信息远高于此:/s/ 音的能量峰值在 4500 Hz 和 7500 Hz 左右,完全高于电话上限。这就是为什么电话音频听起来模糊不清,以及为什么带宽受限的 /s/ 经常被误听为 /sh/。这是一个真正的损失,只是对于现代语音系统来说,它比以前小得多。

Apple Live Translation 在电话通话中是否有效?

是的,在最新的 iPhone 上有效,Samsung Galaxy AI 也提供类似的通话中功能。两者都仅限于该制造商的最新手机以及这些制造商支持的语言,并且两者都要求该功能在您自己的设备上而不是线路上,因此当您需要呼叫办公室总机、固定电话或使用旧手机的人时,两者都无济于事。LiveLingo 从应用程序拨打翻译电话到任何手机或固定电话号码,接收方无需安装任何东西。

哪个翻译系统最擅长处理电话音频?

有两点将它们区分开来。在电话线路上的翻译质量方面,LiveLingo 在120个语音片段中得分96.9%,Google 94.0%,Azure 91.8%,Whisper-large 基线 88.9%。在原始识别鲁棒性方面,差异更大:当相同的片段通过电话线路时,Google Cloud Speech-to-Text v2 识别的词语仅改变了0.4%,而 Whisper 基线改变了2.0%,相差5倍。已发表的研究显示了相同的大规模模式:在 CallHome 电话语料库上,wav2vec 2.0 Large 的词错误率为34.8%,而 Whisper Large V2 为17.6%,尽管两者在清晰朗读语音上的得分均为2.7%。

糟糕的电话连接会使翻译变差吗?

仅带宽不会,但丢包、抖动和背景噪音是单独的问题,它们会。我们的测试隔离了频率范围,保持响度恒定,因此它只测量电话频段,不测量其他。有中断或严重街道噪音的通话会降低翻译质量,原因与它降低人类听众的质量相同,并且任何编解码器质量都无法弥补麦克风从未清晰捕捉到的语音。

完整方法、各语言结果、统计功效、局限性以及我们移除的测量伪影均记录在 livelingo.io/research/phone-line-bandwidth-method.

电话翻译的准确性如何?4个系统测试(2026年) | LiveLingo