電話通訳の精度は?4つのシステムをテスト(2026年)
公開日 2026-08-18 · LiveLingo創設者 Ron Villomo 著 · LiveLingoは測定されたシステムの一つです。 完全な方法と生データ
クイックアンサー:電話通訳の精度は?
2026年8月のテストでは、電話回線音声でLiveLingoが96.9%と最高スコアを記録しました。120の英語発話をスペイン語、日本語、中国語、ドイツ語に翻訳した結果、LiveLingoは5点中4.85点(96.9%)、Google Cloud Speech-to-Text v2とTranslate v3は4.70点(94.0%)、Azure Speech Translationは4.59点(91.8%)、Whisper-largeとGPT-4o-miniのベースラインは4.44点(88.9%)でした。より難しい言語ペアでは、それぞれ87.0%、77.7%、70.0%、66.7%に低下します。電話回線自体はほとんどコストがかかりません。広帯域マイク音声での同じシステムは、電話番号から0.04ポイント以内のスコアでした。採点は、G.711電話チャネルを介して伝送された固定スタジオグレードコーパスについて、3人の独立した最先端LLM審査員によって行われ、以下からダウンロード可能です。
1. 電話通訳の精度は?測定された回答
シミュレートされた電話回線を介して伝送された同一の音声について、4つのシステムを採点しました。各翻訳は、3人の独立した最先端LLM審査員によって理解度忠実度について0-5で評価され、以下のスコアは3つの平均値であり、最大値に対するパーセンテージとしても示されています。この評価基準は、誤った単語の置換、エンティティや数字の欠落、言語スクリプトの混在を減点しますが、スタイルや有効な同義語は減点しません。
| システム | 電話回線スコア | 精度 | より難しいペア |
|---|---|---|---|
| LiveLingo | 4.85 / 5 | 96.9% | 87.0% |
| Google Cloud STT v2 + Translate v3 | 4.70 / 5 | 94.0% | 77.7% |
| Azure Speech Translation | 4.59 / 5 | 91.8% | 70.0% |
| Whisper-large + GPT-4o-mini | 4.44 / 5 | 88.9% | 66.7% |
n=120発話、英語からスペイン語、日本語、中国語、ドイツ語へ。「より難しいペア」は、アラビア語、トルコ語、ベトナム語、ポーランド語、ポルトガル語、インドネシア語、マレー語、北京語をソースとし、ヨーロッパおよびアジアをターゲットとする別の160発話セットです。2026年8月に、G.711電話チャネルを介して伝送された固定スタジオグレードコーパスで測定され、上記からダウンロード可能です。詳細については、 完全な方法と生データ.
テスト音声と結果をダウンロード
30発話の英語セットの両アームと、機械可読形式のすべてのスコア。2つのアーカイブには同じ発話が含まれており、唯一の違いは電話チャネルです。CC BY 4.0でリリースされているため、誰でもこれらのシステムを再実行して数値を確認できます。
audio-wideband.zip (3.1 MB、16 kHz) · audio-phoneline.zip (2.6 MB、G.711) · results.json
言語ペア間の広がりは、上位システム間の広がりよりも重要です。最も強力なシステムでさえ、ドイツ語から日本語に移行すると3ポイント失い、すべてのシステムは、電話回線によって失われるよりも、より難しい回廊ペアで遥かに多くを失います。
| 言語ペア(ベストシステム、電話回線) | スコア | 精度 |
|---|---|---|
| 英語 → ドイツ語 | 4.92 / 5 | 98.4% |
| 英語 → スペイン語 | 4.86 / 5 | 97.1% |
| 英語 → 中国語 | 4.84 / 5 | 96.9% |
| 英語 → 日本語 | 4.77 / 5 | 95.3% |
Tap and speak in English
Tap to start
2. Apple Live Translationは電話で機能しますか?
Apple Live Translationは最新のiPhoneで電話を処理し、Samsung Galaxy AIも同様の通話中機能を提供します。どちらもその機能において優れており、サポートされている言語でのiPhone間の通話では、何もインストールする必要がないため、最も便利なオプションです。
その限界は品質ではなく、対応範囲です。どちらも特定のメーカーの最新のハンドセットを必要とし、メーカーが出荷する言語セットに制限され、決定的に、どちらもその機能を回線ではなくデバイスに搭載しています。これは同じ電話を持つ友人に電話をかける場合には問題ありません。しかし、診療所の交換台、家主、ホテルのフロント、または10年前のオフィス電話を使用しているサプライヤーに連絡する必要がある場合には役に立ちません。これらの通話こそ、ほとんどの人が翻訳通話製品を探す理由なのです。
3. 電話の音声品質が悪いのはなぜですか、そしてそれは精度を低下させますか?
電話はITU-T G.711でエンコードされ、8 kHzでサンプリングされ、約300 Hzから3400 Hzを伝送します。破棄された帯域は空ではありません。オックスフォード大学の音声学研究室による音響音声学の研究では、/s/のエネルギーピークは約4500 Hzと7500 Hzにあり、電話の天井を完全に超えています。これが、帯域制限された/s/が体系的に/sh/と誤って聞き取られる理由でもあります。物理学は、電話音声がより難しいと予測しています。 ITU-T G.711 · University of Oxford Phonetics Laboratory
その予測が出力まで生き残るかどうかをテストするために、すべてのクリップの2つのバージョンを作成しました。1つは元の16 kHz録音です。もう1つは、同じファイルをアンチエイリアスフィルタリングで8 kHzにリサンプリングし、G.711 μ-lawで量子化し、その後元の16 kHzコンテナにデコードし直したものです。したがって、両方のファイルはフォーマットが同一であり、どのシステムもサンプルレートに基づいて分岐することはありません。3.4 kHzを超えるエネルギーは、信号の14-22%から約3%に低下しますが、RMSラウドネスは変化しないため、比較は帯域幅を測定し、音量を測定するものではありません。
すべてのシステムは、それ自体から0.04ポイント以内に収まりました。LiveLingoはマイク音声で97.2%、電話回線で96.9%を記録しました。Googleは93.4%と94.0%、Azureは91.7%と91.8%、Whisperベースラインは88.1%と88.9%でした。個々のセルの88%は、両アームで同一のスコアを受け取りました。電話帯域幅は実際の情報を破壊しますが、現代の翻訳はほとんどすべてを吸収します。
4. 認識は約2%ドリフトし、堅牢性はシステム間で5倍異なります
品質が安定しているからといって、内部で何も起こらなかったわけではありません。各システムが広帯域ファイルから生成したソース転写と、電話回線ファイルから生成したソース転写を比較すると、Google Cloud Speech-to-Text v2は認識された単語の0.4%を変更し、Whisper-largeベースラインは2.0%を変更しました。それぞれ96%と81%の転写は完全に変更されませんでした。
生の比較はこれをひどく過大評価しており、その理由は、この種の数値がどのように間違っているかを示すため、述べる価値があります。Whisperは、末尾の無音に定型句を幻覚させ、固定された字幕スタイルの定型文をどちらかのアームで予測不能に放出します。中国語の出力は、簡体字と繁体字の間でランダムに切り替わります。アラビア語は主にハムザのスペルが異なります。これらを除去する前は、Whisperの見かけのドリフトは5.7%でしたが、除去後は2.0%です。
有用な発見は、ナローバンドの堅牢性が認識器間で約5倍異なることであり、これは電話回線自体よりもはるかに大きな影響です。アラビア語とインドネシア語は摩擦音の予測と一致して約5%と最もドリフトしましたが、それでも忠実度スコアは動きませんでした。
5. AI翻訳は電話通話で対面よりも悪化しますか?
なぜなら、通常引用される証拠は別のものを測定しているからです。Whisperの論文(Radford et al., 2022)では、wav2vec 2.0 LargeとWhisper Large V2はどちらもLibriSpeechのクリーンな読み上げ音声で2.7%の単語誤り率を記録しています。CallHome電話コーパスでは、それぞれ34.8%と17.6%に乖離します。このギャップは現実的で大きく、電話音声が問題であることの証拠として日常的に提示されています。 Radford et al., 2022 · LDC CallHome
しかし、CallHomeは単なるナローバンドではありません。それは、お互いをよく知っている人々の間の自発的で、重なり合い、台本のない会話であり、短縮形、言い間違い、クロストークが密集しています。LibriSpeechは一人が本を読み上げているものです。2つの変数を同時に変更しても、どちらが重要であったかを判断することはできません。帯域幅を分離するとほとんど何も見つからないため、CallHomeのペナルティはほとんどが別の変数によるものです。
これはより有用な結論です。なぜなら、これらは実際に制御できる要因だからです。きれいに順番を待ち、より静かな場所に移動し、各話者が話し終えるのを待つことは、回線品質に関する懸念よりも、翻訳された通話にとってより効果的です。
6. 電話通訳アプリを実際に区別するもの
帯域幅には測定可能なコストがかからず、上位システムは簡単なペアでは互いに3ポイント以内に収まっているため、重要な違いは別の場所にあります。つまり、特定の言語ペアで品質がどれだけ低下するか、製品が電話をかける必要のある番号に到達できるか、そして通話がターンテーキングをどのように処理するかです。
言語ペアは、品質の最大のレバーであり、その差は大きいため、見出しの平均ではなく、ご自身の回廊を確認してください。到達性については、LiveLingoはアプリから任意の携帯電話または固定電話番号に翻訳された通話を発信するため、受信者は通常の電話を受け、何もインストールする必要はありません。そして、行動については、製品が正直に自己紹介するか、翻訳者が関与していることを隠すためにあなたの声をクローンするかを知る価値があります。 livelingo.io/phone-call-translation
7. このテストがカバーするものとカバーしないもの
上記の数値は、4つの特定の設計上の選択によって制限されています。それらを述べることは結果に対する言い訳ではなく、結果が有効である範囲を示しています。
| 次元 | テストされた内容 |
|---|---|
| ソース音声 | 固定されたスタジオグレードのコーパス。両アームが音響的に同一の入力とゼロの話し手変動を受け取るように選択されました。両アームは上記で公開されているため、ここにあるすべての数値は、私たちが使用した同じ音声から再導出できます。クリップは自発的な会話よりも明確に発音されており、セクション3の帯域幅の結果にとって最も好ましいケースとなっています。コーパスの構築は、方法のページで完全に文書化されています。 |
| 評価 | 人間の評価者ではなく、3人の最先端LLM審査員。広帯域セルの66%が完璧な5.0を記録したため、評価基準はきめ細かい品質ではなく、意味が維持されたかどうかを測定します。 |
| チャネル | G.711帯域制限とμ-law量子化のみ。パケット損失、ジッター、自動利得制御、ノイズ抑制はモデル化されておらず、これらはすべて実際の通話で発生します。 |
| 独立性 | LiveLingoは当社の製品であり、両方のコーパスで1位を獲得しました。各アームにつき1回の測定であるため、実行ごとの審査員のばらつきは平均化されていません。 |
実用的な解釈:セクション1のランキングは、すべてのシステムが同一の音声と同一の評価を受けたため、クリーンな同等比較です。セクション3の帯域幅の結果は、コーパスの選択に最も敏感な主張であり、自発的な会話音声での再現が次のステップです。完全な導出、統計的検出力、および除去した測定アーティファクトは、 完全な方法と生データ.
よくある質問
電話通訳の精度は?
2026年8月のテストでは、最高のシステムが、スペイン語、日本語、中国語、ドイツ語に翻訳された120の英語発話について、電話回線音声で5点中4.85点(96.9%)を記録しました。これは、理解度忠実度評価基準に基づいて3人の独立した最先端LLM審査員によって採点されたものです。Google Cloud Speech-to-Text v2とTranslate v3は4.70点(94.0%)、Azure Speech Translationは4.59点(91.8%)、Whisper-largeとGPT-4o-miniのベースラインは4.44点(88.9%)でした。アラビア語、トルコ語、ベトナム語からヨーロッパおよびアジアのターゲットへのより難しい言語ペアでは、同じシステムはそれぞれ87.0%、77.7%、70.0%、66.7%に低下しました。
電話回線は対面よりも翻訳の精度を低下させますか?
ほとんど低下させません。同じ発話を2回採点しました。1回は広帯域マイク音声として、もう1回は同一の録音をシミュレートされたG.711電話回線を介して通過させた後です。テストされたすべてのシステムで、理解度忠実度は0-5スケールで0.04ポイント未満しか動きませんでした。LiveLingoはマイク音声で97.2%、電話回線で96.9%を記録しました。電話帯域幅は実際の情報損失ですが、現代の翻訳はほとんどすべてを吸収します。
電話の音声品質が悪いのはなぜですか?
標準的な電話通話はITU-T G.711コーデックを使用し、300 Hzから3400 Hzのみを伝送し、8 kHzでサンプリングします。人間の音声はそれよりもはるかに高い有用な情報を伝送します。/s/の音は4500 Hzと7500 Hz付近にエネルギーピークがあり、電話の天井を完全に超えています。これが、電話音声がこもって聞こえる理由であり、帯域制限された/s/がしばしば/sh/と誤って聞き取られる理由です。これは真の情報損失ですが、現代の音声システムにとっては以前よりもはるかに小さな問題です。
Apple Live Translationは電話で機能しますか?
はい、最新のiPhoneで機能し、Samsung Galaxy AIも同様の通話中機能を提供します。どちらもそのメーカーの最新のハンドセットと、そのメーカーがサポートする言語に限定されており、どちらも回線ではなく自身のデバイスに機能を必要とするため、オフィスの交換台、固定電話、または古い電話を使用している人に電話をかける必要がある場合にはどちらも役に立ちません。LiveLingoはアプリから任意の携帯電話または固定電話番号に翻訳された通話を発信し、受信者は何もインストールする必要はありません。
どの翻訳システムが電話音声を最もよく処理しますか?
2つの点がそれらを区別します。電話回線での翻訳品質では、120の発話でLiveLingoが96.9%、Googleが94.0%、Azureが91.8%、Whisper-largeベースラインが88.9%を記録しました。生の認識堅牢性では、その広がりはより大きくなります。同じクリップが電話回線を通過した場合、Google Cloud Speech-to-Text v2は認識された単語の0.4%しか変更しなかったのに対し、Whisperベースラインは2.0%変更し、5倍の差がありました。公開された研究では、大規模でも同じパターンが示されています。CallHome電話コーパスでは、wav2vec 2.0 Largeが34.8%の単語誤り率を記録したのに対し、Whisper Large V2は17.6%でした。これは、どちらもクリーンな読み上げ音声では2.7%と同一のスコアを記録したにもかかわらずです。
電話の接続が悪いと翻訳が悪化しますか?
帯域幅だけでは悪化しませんが、パケット損失、ジッター、バックグラウンドノイズは別の問題であり、それらは悪化させます。私たちのテストでは周波数範囲を分離し、ラウドネスを一定に保ったため、電話帯域のみを測定し、それ以外は測定していません。途切れや激しい街の騒音がある通話は、人間の聞き手にとって翻訳を劣化させるのと同じ理由で翻訳を劣化させ、マイクがクリーンに捉えなかった音声を補償するコーデック品質はありません。
完全な方法、言語ごとの結果、統計的検出力、制限事項、および除去した測定アーティファクトは、 livelingo.io/research/phone-line-bandwidth-method.