전화 통화 번역 정확도는 어느 정도인가? 4가지 시스템 테스트 (2026)
게시됨 2026-08-18 · Ron Villomo, LiveLingo 설립자 · LiveLingo는 측정된 시스템 중 하나입니다. 전체 방법 및 원시 데이터
빠른 답변: 전화 통화 번역 정확도는 어느 정도인가?
2026년 8월 테스트에서 LiveLingo는 전화선 오디오에서 96.9%로 가장 높은 점수를 받았습니다. 스페인어, 일본어, 중국어, 독일어로 번역된 120개의 영어 발화에서 LiveLingo는 5점 만점에 4.85점(96.9%)을 기록했으며, Google Cloud Speech-to-Text v2와 Translate v3는 4.70점(94.0%), Azure Speech Translation은 4.59점(91.8%), Whisper-large와 GPT-4o-mini 기준선은 4.44점(88.9%)을 기록했습니다. 더 어려운 언어 쌍에서는 각각 87.0%, 77.7%, 70.0%, 66.7%로 떨어졌습니다. 전화선 자체는 거의 비용이 들지 않습니다. 광대역 마이크 오디오에서 동일한 시스템은 전화 번호와 0.04점 이내의 점수를 기록했습니다. 채점은 G.711 전화 채널을 통해 전달된 고정된 스튜디오급 코퍼스에서 3명의 독립적인 최첨단 LLM 심사위원에 의해 이루어졌으며, 아래에서 다운로드할 수 있습니다.
1. 전화 통화 번역 정확도는 어느 정도인가? 측정된 답변
저희는 시뮬레이션된 전화 구간을 통과한 동일한 오디오에서 4가지 시스템을 평가했습니다. 각 번역은 3명의 독립적인 최첨단 LLM 심사위원에 의해 이해도 충실도에 대해 0-5점으로 평가되었으며, 아래 점수는 세 심사위원의 평균이며 최대값에 대한 백분율로도 표시됩니다. 채점 기준은 잘못된 단어 대체, 누락된 개체 또는 숫자, 언어 스크립트 혼합에 대해 불이익을 주며, 스타일 또는 유효한 동의어에 대해서는 불이익을 주지 않습니다.
| 시스템 | 전화선 점수 | 정확도 | 더 어려운 쌍 |
|---|---|---|---|
| LiveLingo | 4.85 / 5 | 96.9% | 87.0% |
| Google Cloud STT v2 + Translate v3 | 4.70 / 5 | 94.0% | 77.7% |
| Azure Speech Translation | 4.59 / 5 | 91.8% | 70.0% |
| Whisper-large + GPT-4o-mini | 4.44 / 5 | 88.9% | 66.7% |
n=120개 발화, 영어를 스페인어, 일본어, 중국어, 독일어로 번역. “더 어려운 쌍”은 아랍어, 터키어, 베트남어, 폴란드어, 포르투갈어, 인도네시아어, 말레이어, 표준 중국어 소스를 유럽 및 아시아 대상으로 번역하는 별도의 160개 발화 세트입니다. 2026년 8월에 G.711 전화 채널을 통해 전달된 고정된 스튜디오급 코퍼스에서 측정되었으며, 위에서 다운로드할 수 있습니다. 다음을 참조하십시오. 전체 방법 및 원시 데이터.
테스트 오디오 및 결과 다운로드
30개 발화 영어 세트의 양쪽 팔과 기계 판독 가능한 형식의 모든 점수. 두 아카이브에는 동일한 발화가 포함되어 있으며, 유일한 차이점은 전화 채널입니다. CC BY 4.0에 따라 배포되므로 누구나 이 시스템을 다시 실행하고 숫자를 확인할 수 있습니다.
audio-wideband.zip (3.1 MB, 16 kHz) · audio-phoneline.zip (2.6 MB, G.711) · results.json
언어 쌍 간의 확산은 상위 시스템 간의 확산보다 더 중요합니다. 가장 강력한 시스템조차도 독일어에서 일본어로 이동할 때 3점을 잃으며, 모든 시스템은 전화선으로 인해 잃는 것보다 더 어려운 회랑 쌍에서 훨씬 더 많이 잃습니다.
| 언어 쌍 (최고 시스템, 전화선) | 점수 | 정확도 |
|---|---|---|
| 영어 → 독일어 | 4.92 / 5 | 98.4% |
| 영어 → 스페인어 | 4.86 / 5 | 97.1% |
| 영어 → 중국어 | 4.84 / 5 | 96.9% |
| 영어 → 일본어 | 4.77 / 5 | 95.3% |
Tap and speak in English
Tap to start
2. Apple Live Translation은 전화 통화에서 작동하는가?
Apple Live Translation은 최신 iPhone에서 전화 통화를 처리하며, Samsung Galaxy AI는 유사한 통화 중 기능을 제공합니다. 둘 다 해당 기능에 능숙하며, 지원되는 언어로 iPhone 간 통화의 경우 설치할 필요가 없으므로 가장 편리한 옵션입니다.
그들의 한계는 품질이 아니라 적용 범위입니다. 둘 다 해당 특정 제조업체의 최신 핸드셋이 필요하며, 둘 다 해당 제조업체가 제공하는 언어 세트로 제한되며, 결정적으로 둘 다 기능을 회선이 아닌 장치에 배치합니다. 이는 동일한 전화기를 가진 친구에게 전화하는 데는 좋습니다. 그러나 진료소 교환원, 집주인, 호텔 데스크 또는 사무실 전화기가 10년 된 공급업체에 연락해야 할 때는 도움이 되지 않습니다. 이러한 통화는 대부분의 사람들이 번역된 통화 제품을 처음부터 찾는 이유입니다.
3. 전화 통화 오디오 품질이 나쁜 이유는 무엇이며, 정확도를 떨어뜨리는가?
전화 통화는 8 kHz로 샘플링하고 약 300 Hz에서 3400 Hz를 전달하는 ITU-T G.711로 인코딩됩니다. 버려진 대역은 비어 있지 않습니다. 옥스퍼드 대학교 음성학 연구실의 음향 음성학 연구에 따르면 /s/의 에너지 피크는 약 4500 Hz 및 7500 Hz에 있으며, 이는 전화 상한선을 완전히 초과합니다. 이것이 대역 제한된 /s/가 체계적으로 /sh/로 잘못 들리는 이유이기도 합니다. 물리학은 전화 오디오가 더 어려워야 한다고 예측합니다. ITU-T G.711 · University of Oxford Phonetics Laboratory
그 예측이 출력까지 유지되는지 테스트하기 위해 모든 클립의 두 가지 버전을 제작했습니다. 하나는 원본 16 kHz 녹음입니다. 다른 하나는 동일한 파일을 안티앨리어싱 필터링으로 8 kHz로 리샘플링하고, G.711 mu-law로 양자화한 다음, 원본 16 kHz 컨테이너로 다시 디코딩한 것입니다. 따라서 두 파일은 형식이 동일하며 어떤 시스템도 샘플링 속도에 따라 분기할 수 없습니다. 3.4 kHz 이상의 에너지는 신호의 14-22%에서 약 3%로 떨어지는 반면, RMS 음량은 변하지 않으므로 비교는 대역폭을 측정하고 볼륨을 측정하지 않습니다.
모든 시스템은 0.04점 이내로 착지했습니다. LiveLingo는 마이크 오디오에서 97.2%, 전화선에서 96.9%를 기록했습니다. Google은 93.4%와 94.0%, Azure는 91.7%와 91.8%, Whisper 기준선은 88.1%와 88.9%를 기록했습니다. 개별 셀의 88%는 양쪽 팔에서 동일한 점수를 받았습니다. 전화 대역폭은 실제 정보를 파괴하며 현대 번역은 거의 모든 것을 흡수합니다.
4. 인식은 약 2% 정도 표류하며, 견고성은 시스템 간에 5x 차이가 납니다
품질이 안정적으로 유지된다고 해서 내부적으로 아무 일도 일어나지 않았다는 의미는 아닙니다. 각 시스템이 광대역 파일에서 생성한 원본 스크립트와 전화선 파일에서 생성한 스크립트를 비교한 결과, Google Cloud Speech-to-Text v2는 인식된 단어의 0.4%를 변경했으며 Whisper-large 기준선은 2.0%를 변경했으며, 각각 96%와 81%의 스크립트가 완전히 변경되지 않은 상태로 돌아왔습니다.
원시 비교는 이것을 심하게 과장하며, 그 이유는 이러한 종류의 숫자가 잘못되는 방식이기 때문에 언급할 가치가 있습니다. Whisper는 후행 침묵에 상투적인 문구를 환각하여 예측할 수 없게 양쪽 팔에서 고정된 자막 스타일의 상용구를 내보냅니다. 중국어 출력은 간체와 번체 스크립트 사이를 무작위로 전환합니다. 아랍어는 주로 함자 철자법에서 다릅니다. 이들을 제거하기 전에는 Whisper의 명백한 표류가 5.7%로 측정되었지만, 제거 후에는 2.0%입니다.
유용한 발견은 협대역 견고성이 인식기 간에 약 5배 차이가 난다는 것입니다. 이는 전화선 자체보다 훨씬 더 큰 효과입니다. 아랍어와 인도네시아어는 마찰음 예측과 일치하게 약 5%로 가장 많이 표류했으며, 심지어 거기에서도 충실도 점수는 움직이지 않았습니다.
5. AI 번역은 직접 대화할 때보다 전화 통화에서 더 나빠지는가?
그것에 대해 인용되는 증거는 보통 다른 것을 측정하기 때문입니다. Whisper 논문(Radford et al., 2022)에서 wav2vec 2.0 Large와 Whisper Large V2는 LibriSpeech 깨끗한 읽기 음성에서 동일한 2.7%의 단어 오류율을 기록합니다. CallHome 전화 코퍼스에서는 34.8%와 17.6%로 갈라집니다. 이 격차는 실제적이고 크며, 전화 오디오가 문제라는 증거로 일상적으로 제시됩니다. Radford et al., 2022 · LDC CallHome
그러나 CallHome은 단순히 협대역이 아닙니다. 그것은 서로 잘 아는 사람들 간의 자발적이고, 겹치고, 대본 없는 대화이며, 축약어, 잘못된 시작, 교차 대화로 가득합니다. LibriSpeech는 한 사람이 책을 소리 내어 읽는 것입니다. 두 변수를 동시에 변경하면 어떤 변수가 중요했는지 알 수 없습니다. 대역폭을 분리하면 거의 아무것도 발견되지 않으며, 이는 CallHome 페널티가 대부분 다른 변수라는 의미입니다.
이것이 더 유용한 결론입니다. 왜냐하면 그것들은 실제로 제어할 수 있는 요소이기 때문입니다. 깔끔하게 차례를 지키고, 더 조용한 곳으로 이동하고, 각 화자가 말을 마치도록 하는 것이 회선 품질에 대한 어떤 우려보다 번역된 통화에 더 도움이 될 것입니다.
6. 전화 통화 번역 앱을 실제로 구분하는 요소
대역폭은 측정 가능한 비용이 들지 않고 상위 시스템은 쉬운 쌍에서 서로 3점 이내에 있으므로 중요한 차이점은 다른 곳에 있습니다. 즉, 특정 언어 쌍에서 품질이 얼마나 떨어지는지, 제품이 전화해야 하는 번호에 도달할 수 있는지, 그리고 통화가 차례를 어떻게 처리하는지입니다.
언어 쌍은 가장 큰 품질 레버이므로 헤드라인 평균보다는 자신의 회랑을 확인하십시오. 도달 범위에 있어서 LiveLingo는 앱에서 모든 모바일 또는 유선 전화 번호로 번역된 통화를 걸 수 있으므로 수신자는 일반 전화 통화를 받고 아무것도 설치하지 않습니다. 그리고 행동에 있어서 제품이 정직하게 자신을 알리는지 아니면 번역가가 개입했다는 사실을 숨기기 위해 목소리를 복제하는지 아는 것이 중요합니다. livelingo.io/phone-call-translation
7. 이 테스트가 다루는 것과 다루지 않는 것
위의 숫자는 네 가지 특정 설계 선택에 의해 제한됩니다. 이를 명시하는 것은 결과에 대한 회피가 아니라 결과가 유효한 범위입니다.
| 차원 | 테스트된 내용 |
|---|---|
| 원본 음성 | 고정된 스튜디오급 코퍼스. 스피커 변동 없이 음향적으로 동일한 입력을 양쪽 팔이 받도록 선택되었습니다. 양쪽 팔은 위에 게시되어 있으므로 여기의 모든 숫자는 우리가 사용한 동일한 오디오에서 다시 도출될 수 있습니다. 클립은 자발적인 대화보다 더 명확하게 발음되므로 섹션 3의 대역폭 결과에 가장 유리한 경우입니다. 코퍼스 구성은 방법 페이지에 자세히 문서화되어 있습니다. |
| 채점 | 인간 평가자가 아닌 세 명의 최첨단 LLM 심사위원. 광대역 셀의 66%가 완벽한 5.0점을 받았으므로 채점 기준은 미세한 품질보다는 의미가 유지되었는지 여부를 측정합니다. |
| 채널 | G.711 대역 제한 및 mu-law 양자화만 해당. 패킷 손실, 지터, 자동 이득 제어 및 노이즈 억제는 모델링되지 않으며, 이 모든 것은 실제 통화에서 발생합니다. |
| 독립성 | LiveLingo는 당사의 제품이며 두 코퍼스에서 모두 1위를 차지했습니다. 팔당 하나의 측정값이므로 실행 간 심사위원 분산은 평균화되지 않습니다. |
실용적인 해석: 섹션 1의 순위는 모든 시스템이 동일한 오디오와 동일한 채점을 받았으므로 깔끔한 동종 비교입니다. 섹션 3의 대역폭 결과는 코퍼스 선택에 가장 민감한 주장이며, 자발적인 대화 음성에서의 복제는 다음 단계입니다. 전체 파생, 통계적 검정력 및 제거된 측정 아티팩트는 다음에서 문서화되어 있습니다. 전체 방법 및 원시 데이터.
자주 묻는 질문
전화 통화 번역 정확도는 어느 정도인가?
2026년 8월 테스트에서 최고의 시스템은 스페인어, 일본어, 중국어, 독일어로 번역된 120개의 영어 발화에서 전화선 오디오에서 5점 만점에 4.85점(96.9%)을 기록했으며, 3명의 독립적인 최첨단 LLM 심사위원이 이해도 충실도 채점 기준에 따라 평가했습니다. Google Cloud Speech-to-Text v2와 Translate v3는 4.70점(94.0%), Azure Speech Translation은 4.59점(91.8%), Whisper-large와 GPT-4o-mini 기준선은 4.44점(88.9%)을 기록했습니다. 아랍어, 터키어, 베트남어와 같은 더 어려운 언어 쌍을 유럽 및 아시아 대상으로 번역할 때 동일한 시스템은 각각 87.0%, 77.7%, 70.0%, 66.7%로 떨어졌습니다.
전화선은 직접 대화할 때보다 번역을 덜 정확하게 만드는가?
거의 그렇지 않습니다. 저희는 동일한 발화를 두 번 평가했습니다. 한 번은 광대역 마이크 오디오로, 다른 한 번은 동일한 녹음을 시뮬레이션된 G.711 전화 구간을 통과시킨 후 평가했으며, 테스트된 모든 시스템에서 0-5점 척도에서 이해도 충실도가 0.04점 미만으로 움직였습니다. LiveLingo는 마이크 오디오에서 97.2%, 전화선에서 96.9%를 기록했습니다. 전화 대역폭은 실제 정보 손실이지만, 현대 번역은 거의 모든 것을 흡수합니다.
전화 통화 오디오 품질이 나쁜 이유는 무엇인가?
표준 전화 통화는 ITU-T G.711 코덱을 사용하며, 이는 300 Hz에서 3400 Hz만 전달하고 8 kHz로 샘플링합니다. 인간의 음성은 그보다 훨씬 높은 유용한 정보를 전달합니다. /s/ 소리는 약 4500 Hz 및 7500 Hz 주변에 에너지 피크를 가지며, 이는 전화 상한선을 완전히 초과합니다. 이것이 전화 오디오가 먹먹하게 들리고 대역 제한된 /s/가 종종 /sh/로 잘못 들리는 이유입니다. 이는 진정한 손실이지만, 현대 음성 시스템에는 예전보다 훨씬 작은 문제입니다.
Apple Live Translation은 전화 통화에서 작동하는가?
예, 최신 iPhone에서 작동하며, Samsung Galaxy AI는 유사한 통화 중 기능을 제공합니다. 둘 다 해당 제조업체의 최신 핸드셋과 해당 제조업체가 지원하는 언어로 제한되며, 둘 다 회선이 아닌 자신의 장치에 기능이 필요하므로 사무실 교환원, 유선 전화 또는 오래된 전화기를 사용하는 사람에게 전화해야 할 때는 도움이 되지 않습니다. LiveLingo는 앱에서 모든 모바일 또는 유선 전화 번호로 번역된 통화를 걸 수 있으며 수신자는 아무것도 설치하지 않습니다.
어떤 번역 시스템이 전화 오디오를 가장 잘 처리하는가?
두 가지가 그들을 구분합니다. 전화선에서의 번역 품질에 있어서 LiveLingo는 96.9%, Google은 94.0%, Azure는 91.8%, Whisper-large 기준선은 120개 발화에서 88.9%를 기록했습니다. 원시 인식 견고성에서는 확산이 더 넓습니다. 동일한 클립이 전화 구간을 통과했을 때 Google Cloud Speech-to-Text v2는 인식된 단어의 0.4%만 변경한 반면 Whisper 기준선은 2.0%를 변경하여 5배의 차이를 보였습니다. 발표된 연구는 대규모에서 동일한 패턴을 보여줍니다. CallHome 전화 코퍼스에서 wav2vec 2.0 Large는 34.8%의 단어 오류율을 기록하는 반면 Whisper Large V2는 17.6%를 기록하며, 둘 다 깨끗한 읽기 음성에서는 동일한 2.7%를 기록합니다.
나쁜 전화 연결이 번역을 더 나쁘게 만드는가?
대역폭만으로는 그렇지 않지만, 패킷 손실, 지터 및 배경 소음은 별개의 문제이며 그들은 그렇습니다. 저희 테스트는 음량을 일정하게 유지하면서 주파수 범위를 분리했으므로 전화 대역만 측정하고 다른 것은 측정하지 않습니다. 끊김이나 심한 거리 소음이 있는 통화는 인간 청취자를 저하시키는 것과 동일한 이유로 번역을 저하시키며, 어떤 코덱 품질도 마이크가 깨끗하게 포착하지 못한 음성을 보상하지 못합니다.
전체 방법, 언어별 결과, 통계적 검정력, 한계 및 제거된 측정 아티팩트는 다음에서 문서화되어 있습니다. livelingo.io/research/phone-line-bandwidth-method.