फ़ोन कॉल अनुवाद कितना सटीक है? 4 प्रणालियों का परीक्षण किया गया (2026)
प्रकाशित 2026-08-18 · रॉन विलोमो, LiveLingo के संस्थापक द्वारा · LiveLingo मापी गई प्रणालियों में से एक है; पूरी विधि और कच्चा डेटा
त्वरित उत्तर: फ़ोन कॉल अनुवाद कितना सटीक है?
अगस्त 2026 में हमारे परीक्षण में, LiveLingo ने फ़ोन-लाइन ऑडियो पर 96.9% के साथ उच्चतम स्कोर किया। स्पेनिश, जापानी, चीनी और जर्मन में अनुवादित 120 अंग्रेजी कथनों में, LiveLingo ने 5 में से 4.85 (96.9%) अंक प्राप्त किए, Google Cloud Speech-to-Text v2 ने Translate v3 के साथ 4.70 (94.0%) अंक प्राप्त किए, Azure Speech Translation ने 4.59 (91.8%) अंक प्राप्त किए और एक Whisper-large प्लस GPT-4o-mini बेसलाइन ने 4.44 (88.9%) अंक प्राप्त किए। कठिन भाषा युग्मों पर ये 87.0%, 77.7%, 70.0% और 66.7% तक गिर जाते हैं। फ़ोन लाइन का स्वयं लगभग कोई खर्च नहीं होता है: वाइडबैंड माइक्रोफ़ोन ऑडियो पर समान प्रणालियों ने अपने फ़ोन नंबरों के 0.04 अंकों के भीतर स्कोर किया। स्कोरिंग तीन स्वतंत्र फ्रंटियर LLM न्यायाधीशों द्वारा एक निश्चित स्टूडियो-ग्रेड कॉर्पस पर की गई थी जिसे G.711 फ़ोन चैनल पर ले जाया गया था, जिसे नीचे डाउनलोड किया जा सकता है।
1. फ़ोन कॉल अनुवाद कितना सटीक है? मापा गया उत्तर
हमने एक सिम्युलेटेड फ़ोन लेग के माध्यम से पारित समान ऑडियो पर चार प्रणालियों का मूल्यांकन किया। प्रत्येक अनुवाद को तीन स्वतंत्र फ्रंटियर LLM न्यायाधीशों द्वारा समझ की सटीकता के लिए 0-5 रेट किया गया था, और नीचे दिया गया स्कोर तीनों का औसत है, जिसे अधिकतम के प्रतिशत के रूप में भी दिखाया गया है। यह रूब्रिक गलत-शब्द प्रतिस्थापन, छोड़ी गई संस्थाओं या संख्याओं, और भाषा-स्क्रिप्ट मिश्रण को दंडित करता है; यह शैली या वैध समानार्थी शब्दों को दंडित नहीं करता है।
| प्रणाली | फ़ोन-लाइन स्कोर | सटीकता | कठिन युग्म |
|---|---|---|---|
| LiveLingo | 4.85 / 5 | 96.9% | 87.0% |
| Google Cloud STT v2 + Translate v3 | 4.70 / 5 | 94.0% | 77.7% |
| Azure Speech Translation | 4.59 / 5 | 91.8% | 70.0% |
| Whisper-large + GPT-4o-mini | 4.44 / 5 | 88.9% | 66.7% |
n=120 कथन, अंग्रेजी से स्पेनिश, जापानी, चीनी और जर्मन में। “कठिन युग्म” एक अलग 160-कथन सेट है जिसमें यूरोपीय और एशियाई लक्ष्यों में अरबी, तुर्की, वियतनामी, पोलिश, पुर्तगाली, इंडोनेशियाई, मलय और मंदारिन स्रोत शामिल हैं। अगस्त 2026 में एक निश्चित स्टूडियो-ग्रेड कॉर्पस पर मापा गया जिसे G.711 फ़ोन चैनल पर ले जाया गया था, जिसे ऊपर डाउनलोड किया जा सकता है; देखें पूरी विधि और कच्चा डेटा.
परीक्षण ऑडियो और परिणाम डाउनलोड करें
30-कथन वाले अंग्रेजी सेट के दोनों भाग, साथ ही मशीन-पठनीय रूप में प्रत्येक स्कोर। दोनों अभिलेखागार में समान कथन हैं; एकमात्र अंतर फ़ोन चैनल है। CC BY 4.0 के तहत जारी किया गया है, ताकि कोई भी इन प्रणालियों को फिर से चला सके और संख्याओं की जांच कर सके।
audio-wideband.zip (3.1 MB, 16 kHz) · audio-phoneline.zip (2.6 MB, G.711) · results.json
भाषा युग्मों के बीच का फैलाव शीर्ष प्रणालियों के बीच के फैलाव से अधिक मायने रखता है। सबसे मजबूत प्रणाली भी जर्मन से जापानी में जाने पर तीन अंक खो देती है, और हर प्रणाली कठिन कॉरिडोर युग्मों पर फ़ोन लाइन की तुलना में कहीं अधिक खो देती है।
| भाषा युग्म (सर्वश्रेष्ठ प्रणाली, फ़ोन-लाइन) | स्कोर | सटीकता |
|---|---|---|
| अंग्रेजी → जर्मन | 4.92 / 5 | 98.4% |
| अंग्रेजी → स्पेनिश | 4.86 / 5 | 97.1% |
| अंग्रेजी → चीनी | 4.84 / 5 | 96.9% |
| अंग्रेजी → जापानी | 4.77 / 5 | 95.3% |
Tap and speak in English
Tap to start
2. क्या Apple Live Translation फ़ोन कॉल पर काम करता है?
Apple Live Translation हाल के iPhones पर फ़ोन कॉल को संभालता है और Samsung Galaxy AI एक तुलनीय इन-कॉल सुविधा प्रदान करता है। दोनों अपने काम में अच्छे हैं, और एक समर्थित भाषा में iPhone-से-iPhone कॉल के लिए वे सबसे सुविधाजनक विकल्प उपलब्ध हैं क्योंकि कुछ भी स्थापित करने की आवश्यकता नहीं है।
उनकी सीमा कवरेज है, गुणवत्ता नहीं। दोनों को उस विशिष्ट निर्माता के हाल के हैंडसेट की आवश्यकता होती है, दोनों उन भाषा सेटों तक सीमित हैं जिन्हें वे निर्माता भेजते हैं, और महत्वपूर्ण रूप से दोनों क्षमता को आपकी डिवाइस पर रखते हैं न कि लाइन पर। यह समान फ़ोन वाले मित्र को कॉल करने के लिए ठीक है। यह तब मदद नहीं करता जब आपको किसी क्लिनिक स्विचबोर्ड, मकान मालिक, होटल डेस्क, या किसी ऐसे आपूर्तिकर्ता तक पहुंचने की आवश्यकता हो जिसका कार्यालय फ़ोन एक दशक पुराना हो। वे कॉल ही कारण हैं कि अधिकांश लोग पहली जगह में अनुवादित-कॉल उत्पाद की तलाश में जाते हैं।
3. फ़ोन कॉल ऑडियो गुणवत्ता खराब क्यों होती है, और क्या यह सटीकता को कम करती है?
एक फ़ोन कॉल ITU-T G.711 के साथ एन्कोड किया जाता है, जो 8 kHz पर नमूना लेता है और लगभग 300 Hz से 3400 Hz तक वहन करता है। छोड़ी गई बैंड खाली नहीं है। यूनिवर्सिटी ऑफ ऑक्सफ़ोर्ड की ध्वन्यात्मक प्रयोगशाला से ध्वनिक ध्वन्यात्मकता का काम /s/ के ऊर्जा शिखर को लगभग 4500 Hz और 7500 Hz पर रखता है, जो पूरी तरह से टेलीफोन की सीमा से ऊपर है, यही कारण है कि बैंड-सीमित /s/ को व्यवस्थित रूप से /sh/ के रूप में गलत सुना जाता है। भौतिकी भविष्यवाणी करती है कि फ़ोन ऑडियो कठिन होना चाहिए। ITU-T G.711 · University of Oxford Phonetics Laboratory
यह परीक्षण करने के लिए कि क्या वह भविष्यवाणी आउटपुट तक बनी रहती है, हमने प्रत्येक क्लिप के दो संस्करण तैयार किए। एक मूल 16 kHz रिकॉर्डिंग है। दूसरा वही फ़ाइल है जिसे एंटी-एलियास फ़िल्टरिंग के साथ 8 kHz पर फिर से नमूना लिया गया है, G.711 म्यू-लॉ के साथ क्वांटाइज़ किया गया है, फिर मूल 16 kHz कंटेनर में वापस डिकोड किया गया है, ताकि दोनों फ़ाइलें प्रारूप में समान हों और कोई भी सिस्टम नमूना दर पर शाखा नहीं कर सके। 3.4 kHz से ऊपर की ऊर्जा सिग्नल के 14-22% से लगभग 3% तक गिर जाती है, जबकि RMS लाउडनेस अपरिवर्तित रहती है, इसलिए तुलना बैंडविड्थ को मापती है न कि वॉल्यूम को।
हर प्रणाली स्वयं के 0.04 अंकों के भीतर उतरी। LiveLingo ने माइक्रोफ़ोन ऑडियो पर 97.2% और फ़ोन लाइन पर 96.9% स्कोर किया; Google ने 93.4% और 94.0%; Azure ने 91.7% और 91.8%; Whisper बेसलाइन ने 88.1% और 88.9%। व्यक्तिगत कोशिकाओं के 88% को दोनों भागों में समान स्कोर प्राप्त हुआ। टेलीफोन बैंडविड्थ वास्तविक जानकारी को नष्ट कर देता है और आधुनिक अनुवाद इसे लगभग पूरी तरह से अवशोषित कर लेता है।
4. पहचान लगभग 2% तक बदल जाती है, और प्रणालियों के बीच मजबूती 5 गुना भिन्न होती है
गुणवत्ता का स्थिर रहना यह नहीं दर्शाता कि अंदर कुछ नहीं हुआ। प्रत्येक प्रणाली द्वारा वाइडबैंड फ़ाइल से उत्पादित स्रोत प्रतिलेख की तुलना फ़ोन-लाइन फ़ाइल से उत्पादित प्रतिलेख से करने पर, Google Cloud Speech-to-Text v2 ने पहचाने गए शब्दों के 0.4% को बदल दिया और Whisper-large बेसलाइन ने 2.0% को बदल दिया, जिसमें क्रमशः 96% और 81% प्रतिलेख पूरी तरह से अपरिवर्तित रहे।
कच्ची तुलना इसे बुरी तरह से बढ़ा-चढ़ाकर बताती है, और इसका कारण बताना महत्वपूर्ण है क्योंकि इस तरह की संख्या गलत कैसे होती है। Whisper ट्रेलिंग साइलेंस पर स्टॉक वाक्यांशों को भ्रमित करता है, किसी भी भाग में अप्रत्याशित रूप से निश्चित उपशीर्षक-शैली बॉयलरप्लेट उत्सर्जित करता है। चीनी आउटपुट यादृच्छिक रूप से सरलीकृत और पारंपरिक स्क्रिप्ट के बीच फ़्लिप करता है। अरबी मुख्य रूप से हमज़ा वर्तनी से भिन्न होती है। इन्हें हटाने से पहले, Whisper का स्पष्ट बहाव 5.7% मापा गया; बाद में, यह 2.0% है।
उपयोगी खोज यह है कि नैरोबैंड मजबूती पहचानकर्ताओं के बीच लगभग 5 गुना भिन्न होती है, जो फ़ोन लाइन की तुलना में कहीं अधिक बड़ा प्रभाव है। अरबी और इंडोनेशियाई लगभग 5% पर सबसे अधिक बहाव हुए, जो फ्रिकेटिव भविष्यवाणी के अनुरूप है, और वहां भी निष्ठा स्कोर नहीं बदला।
5. क्या AI अनुवाद फ़ोन कॉल पर व्यक्तिगत रूप से खराब हो जाता है?
क्योंकि इसके लिए आमतौर पर उद्धृत साक्ष्य कुछ और मापते हैं। Whisper पेपर (Radford et al., 2022) में, wav2vec 2.0 Large और Whisper Large V2 दोनों LibriSpeech स्वच्छ पठित भाषण पर समान 2.7% शब्द त्रुटि दर स्कोर करते हैं। CallHome टेलीफोन कॉर्पस पर वे 34.8% और 17.6% तक भिन्न होते हैं। यह अंतर वास्तविक, बड़ा है, और इसे नियमित रूप से इस बात के प्रमाण के रूप में पेश किया जाता है कि फ़ोन ऑडियो समस्या है। Radford et al., 2022 · LDC CallHome
लेकिन CallHome केवल नैरोबैंड नहीं है। यह सहज, अतिव्यापी, अनस्क्रिप्टेड बातचीत है जो एक-दूसरे को अच्छी तरह से जानने वाले लोगों के बीच होती है, जिसमें संकुचन, झूठी शुरुआत और क्रॉसस्टॉक की भरमार होती है। LibriSpeech एक व्यक्ति द्वारा जोर से किताब पढ़ना है। एक साथ दो चर बदलने से आपको यह नहीं पता चल सकता कि कौन सा महत्वपूर्ण था। बैंडविड्थ को अलग करने से लगभग कुछ भी नहीं मिलता है, जिसका अर्थ है कि CallHome दंड मुख्य रूप से दूसरा चर है।
यह अधिक उपयोगी निष्कर्ष है, क्योंकि ये वे कारक हैं जिन्हें आप वास्तव में नियंत्रित कर सकते हैं। साफ-सुथरी बारी लेना, कहीं शांत जगह पर जाना, और प्रत्येक वक्ता को समाप्त करने देना लाइन की गुणवत्ता के बारे में किसी भी चिंता से अधिक अनुवादित कॉल के लिए करेगा।
6. फ़ोन कॉल अनुवाद ऐप्स को वास्तव में क्या अलग करता है
चूंकि बैंडविड्थ का कोई मापने योग्य खर्च नहीं होता है और शीर्ष प्रणालियां आसान युग्मों पर एक-दूसरे के तीन अंकों के भीतर बैठती हैं, इसलिए महत्वपूर्ण अंतर कहीं और हैं: आपकी विशिष्ट भाषा युग्म पर गुणवत्ता कितनी गिरती है, क्या उत्पाद उस नंबर तक पहुंच सकता है जिसे आपको कॉल करने की आवश्यकता है, और कॉल बारी-बारी से कैसे संभालती है।
भाषा युग्म एक बड़े अंतर से सबसे बड़ा गुणवत्ता लीवर है, इसलिए एक हेडलाइन औसत के बजाय अपने स्वयं के कॉरिडोर की जांच करें। पहुंच पर, LiveLingo ऐप से किसी भी मोबाइल या लैंडलाइन नंबर पर अनुवादित कॉल करता है, इसलिए प्राप्तकर्ता एक सामान्य फ़ोन कॉल का जवाब देता है और कुछ भी स्थापित नहीं करता है। और आचरण पर, यह जानना महत्वपूर्ण है कि क्या कोई उत्पाद ईमानदारी से खुद को घोषित करता है या यह छिपाने के लिए आपकी आवाज़ को क्लोन करता है कि एक अनुवादक शामिल है। livelingo.io/phone-call-translation
7. यह परीक्षण क्या कवर करता है, और क्या नहीं
ऊपर दी गई संख्याएँ चार विशिष्ट डिज़ाइन विकल्पों से बंधी हैं। उन्हें बताना परिणामों पर कोई बचाव नहीं है; यह वह दायरा है जिसके भीतर परिणाम मान्य हैं।
| आयाम | क्या परीक्षण किया गया था |
|---|---|
| स्रोत भाषण | एक निश्चित स्टूडियो-ग्रेड कॉर्पस, जिसे इस तरह से चुना गया था कि दोनों भागों को शून्य स्पीकर भिन्नता के साथ ध्वनिक रूप से समान इनपुट प्राप्त हो। दोनों भाग ऊपर प्रकाशित हैं, इसलिए यहां हर संख्या को उसी ऑडियो से फिर से प्राप्त किया जा सकता है जिसका हमने उपयोग किया था। क्लिप सहज बातचीत की तुलना में अधिक स्पष्ट रूप से व्यक्त किए गए हैं, जो उन्हें अनुभाग 3 में बैंडविड्थ परिणाम के लिए सबसे अनुकूल मामला बनाता है; कॉर्पस निर्माण को विधि पृष्ठ पर पूरी तरह से प्रलेखित किया गया है। |
| निर्णय | तीन फ्रंटियर LLM न्यायाधीश, मानव रेटर नहीं। 66% वाइडबैंड कोशिकाओं ने एक पूर्ण 5.0 स्कोर किया, इसलिए रूब्रिक यह मापता है कि अर्थ बचा रहा या नहीं, न कि बारीक गुणवत्ता। |
| चैनल | G.711 बैंड-सीमित और म्यू-लॉ क्वांटाइज़ेशन केवल। पैकेट हानि, जिटर, स्वचालित लाभ नियंत्रण और शोर दमन को मॉडल नहीं किया गया है, और ये सभी वास्तविक कॉल पर होते हैं। |
| स्वतंत्रता | LiveLingo हमारा उत्पाद है और दोनों कॉर्पोरा पर पहले स्थान पर रहा। प्रति भाग एक माप, इसलिए रन-टू-रन न्यायाधीश भिन्नता का औसत नहीं निकाला जाता है। |
व्यावहारिक पठन: अनुभाग 1 में रैंकिंग एक साफ-सुथरी समान-के-लिए-समान तुलना है, क्योंकि प्रत्येक प्रणाली को समान ऑडियो और समान निर्णय प्राप्त हुए। अनुभाग 3 में बैंडविड्थ परिणाम कॉर्पस पसंद के प्रति सबसे संवेदनशील दावा है, और सहज संवादी भाषण पर प्रतिकृति अगला कदम है। पूर्ण व्युत्पत्ति, सांख्यिकीय शक्ति और हमने जो माप कलाकृतियां हटाईं, वे यहां प्रलेखित हैं पूरी विधि और कच्चा डेटा.
अक्सर पूछे जाने वाले प्रश्न
फ़ोन कॉल अनुवाद कितना सटीक है?
अगस्त 2026 में हमारे परीक्षण में, सर्वश्रेष्ठ प्रणाली ने स्पेनिश, जापानी, चीनी और जर्मन में अनुवादित 120 अंग्रेजी कथनों पर फ़ोन-लाइन ऑडियो पर 5 में से 4.85 (96.9%) स्कोर किया, जिसे तीन स्वतंत्र फ्रंटियर LLM न्यायाधीशों द्वारा समझ-निष्ठा रूब्रिक पर स्कोर किया गया। Google Cloud Speech-to-Text v2 ने Translate v3 के साथ 4.70 (94.0%) स्कोर किया, Azure Speech Translation ने 4.59 (91.8%) स्कोर किया, और एक Whisper-large प्लस GPT-4o-mini बेसलाइन ने 4.44 (88.9%) स्कोर किया। अरबी, तुर्की और वियतनामी जैसे कठिन भाषा युग्मों में यूरोपीय और एशियाई लक्ष्यों में, समान प्रणालियां क्रमशः 87.0%, 77.7%, 70.0% और 66.7% तक गिर गईं।
क्या फ़ोन लाइन अनुवाद को व्यक्तिगत रूप से कम सटीक बनाती है?
लगभग बिल्कुल नहीं। हमने समान कथनों को दो बार स्कोर किया, एक बार वाइडबैंड माइक्रोफ़ोन ऑडियो के रूप में और एक बार समान रिकॉर्डिंग को एक सिम्युलेटेड G.711 फ़ोन लेग के माध्यम से पारित करने के बाद, और परीक्षण की गई प्रत्येक प्रणाली के लिए 0-5 पैमाने पर समझ की सटीकता 0.04 अंकों से कम चली गई। LiveLingo ने माइक्रोफ़ोन ऑडियो पर 97.2% और फ़ोन लाइन पर 96.9% स्कोर किया। टेलीफोन बैंडविड्थ जानकारी का एक वास्तविक नुकसान है, लेकिन आधुनिक अनुवाद इसे लगभग पूरी तरह से अवशोषित कर लेता है।
फ़ोन कॉल ऑडियो गुणवत्ता खराब क्यों होती है?
एक मानक फ़ोन कॉल ITU-T G.711 कोडेक का उपयोग करता है, जो केवल 300 Hz से 3400 Hz तक वहन करता है और 8 kHz पर नमूना लेता है। मानव भाषण उससे कहीं अधिक उपयोगी जानकारी वहन करता है: /s/ ध्वनि में लगभग 4500 Hz और 7500 Hz के आसपास ऊर्जा शिखर होते हैं, जो पूरी तरह से टेलीफोन की सीमा से ऊपर होते हैं। यही कारण है कि फ़ोन ऑडियो अस्पष्ट लगता है और यही कारण है कि बैंड-सीमित /s/ को अक्सर /sh/ के रूप में गलत सुना जाता है। यह एक वास्तविक नुकसान है, यह आधुनिक भाषण प्रणालियों के लिए पहले की तुलना में बहुत छोटी समस्या है।
क्या Apple Live Translation फ़ोन कॉल पर काम करता है?
हाँ, हाल के iPhones पर, और Samsung Galaxy AI एक तुलनीय इन-कॉल सुविधा प्रदान करता है। दोनों उस निर्माता के हाल के हैंडसेट तक और उन भाषाओं तक सीमित हैं जिन्हें वे निर्माता समर्थन करते हैं, और दोनों को आपकी अपनी डिवाइस पर सुविधा की आवश्यकता होती है न कि लाइन पर, इसलिए जब आपको किसी कार्यालय स्विचबोर्ड, लैंडलाइन, या किसी पुराने फ़ोन पर किसी को कॉल करने की आवश्यकता होती है तो कोई भी मदद नहीं करता है। LiveLingo ऐप से किसी भी मोबाइल या लैंडलाइन नंबर पर अनुवादित कॉल करता है और प्राप्तकर्ता कुछ भी स्थापित नहीं करता है।
कौन सी अनुवाद प्रणाली फ़ोन ऑडियो को सबसे अच्छी तरह संभालती है?
दो चीजें उन्हें अलग करती हैं। फ़ोन लाइन पर अनुवाद गुणवत्ता पर, LiveLingo ने 96.9%, Google ने 94.0%, Azure ने 91.8% और एक Whisper-large बेसलाइन ने 120 कथनों में 88.9% स्कोर किया। कच्ची पहचान मजबूती पर फैलाव व्यापक है: जब वही क्लिप एक फ़ोन लेग से गुज़री, तो Google Cloud Speech-to-Text v2 ने पहचाने गए शब्दों के केवल 0.4% को बदला जबकि Whisper बेसलाइन ने 2.0% को बदला, जो 5 गुना अंतर है। प्रकाशित शोध बड़े पैमाने पर समान पैटर्न दिखाता है: CallHome टेलीफोन कॉर्पस पर, wav2vec 2.0 Large 34.8% शब्द त्रुटि दर स्कोर करता है जबकि Whisper Large V2 17.6% स्कोर करता है, भले ही दोनों स्वच्छ पठित भाषण पर समान 2.7% स्कोर करते हैं।
क्या खराब फ़ोन कनेक्शन अनुवाद को खराब करता है?
केवल बैंडविड्थ नहीं करता है, लेकिन पैकेट हानि, जिटर और पृष्ठभूमि शोर अलग-अलग समस्याएं हैं और वे करते हैं। हमारे परीक्षण ने आवृत्ति सीमा को अलग किया, लाउडनेस को स्थिर रखा, इसलिए यह फ़ोन बैंड को मापता है और कुछ भी नहीं। ड्रॉपआउट या भारी सड़क शोर वाली कॉल अनुवाद को उसी कारण से खराब करती है जिस कारण से यह एक मानव श्रोता को खराब करती है, और कोई भी कोडेक गुणवत्ता उस भाषण की भरपाई नहीं करती है जिसे माइक्रोफ़ोन ने कभी साफ-सुथरा कैप्चर नहीं किया।
पूरी विधि, प्रति-भाषा परिणाम, सांख्यिकीय शक्ति, सीमाएं और हमने जो माप कलाकृतियां हटाईं, वे यहां प्रलेखित हैं livelingo.io/research/phone-line-bandwidth-method.