LiveLingoLiveLingoTry free

Jak dokładne jest tłumaczenie rozmów telefonicznych? Test 4 systemów (2026)

Opublikowano 2026-08-18 · Autor: Ron Villomo, założyciel LiveLingo · LiveLingo jest jednym z mierzonych systemów; pełna metoda i surowe dane

Szybka odpowiedź: Jak dokładne jest tłumaczenie rozmów telefonicznych?

W naszym teście z sierpnia 2026 roku LiveLingo uzyskało najwyższy wynik 96.9% na dźwięku z linii telefonicznej. Wśród 120 angielskich wypowiedzi przetłumaczonych na hiszpański, japoński, chiński i niemiecki, LiveLingo osiągnęło 4.85 na 5 (96.9%), Google Cloud Speech-to-Text v2 z Translate v3 osiągnęło 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%), a bazowy Whisper-large plus GPT-4o-mini 4.44 (88.9%). W przypadku trudniejszych par językowych wyniki te spadają do 87.0%, 77.7%, 70.0% i 66.7%. Sama linia telefoniczna kosztuje prawie nic: te same systemy na szerokopasmowym dźwięku mikrofonowym uzyskały wyniki w granicach 0.04 punktu od ich wyników telefonicznych. Punktacja została dokonana przez trzech niezależnych sędziów LLM na stałym korpusie studyjnym przeniesionym przez kanał telefoniczny G.711, do pobrania poniżej.

1. Jak dokładne jest tłumaczenie rozmów telefonicznych? Zmierzona odpowiedź

Oceniliśmy cztery systemy na identycznym dźwięku przepuszczonym przez symulowany odcinek telefoniczny. Każde tłumaczenie zostało ocenione w skali 0-5 pod kątem wierności zrozumienia przez trzech niezależnych sędziów LLM, a poniższy wynik jest średnią z trzech, pokazaną również jako procent maksimum. Kryteria oceny penalizują podstawienie błędnego słowa, pominięte encje lub liczby oraz mieszanie skryptów językowych; nie penalizują stylu ani prawidłowych synonimów.

SystemWynik na linii telefonicznejDokładnośćTrudniejsze pary
LiveLingo4.85 / 596.9%87.0%
Google Cloud STT v2 + Translate v34.70 / 594.0%77.7%
Azure Speech Translation4.59 / 591.8%70.0%
Whisper-large + GPT-4o-mini4.44 / 588.9%66.7%

n=120 wypowiedzi, angielski na hiszpański, japoński, chiński i niemiecki. „Trudniejsze pary” to oddzielny zestaw 160 wypowiedzi obejmujący źródła arabskie, tureckie, wietnamskie, polskie, portugalskie, indonezyjskie, malajskie i mandaryńskie na cele europejskie i azjatyckie. Zmierzone w sierpniu 2026 roku na stałym korpusie studyjnym przeniesionym przez kanał telefoniczny G.711, do pobrania powyżej; zobacz pełna metoda i surowe dane.

Pobierz dźwięk testowy i wyniki

Obie części 30-wypowiedziowego zestawu angielskiego, plus każdy wynik w formie czytelnej maszynowo. Dwa archiwa zawierają te same wypowiedzi; jedyną różnicą jest kanał telefoniczny. Wydane na licencji CC BY 4.0, więc każdy może ponownie uruchomić te systemy i sprawdzić liczby.

audio-wideband.zip (3.1 MB, 16 kHz) · audio-phoneline.zip (2.6 MB, G.711) · results.json

Rozrzut między parami językowymi ma większe znaczenie niż rozrzut między najlepszymi systemami. Nawet najsilniejszy system traci trzy punkty, przechodząc z niemieckiego na japoński, a każdy system traci znacznie więcej na trudniejszych parach korytarzowych niż na linii telefonicznej.

Para językowa (najlepszy system, linia telefoniczna)WynikDokładność
Angielski → Niemiecki4.92 / 598.4%
Angielski → Hiszpański4.86 / 597.1%
Angielski → Chiński4.84 / 596.9%
Angielski → Japoński4.77 / 595.3%
LiveLingo

Tap and speak in English

Tap to start

2. Czy Apple Live Translation działa podczas rozmów telefonicznych?

Apple Live Translation obsługuje rozmowy telefoniczne na nowszych iPhone'ach, a Samsung Galaxy AI oferuje porównywalną funkcję podczas rozmów. Obie są dobre w tym, co robią, a w przypadku połączenia iPhone-to-iPhone w obsługiwanym języku są najwygodniejszą dostępną opcją, ponieważ nie ma nic do zainstalowania.

Ich ograniczeniem jest zasięg, a nie jakość. Obie wymagają nowszego telefonu od konkretnego producenta, obie są ograniczone do zestawów językowych dostarczanych przez tych producentów, i co najważniejsze, obie umieszczają tę funkcję na twoim urządzeniu, a nie na linii. To jest w porządku, jeśli dzwonisz do znajomego z tym samym telefonem. Nie pomaga to, gdy musisz skontaktować się z centralą kliniki, właścicielem, recepcją hotelu lub dostawcą, którego telefon biurowy ma dziesięć lat. Te połączenia są powodem, dla którego większość ludzi szuka produktu do tłumaczenia rozmów.

3. Dlaczego jakość dźwięku rozmów telefonicznych jest zła i czy zmniejsza dokładność?

Rozmowa telefoniczna jest kodowana za pomocą ITU-T G.711, który próbkuje z częstotliwością 8 kHz i przenosi mniej więcej od 300 Hz do 3400 Hz. Odrzucone pasmo nie jest puste. Prace z fonetyki akustycznej z laboratorium fonetyki University of Oxford umieszczają szczyty energii /s/ na około 4500 Hz i 7500 Hz, całkowicie powyżej limitu telefonicznego, dlatego też /s/ o ograniczonej szerokości pasma jest systematycznie błędnie słyszane jako /sh/. Fizyka przewiduje, że dźwięk telefoniczny powinien być trudniejszy. ITU-T G.711 · University of Oxford Phonetics Laboratory

Aby sprawdzić, czy ta prognoza utrzymuje się do wyjścia, stworzyliśmy dwie wersje każdego klipu. Jedna to oryginalne nagranie 16 kHz. Druga to ten sam plik ponownie próbkowany do 8 kHz z filtrowaniem antyaliasingowym, kwantyzowany za pomocą G.711 mu-law, a następnie dekodowany z powrotem do oryginalnego kontenera 16 kHz, więc oba pliki są identyczne pod względem formatu i żaden system nie może rozgałęziać się na podstawie częstotliwości próbkowania. Energia powyżej 3.4 kHz spada z 14-22% sygnału do około 3%, podczas gdy głośność RMS pozostaje niezmieniona, więc porównanie mierzy szerokość pasma, a nie głośność.

Każdy system uzyskał wynik w granicach 0.04 punktu od siebie. LiveLingo uzyskało 97.2% na dźwięku mikrofonowym i 96.9% na linii telefonicznej; Google 93.4% i 94.0%; Azure 91.7% i 91.8%; bazowy Whisper 88.1% i 88.9%. 88% pojedynczych komórek otrzymało identyczny wynik w obu częściach. Przepustowość telefoniczna niszczy prawdziwe informacje, a nowoczesne tłumaczenie pochłania prawie wszystkie z nich.

4. Rozpoznawanie dryfuje o około 2%, a odporność różni się 5x między systemami

Utrzymująca się stała jakość nie oznacza, że nic się nie wydarzyło pod spodem. Porównując transkrypcję źródłową, którą każdy system wygenerował z pliku szerokopasmowego, z tą, którą wygenerował z pliku linii telefonicznej, Google Cloud Speech-to-Text v2 zmienił 0.4% rozpoznanych słów, a bazowy Whisper-large zmienił 2.0%, przy czym odpowiednio 96% i 81% transkrypcji wróciło całkowicie niezmienionych.

Surowe porównanie bardzo to wyolbrzymia, a powód jest wart uwagi, ponieważ tak właśnie tego rodzaju liczby są błędne. Whisper halucynuje standardowe frazy na końcową ciszę, emitując stałe, szablonowe napisy w sposób nieprzewidywalny w obu ramionach. Chińskie wyjście przełącza się losowo między skryptem uproszczonym a tradycyjnym. Arabski różni się głównie pisownią hamzy. Przed ich usunięciem, pozorny dryf Whisper wynosił 5.7%; po usunięciu, wynosi 2.0%.

Użytecznym odkryciem jest to, że odporność na wąskopasmowość różni się około 5x między rozpoznawaczami, co jest znacznie większym efektem niż sama linia telefoniczna. Arabski i indonezyjski dryfowały najbardziej, około 5%, co jest zgodne z przewidywaniami dotyczącymi spółgłosek szczelinowych, i nawet tam wynik wierności nie zmienił się.

5. Czy tłumaczenie AI pogarsza się podczas rozmów telefonicznych niż osobiście?

Ponieważ dowody zazwyczaj cytowane na to mierzą coś innego. W artykule Whisper (Radford et al., 2022), wav2vec 2.0 Large i Whisper Large V2 uzyskują identyczny wskaźnik błędu słów wynoszący 2.7% na czystej mowie czytanej LibriSpeech. Na korpusie telefonicznym CallHome rozbiegają się do 34.8% i 17.6%. Ta luka jest rzeczywista, duża i rutynowo przedstawiana jako dowód, że problemem jest dźwięk telefoniczny. Radford et al., 2022 · LDC CallHome

Ale CallHome to nie tylko wąskopasmowość. To spontaniczna, nakładająca się, nieskryptowana rozmowa między ludźmi, którzy dobrze się znają, pełna skrótów, fałszywych startów i nakładających się rozmów. LibriSpeech to jedna osoba czytająca książkę na głos. Zmiana dwóch zmiennych jednocześnie nie może powiedzieć, która z nich miała znaczenie. Izolowanie szerokości pasma nie znajduje prawie nic, co oznacza, że kara CallHome to głównie inna zmienna.

To jest bardziej użyteczny wniosek, ponieważ to są czynniki, które faktycznie możesz kontrolować. Czyste przejmowanie kolejki, przeniesienie się w cichsze miejsce i pozwolenie każdemu mówcy na zakończenie zrobi więcej dla przetłumaczonej rozmowy niż jakiekolwiek obawy dotyczące jakości linii.

6. Co faktycznie wyróżnia aplikacje do tłumaczenia rozmów telefonicznych

Ponieważ przepustowość nie kosztuje nic mierzalnego, a najlepsze systemy różnią się od siebie o trzy punkty w przypadku łatwych par, różnice, które mają znaczenie, leżą gdzie indziej: o ile spada jakość w przypadku konkretnej pary językowej, czy produkt może dotrzeć do numeru, na który musisz zadzwonić, i jak rozmowa obsługuje przejmowanie kolejki.

Para językowa jest zdecydowanie największą dźwignią jakości, więc sprawdź swój własny korytarz, a nie średnią nagłówkową. Jeśli chodzi o zasięg, LiveLingo nawiązuje przetłumaczone połączenie z aplikacji na dowolny numer komórkowy lub stacjonarny, więc odbiorca odbiera zwykłe połączenie telefoniczne i niczego nie instaluje. A jeśli chodzi o prowadzenie, warto wiedzieć, czy produkt uczciwie się przedstawia, czy klonuje twój głos, aby ukryć, że w rozmowie uczestniczy tłumacz. livelingo.io/phone-call-translation

7. Co obejmuje ten test, a czego nie

Powyższe liczby są ograniczone czterema konkretnymi wyborami projektowymi. Ich przedstawienie nie jest zabezpieczeniem wyników; to zakres, w którym wyniki są ważne.

WymiarCo zostało przetestowane
Mowa źródłowaStały korpus studyjny, wybrany tak, aby obie części otrzymywały akustycznie identyczne dane wejściowe z zerową zmiennością mówcy. Obie części są opublikowane powyżej, więc każda liczba tutaj może być ponownie wyprowadzona z tego samego dźwięku, którego użyliśmy. Klipy są wyraźniej artykułowane niż spontaniczna rozmowa, co czyni je najbardziej korzystnym przypadkiem dla wyniku szerokości pasma w sekcji 3; konstrukcja korpusu jest w pełni udokumentowana na stronie metody.
OcenaTrzech sędziów LLM, a nie ludzkich oceniających. 66% komórek szerokopasmowych uzyskało doskonały wynik 5.0, więc kryteria oceny mierzą, czy znaczenie przetrwało, a nie szczegółową jakość.
KanałTylko ograniczenie pasma G.711 i kwantyzacja mu-law. Utrata pakietów, jitter, automatyczna kontrola wzmocnienia i tłumienie szumów nie są modelowane, a wszystkie występują w rzeczywistych połączeniach.
NiezależnośćLiveLingo to nasz produkt i zajął pierwsze miejsce w obu korpusach. Jeden pomiar na ramię, więc wariancja sędziów między przebiegami nie jest uśredniana.

Praktyczne odczytanie: ranking w sekcji 1 to czyste porównanie typu „jeden do jednego”, ponieważ każdy system otrzymał identyczny dźwięk i identyczną ocenę. Wynik szerokości pasma w sekcji 3 jest twierdzeniem najbardziej wrażliwym na wybór korpusu, a replikacja na spontanicznej mowie konwersacyjnej jest następnym krokiem. Pełne wyprowadzenia, moc statystyczna i artefakty pomiarowe, które usunęliśmy, znajdują się na pełna metoda i surowe dane.

Często zadawane pytania

Jak dokładne jest tłumaczenie rozmów telefonicznych?

W naszym teście z sierpnia 2026 roku najlepszy system uzyskał 4.85 na 5 (96.9%) na dźwięku z linii telefonicznej w 120 angielskich wypowiedziach przetłumaczonych na hiszpański, japoński, chiński i niemiecki, ocenionych przez trzech niezależnych sędziów LLM na podstawie kryteriów wierności zrozumienia. Google Cloud Speech-to-Text v2 z Translate v3 uzyskało 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%), a bazowy Whisper-large plus GPT-4o-mini 4.44 (88.9%). W przypadku trudniejszych par językowych, takich jak arabski, turecki i wietnamski na cele europejskie i azjatyckie, te same systemy spadły odpowiednio do 87.0%, 77.7%, 70.0% i 66.7%.

Czy linia telefoniczna sprawia, że tłumaczenie jest mniej dokładne niż osobiście?

Prawie wcale. Oceniliśmy te same wypowiedzi dwukrotnie, raz jako szerokopasmowy dźwięk mikrofonowy, a raz po przepuszczeniu identycznego nagrania przez symulowany odcinek telefoniczny G.711, a wierność zrozumienia zmieniła się o mniej niż 0.04 punktu w skali 0-5 dla każdego testowanego systemu. LiveLingo uzyskało 97.2% na dźwięku mikrofonowym i 96.9% na linii telefonicznej. Przepustowość telefoniczna to rzeczywista utrata informacji, ale nowoczesne tłumaczenie pochłania prawie wszystkie z nich.

Dlaczego jakość dźwięku rozmów telefonicznych jest zła?

Standardowa rozmowa telefoniczna wykorzystuje kodek ITU-T G.711, który przenosi tylko od 300 Hz do 3400 Hz i próbkuje z częstotliwością 8 kHz. Mowa ludzka przenosi użyteczne informacje znacznie powyżej tego: dźwięk /s/ ma szczyty energii około 4500 Hz i 7500 Hz, całkowicie powyżej limitu telefonicznego. Dlatego dźwięk telefoniczny brzmi stłumiony i dlatego /s/ o ograniczonej szerokości pasma jest często błędnie słyszane jako /sh/. To jest prawdziwa strata, po prostu jest to znacznie mniejszy problem dla nowoczesnych systemów mowy niż kiedyś.

Czy Apple Live Translation działa podczas rozmów telefonicznych?

Tak, na nowszych iPhone'ach, a Samsung Galaxy AI oferuje porównywalną funkcję podczas rozmów. Obie są ograniczone do nowszych telefonów od tego producenta i do języków obsługiwanych przez tych producentów, a obie wymagają funkcji na twoim własnym urządzeniu, a nie na linii, więc żadna z nich nie pomaga, gdy musisz zadzwonić do centrali biurowej, na telefon stacjonarny lub do kogoś na starszym telefonie. LiveLingo nawiązuje przetłumaczone połączenie z aplikacji na dowolny numer komórkowy lub stacjonarny, a odbiorca niczego nie instaluje.

Który system tłumaczeniowy najlepiej radzi sobie z dźwiękiem telefonicznym?

Dwie rzeczy je rozróżniają. Jeśli chodzi o jakość tłumaczenia przez linię telefoniczną, LiveLingo uzyskało 96.9%, Google 94.0%, Azure 91.8%, a bazowy Whisper-large 88.9% w 120 wypowiedziach. Jeśli chodzi o surową odporność rozpoznawania, rozrzut jest większy: gdy ten sam klip przeszedł przez odcinek telefoniczny, Google Cloud Speech-to-Text v2 zmienił tylko 0.4% rozpoznanych słów, podczas gdy bazowy Whisper zmienił 2.0%, co stanowi 5x różnicę. Opublikowane badania pokazują ten sam wzorzec na dużą skalę: na korpusie telefonicznym CallHome, wav2vec 2.0 Large uzyskuje 34.8% wskaźnika błędu słów w porównaniu do Whisper Large V2 na poziomie 17.6%, mimo że oba uzyskują identyczny wynik 2.7% na czystej mowie czytanej.

Czy złe połączenie telefoniczne pogarsza tłumaczenie?

Sama przepustowość nie, ale utrata pakietów, jitter i szum tła to oddzielne problemy i one tak. Nasz test izolował zakres częstotliwości, utrzymując stałą głośność, więc mierzy pasmo telefoniczne i nic więcej. Rozmowa z przerwami lub dużym hałasem ulicznym pogarsza tłumaczenie z tych samych powodów, z których pogarsza słuchanie przez człowieka, a żadna jakość kodeka nie rekompensuje mowy, której mikrofon nigdy nie uchwycił czysto.

Pełna metoda, wyniki dla poszczególnych języków, moc statystyczna, ograniczenia i usunięte artefakty pomiarowe są udokumentowane na livelingo.io/research/phone-line-bandwidth-method.

Jak dokładne jest tłumaczenie rozmów telefonicznych? Test 4 systemów (2026) | LiveLingo