การแปลสายโทรศัพท์แม่นยำแค่ไหน? ทดสอบ 4 ระบบ (2026)
เผยแพร่แล้ว 2026-08-18 · โดย Ron Villomo ผู้ก่อตั้ง LiveLingo · LiveLingo เป็นหนึ่งในระบบที่วัดผล; วิธีการฉบับเต็มและข้อมูลดิบ
คำตอบด่วน: การแปลสายโทรศัพท์แม่นยำแค่ไหน?
ในการทดสอบเดือนสิงหาคม 2026 ของเรา LiveLingo ได้คะแนนสูงสุดที่ 96.9% สำหรับเสียงโทรศัพท์ จากประโยคภาษาอังกฤษ 120 ประโยคที่แปลเป็นภาษาสเปน ญี่ปุ่น จีน และเยอรมัน LiveLingo ได้ 4.85 จาก 5 (96.9%), Google Cloud Speech-to-Text v2 พร้อม Translate v3 ได้ 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%) และ Whisper-large บวกกับ GPT-4o-mini baseline 4.44 (88.9%) สำหรับคู่ภาษาที่ยากขึ้น คะแนนเหล่านี้ลดลงเหลือ 87.0%, 77.7%, 70.0% และ 66.7% สายโทรศัพท์เองแทบไม่มีค่าใช้จ่าย: ระบบเดียวกันนี้เมื่อใช้เสียงไมโครโฟนแบบไวด์แบนด์ได้คะแนนห่างจากคะแนนโทรศัพท์ไม่เกิน 0.04 คะแนน การให้คะแนนโดยกรรมการ LLM ชั้นนำอิสระสามท่านจากคลังข้อมูลคุณภาพสตูดิโอที่คงที่ซึ่งส่งผ่านช่องสัญญาณโทรศัพท์ G.711 สามารถดาวน์โหลดได้ด้านล่าง
1. การแปลสายโทรศัพท์แม่นยำแค่ไหน? คำตอบที่วัดได้
เราให้คะแนนสี่ระบบจากเสียงที่เหมือนกันซึ่งส่งผ่านช่องสัญญาณโทรศัพท์จำลอง การแปลแต่ละครั้งได้รับการให้คะแนน 0-5 สำหรับความแม่นยำในการทำความเข้าใจโดยกรรมการ LLM ชั้นนำอิสระสามท่าน และคะแนนด้านล่างคือค่าเฉลี่ยของทั้งสาม ซึ่งแสดงเป็นเปอร์เซ็นต์ของคะแนนสูงสุดด้วย เกณฑ์การให้คะแนนจะลงโทษการแทนที่คำผิด การละเว้นเอนทิตีหรือตัวเลข และการผสมสคริปต์ภาษา แต่ไม่ลงโทษสไตล์หรือคำพ้องความหมายที่ถูกต้อง
| ระบบ | คะแนนสายโทรศัพท์ | ความแม่นยำ | คู่ภาษาที่ยากขึ้น |
|---|---|---|---|
| LiveLingo | 4.85 / 5 | 96.9% | 87.0% |
| Google Cloud STT v2 + Translate v3 | 4.70 / 5 | 94.0% | 77.7% |
| Azure Speech Translation | 4.59 / 5 | 91.8% | 70.0% |
| Whisper-large + GPT-4o-mini | 4.44 / 5 | 88.9% | 66.7% |
n=120 ประโยค, ภาษาอังกฤษเป็นภาษาสเปน, ญี่ปุ่น, จีน และเยอรมัน “คู่ภาษาที่ยากขึ้น” คือชุดประโยคแยกต่างหาก 160 ประโยค ครอบคลุมภาษาอาหรับ, ตุรกี, เวียดนาม, โปแลนด์, โปรตุเกส, อินโดนีเซีย, มาลายู และจีนกลางเป็นภาษาเป้าหมายในยุโรปและเอเชีย วัดผลในเดือนสิงหาคม 2026 จากคลังข้อมูลคุณภาพสตูดิโอที่คงที่ซึ่งส่งผ่านช่องสัญญาณโทรศัพท์ G.711 สามารถดาวน์โหลดได้ด้านบน; ดู วิธีการฉบับเต็มและข้อมูลดิบ.
ดาวน์โหลดไฟล์เสียงและผลการทดสอบ
ทั้งสองส่วนของชุดภาษาอังกฤษ 30 ประโยค พร้อมคะแนนทั้งหมดในรูปแบบที่เครื่องอ่านได้ ไฟล์เก็บถาวรทั้งสองมีประโยคเดียวกัน ความแตกต่างเพียงอย่างเดียวคือช่องสัญญาณโทรศัพท์ เผยแพร่ภายใต้ CC BY 4.0 ดังนั้นทุกคนสามารถเรียกใช้ระบบเหล่านี้ซ้ำและตรวจสอบตัวเลขได้
audio-wideband.zip (3.1 MB, 16 kHz) · audio-phoneline.zip (2.6 MB, G.711) · results.json
ความแตกต่างระหว่างคู่ภาษามีความสำคัญมากกว่าความแตกต่างระหว่างระบบชั้นนำ แม้แต่ระบบที่แข็งแกร่งที่สุดก็ยังเสียสามคะแนนเมื่อเปลี่ยนจากภาษาเยอรมันเป็นภาษาญี่ปุ่น และทุกระบบก็เสียคะแนนมากกว่ามากในคู่ภาษาที่ยากกว่าเมื่อเทียบกับการเสียคะแนนจากสายโทรศัพท์
| คู่ภาษา (ระบบที่ดีที่สุด, สายโทรศัพท์) | คะแนน | ความแม่นยำ |
|---|---|---|
| English → German | 4.92 / 5 | 98.4% |
| English → Spanish | 4.86 / 5 | 97.1% |
| English → Chinese | 4.84 / 5 | 96.9% |
| English → Japanese | 4.77 / 5 | 95.3% |
Tap and speak in English
Tap to start
2. Apple Live Translation ใช้ได้กับการโทรศัพท์หรือไม่?
Apple Live Translation รองรับการโทรศัพท์บน iPhone รุ่นใหม่ และ Samsung Galaxy AI ก็มีฟีเจอร์การโทรที่เทียบเคียงได้ ทั้งสองทำได้ดีในสิ่งที่ทำ และสำหรับการโทรแบบ iPhone-to-iPhone ในภาษาที่รองรับ พวกเขาเป็นตัวเลือกที่สะดวกที่สุดที่มีอยู่เพราะไม่ต้องติดตั้งอะไรเลย
ข้อจำกัดของพวกเขาคือความครอบคลุม ไม่ใช่คุณภาพ ทั้งสองต้องใช้โทรศัพท์มือถือรุ่นใหม่จากผู้ผลิตรายนั้นๆ ทั้งสองถูกจำกัดอยู่แค่ชุดภาษาที่ผู้ผลิตเหล่านั้นจัดส่ง และที่สำคัญทั้งสองใส่ความสามารถไว้ในอุปกรณ์ของคุณแทนที่จะอยู่บนสาย นั่นเป็นสิ่งที่ดีสำหรับการโทรหาเพื่อนที่มีโทรศัพท์รุ่นเดียวกัน แต่ไม่ช่วยเมื่อคุณต้องการติดต่อตู้สาขาคลินิก เจ้าของบ้าน แผนกต้อนรับโรงแรม หรือซัพพลายเออร์ที่โทรศัพท์สำนักงานมีอายุเป็นสิบปี การโทรเหล่านั้นคือเหตุผลที่คนส่วนใหญ่เริ่มมองหาผลิตภัณฑ์การโทรที่แปลได้ตั้งแต่แรก
3. ทำไมคุณภาพเสียงโทรศัพท์ถึงไม่ดี และลดความแม่นยำหรือไม่?
การโทรศัพท์ถูกเข้ารหัสด้วย ITU-T G.711 ซึ่งสุ่มตัวอย่างที่ 8 kHz และรองรับความถี่ประมาณ 300 Hz ถึง 3400 Hz แบนด์ที่ถูกทิ้งไปนั้นไม่ได้ว่างเปล่า งานสัทศาสตร์อะคูสติกจากห้องปฏิบัติการสัทศาสตร์ของ University of Oxford ระบุว่าจุดสูงสุดของพลังงานของ /s/ อยู่ที่ประมาณ 4500 Hz และ 7500 Hz ซึ่งสูงกว่าขีดจำกัดของโทรศัพท์ทั้งหมด ซึ่งเป็นเหตุผลว่าทำไม /s/ ที่จำกัดแบนด์จึงมักถูกเข้าใจผิดว่าเป็น /sh/ ฟิสิกส์ทำนายว่าเสียงโทรศัพท์ควรจะยากขึ้น ITU-T G.711 · University of Oxford Phonetics Laboratory
เพื่อทดสอบว่าการทำนายนั้นยังคงอยู่จนถึงผลลัพธ์หรือไม่ เราได้สร้างคลิปสองเวอร์ชันสำหรับทุกคลิป หนึ่งคือการบันทึกต้นฉบับ 16 kHz อีกอันคือไฟล์เดียวกันที่สุ่มตัวอย่างใหม่เป็น 8 kHz ด้วยการกรองแบบ anti-alias, quantised ด้วย G.711 mu-law จากนั้นถอดรหัสกลับเป็นคอนเทนเนอร์ 16 kHz ต้นฉบับ ดังนั้นไฟล์ทั้งสองจึงมีรูปแบบเหมือนกันและไม่มีระบบใดสามารถแยกตามอัตราการสุ่มตัวอย่างได้ พลังงานที่สูงกว่า 3.4 kHz ลดลงจาก 14-22% ของสัญญาณเหลือประมาณ 3% ในขณะที่ความดัง RMS ไม่เปลี่ยนแปลง ดังนั้นการเปรียบเทียบจึงวัดแบนด์วิดท์และไม่ใช่ระดับเสียง
ทุกระบบได้คะแนนห่างกันไม่เกิน 0.04 คะแนน LiveLingo ได้ 97.2% สำหรับเสียงไมโครโฟนและ 96.9% สำหรับสายโทรศัพท์; Google 93.4% และ 94.0%; Azure 91.7% และ 91.8%; Whisper baseline 88.1% และ 88.9% 88% ของเซลล์แต่ละเซลล์ได้รับคะแนนที่เหมือนกันในทั้งสองส่วน แบนด์วิดท์ของโทรศัพท์ทำลายข้อมูลจริง และการแปลสมัยใหม่ก็ดูดซับข้อมูลเกือบทั้งหมดนั้น
4. การรู้จำคลาดเคลื่อนประมาณ 2% และความทนทานแตกต่างกัน 5 เท่าระหว่างระบบ
คุณภาพที่คงที่ไม่ได้หมายความว่าไม่มีอะไรเกิดขึ้นภายใต้พื้นผิว เมื่อเปรียบเทียบข้อความถอดเสียงต้นฉบับที่แต่ละระบบสร้างจากไฟล์ไวด์แบนด์กับข้อความที่สร้างจากไฟล์สายโทรศัพท์ Google Cloud Speech-to-Text v2 เปลี่ยนแปลงคำที่รู้จัก 0.4% และ Whisper-large baseline เปลี่ยนแปลง 2.0% โดยมีข้อความถอดเสียง 96% และ 81% ตามลำดับที่กลับมาไม่เปลี่ยนแปลงเลย
การเปรียบเทียบแบบดิบๆ ทำให้เกิดการประเมินที่เกินจริงอย่างมาก และเหตุผลนั้นควรกล่าวถึงเพราะเป็นวิธีที่ตัวเลขประเภทนี้ผิดพลาด Whisper สร้างวลีสำเร็จรูปบนความเงียบที่ตามมา โดยปล่อยข้อความสำเร็จรูปสไตล์คำบรรยายที่ไม่สามารถคาดเดาได้ในทั้งสองส่วน ผลลัพธ์ภาษาจีนสลับไปมาระหว่างสคริปต์ตัวย่อและตัวเต็มแบบสุ่ม ภาษาอาหรับแตกต่างกันส่วนใหญ่โดยการสะกด hamza ก่อนที่จะลบสิ่งเหล่านี้ การคลาดเคลื่อนที่เห็นได้ชัดของ Whisper วัดได้ 5.7%; หลังจากนั้นคือ 2.0%
สิ่งที่ค้นพบที่เป็นประโยชน์คือความทนทานของแถบความถี่แคบแตกต่างกันประมาณ 5 เท่าระหว่างตัวรู้จำ ซึ่งเป็นผลกระทบที่ใหญ่กว่าสายโทรศัพท์เองมาก ภาษาอาหรับและอินโดนีเซียคลาดเคลื่อนมากที่สุดที่ประมาณ 5% ซึ่งสอดคล้องกับการทำนายของ fricative และแม้แต่ในกรณีนั้นคะแนนความแม่นยำก็ไม่เปลี่ยนแปลง
5. การแปลด้วย AI แย่ลงในการโทรศัพท์มากกว่าการสนทนาต่อหน้าหรือไม่?
เพราะหลักฐานที่มักอ้างถึงนั้นวัดสิ่งอื่น ในเอกสาร Whisper (Radford et al., 2022) ทั้ง wav2vec 2.0 Large และ Whisper Large V2 ได้คะแนนอัตราข้อผิดพลาดของคำที่เหมือนกัน 2.7% ในการอ่านออกเสียงที่ชัดเจนของ LibriSpeech ในคลังข้อมูลโทรศัพท์ CallHome พวกเขาแตกต่างกันไปที่ 34.8% และ 17.6% ช่องว่างนั้นเป็นของจริง มีขนาดใหญ่ และมักถูกนำเสนอเป็นหลักฐานว่าเสียงโทรศัพท์คือปัญหา Radford et al., 2022 · LDC CallHome
แต่ CallHome ไม่ใช่แค่แถบความถี่แคบเท่านั้น เป็นการสนทนาที่เกิดขึ้นเอง ซ้อนทับกัน ไม่ได้เตรียมสคริปต์ ระหว่างคนที่รู้จักกันดี เต็มไปด้วยคำย่อ การเริ่มต้นที่ผิดพลาด และการพูดแทรก LibriSpeech คือคนคนหนึ่งอ่านหนังสือออกเสียง การเปลี่ยนตัวแปรสองตัวพร้อมกันไม่สามารถบอกได้ว่าตัวแปรใดมีความสำคัญ การแยกแบนด์วิดท์พบว่าแทบไม่มีอะไรเลย ซึ่งหมายความว่าค่าปรับของ CallHome ส่วนใหญ่เป็นตัวแปรอื่น
นั่นคือข้อสรุปที่เป็นประโยชน์มากกว่า เพราะนั่นคือปัจจัยที่คุณสามารถควบคุมได้จริง การผลัดกันพูดอย่างชัดเจน การย้ายไปยังที่ที่เงียบกว่า และการปล่อยให้ผู้พูดแต่ละคนพูดจบจะช่วยให้การโทรที่แปลได้ดีขึ้นมากกว่าความกังวลใดๆ เกี่ยวกับคุณภาพสาย
6. อะไรคือสิ่งที่แยกแอปแปลสายโทรศัพท์ออกจากกันจริงๆ
เนื่องจากแบนด์วิดท์ไม่มีค่าใช้จ่ายที่วัดได้ และระบบชั้นนำอยู่ห่างกันไม่เกินสามคะแนนในคู่ภาษาที่ง่าย ความแตกต่างที่สำคัญจึงอยู่ที่อื่น: คุณภาพลดลงมากแค่ไหนในคู่ภาษาเฉพาะของคุณ ผลิตภัณฑ์สามารถเข้าถึงหมายเลขที่คุณต้องการโทรได้หรือไม่ และการโทรจัดการกับการผลัดกันพูดอย่างไร
คู่ภาษาเป็นตัวแปรคุณภาพที่ใหญ่ที่สุดอย่างมาก ดังนั้นควรตรวจสอบคู่ภาษาของคุณเองแทนที่จะเป็นค่าเฉลี่ยโดยรวม ในด้านการเข้าถึง LiveLingo จะโทรออกที่แปลแล้วจากแอปไปยังหมายเลขโทรศัพท์มือถือหรือโทรศัพท์บ้านใดก็ได้ ดังนั้นผู้รับจะรับสายโทรศัพท์ปกติและไม่ต้องติดตั้งอะไรเลย และในด้านพฤติกรรม ควรทราบว่าผลิตภัณฑ์ประกาศตัวเองอย่างซื่อสัตย์หรือเลียนแบบเสียงของคุณเพื่อซ่อนว่ามีนักแปลเข้ามาเกี่ยวข้อง livelingo.io/phone-call-translation
7. การทดสอบนี้ครอบคลุมอะไร และไม่ครอบคลุมอะไร
ตัวเลขข้างต้นถูกจำกัดด้วยการออกแบบเฉพาะสี่ประการ การระบุสิ่งเหล่านี้ไม่ใช่การหลีกเลี่ยงผลลัพธ์ แต่เป็นขอบเขตที่ผลลัพธ์ยังคงใช้ได้
| มิติ | สิ่งที่ทดสอบ |
|---|---|
| คำพูดต้นฉบับ | คลังข้อมูลคุณภาพสตูดิโอที่คงที่ เลือกเพื่อให้ทั้งสองส่วนได้รับอินพุตที่เหมือนกันทางอะคูสติกโดยไม่มีความแปรปรวนของผู้พูดเป็นศูนย์ ทั้งสองส่วนได้รับการเผยแพร่ด้านบน ดังนั้นทุกตัวเลขที่นี่สามารถหาได้ใหม่จากเสียงเดียวกันที่เราใช้ คลิปมีการออกเสียงที่ชัดเจนกว่าการสนทนาที่เกิดขึ้นเอง ซึ่งทำให้เป็นกรณีที่เอื้ออำนวยที่สุดสำหรับผลลัพธ์แบนด์วิดท์ในส่วนที่ 3; การสร้างคลังข้อมูลได้รับการบันทึกไว้อย่างครบถ้วนในหน้าวิธีการ |
| การตัดสิน | กรรมการ LLM ชั้นนำสามท่าน ไม่ใช่มนุษย์ผู้ให้คะแนน 66% ของเซลล์ไวด์แบนด์ได้คะแนนสมบูรณ์ 5.0 ดังนั้นเกณฑ์การให้คะแนนจึงวัดว่าความหมายยังคงอยู่หรือไม่มากกว่าคุณภาพที่ละเอียด |
| ช่องสัญญาณ | การจำกัดแบนด์ G.711 และการควอนไทซ์แบบ mu-law เท่านั้น การสูญหายของแพ็กเก็ต, jitter, การควบคุมอัตราขยายอัตโนมัติ และการลดเสียงรบกวนไม่ได้ถูกจำลอง และทั้งหมดเกิดขึ้นในการโทรจริง |
| ความเป็นอิสระ | LiveLingo เป็นผลิตภัณฑ์ของเราและได้อันดับหนึ่งในคลังข้อมูลทั้งสองชุด การวัดผลหนึ่งครั้งต่อส่วน ดังนั้นความแปรปรวนของกรรมการจากการรันซ้ำจึงไม่ได้ถูกเฉลี่ยออกไป |
การอ่านเชิงปฏิบัติ: การจัดอันดับในส่วนที่ 1 เป็นการเปรียบเทียบแบบเหมือนกัน เนื่องจากทุกระบบได้รับเสียงที่เหมือนกันและการตัดสินที่เหมือนกัน ผลลัพธ์แบนด์วิดท์ในส่วนที่ 3 คือข้ออ้างที่อ่อนไหวที่สุดต่อการเลือกคลังข้อมูล และการทำซ้ำในการสนทนาที่เกิดขึ้นเองคือขั้นตอนต่อไป การหาอนุพันธ์ทั้งหมด พลังงานทางสถิติ และสิ่งประดิษฐ์การวัดที่เราลบออกมีอยู่ใน วิธีการฉบับเต็มและข้อมูลดิบ.
คำถามที่พบบ่อย
การแปลสายโทรศัพท์แม่นยำแค่ไหน?
ในการทดสอบเดือนสิงหาคม 2026 ของเรา ระบบที่ดีที่สุดได้คะแนน 4.85 จาก 5 (96.9%) สำหรับเสียงโทรศัพท์จากประโยคภาษาอังกฤษ 120 ประโยคที่แปลเป็นภาษาสเปน ญี่ปุ่น จีน และเยอรมัน โดยกรรมการ LLM ชั้นนำอิสระสามท่านให้คะแนนตามเกณฑ์ความแม่นยำในการทำความเข้าใจ Google Cloud Speech-to-Text v2 พร้อม Translate v3 ได้ 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%) และ Whisper-large บวกกับ GPT-4o-mini baseline 4.44 (88.9%) สำหรับคู่ภาษาที่ยากขึ้น เช่น อาหรับ, ตุรกี และเวียดนามเป็นภาษาเป้าหมายในยุโรปและเอเชีย ระบบเดียวกันนี้ลดลงเหลือ 87.0%, 77.7%, 70.0% และ 66.7% ตามลำดับ
สายโทรศัพท์ทำให้การแปลแม่นยำน้อยกว่าการสนทนาต่อหน้าหรือไม่?
แทบจะไม่มีผลเลย เราให้คะแนนประโยคเดียวกันสองครั้ง ครั้งหนึ่งเป็นเสียงไมโครโฟนแบบไวด์แบนด์ และอีกครั้งหลังจากส่งการบันทึกที่เหมือนกันผ่านช่องสัญญาณโทรศัพท์ G.711 จำลอง และความแม่นยำในการทำความเข้าใจเปลี่ยนไปน้อยกว่า 0.04 คะแนนในมาตราส่วน 0-5 สำหรับทุกระบบที่ทดสอบ LiveLingo ได้ 97.2% สำหรับเสียงไมโครโฟนและ 96.9% สำหรับสายโทรศัพท์ แบนด์วิดท์ของโทรศัพท์เป็นการสูญเสียข้อมูลจริง แต่การแปลสมัยใหม่ก็ดูดซับข้อมูลเกือบทั้งหมดนั้น
ทำไมคุณภาพเสียงโทรศัพท์ถึงไม่ดี?
การโทรศัพท์มาตรฐานใช้ตัวแปลงสัญญาณ ITU-T G.711 ซึ่งรองรับความถี่เพียง 300 Hz ถึง 3400 Hz และสุ่มตัวอย่างที่ 8 kHz เสียงพูดของมนุษย์มีข้อมูลที่เป็นประโยชน์สูงกว่านั้นมาก: เสียง /s/ มีจุดสูงสุดของพลังงานประมาณ 4500 Hz และ 7500 Hz ซึ่งสูงกว่าขีดจำกัดของโทรศัพท์ทั้งหมด นั่นคือเหตุผลที่เสียงโทรศัพท์ฟังดูอู้อี้ และทำไม /s/ ที่จำกัดแบนด์จึงมักถูกเข้าใจผิดว่าเป็น /sh/ เป็นการสูญเสียที่แท้จริง แต่เป็นปัญหาที่เล็กกว่ามากสำหรับระบบเสียงพูดสมัยใหม่กว่าที่เคยเป็นมา
Apple Live Translation ใช้ได้กับการโทรศัพท์หรือไม่?
ใช่ บน iPhone รุ่นใหม่ และ Samsung Galaxy AI ก็มีฟีเจอร์การโทรที่เทียบเคียงได้ ทั้งสองถูกจำกัดอยู่แค่โทรศัพท์มือถือรุ่นใหม่จากผู้ผลิตรายนั้นๆ และภาษาที่ผู้ผลิตเหล่านั้นรองรับ และทั้งสองต้องใช้ฟีเจอร์นี้บนอุปกรณ์ของคุณเองแทนที่จะอยู่บนสาย ดังนั้นจึงไม่ช่วยเมื่อคุณต้องการโทรหาตู้สาขาสำนักงาน โทรศัพท์บ้าน หรือใครบางคนบนโทรศัพท์รุ่นเก่า LiveLingo จะโทรออกที่แปลแล้วจากแอปไปยังหมายเลขโทรศัพท์มือถือหรือโทรศัพท์บ้านใดก็ได้ และผู้รับไม่ต้องติดตั้งอะไรเลย
ระบบการแปลใดจัดการเสียงโทรศัพท์ได้ดีที่สุด?
มีสองสิ่งที่แยกพวกเขาออกจากกัน ในด้านคุณภาพการแปลผ่านสายโทรศัพท์ LiveLingo ได้ 96.9%, Google 94.0%, Azure 91.8% และ Whisper-large baseline 88.9% จาก 120 ประโยค ในด้านความทนทานของการรู้จำแบบดิบ ความแตกต่างกว้างขึ้น: เมื่อคลิปเดียวกันผ่านช่องสัญญาณโทรศัพท์ Google Cloud Speech-to-Text v2 เปลี่ยนแปลงคำที่รู้จักเพียง 0.4% ในขณะที่ Whisper baseline เปลี่ยนแปลง 2.0% ซึ่งแตกต่างกัน 5 เท่า งานวิจัยที่ตีพิมพ์แสดงรูปแบบเดียวกันในขนาดใหญ่: ในคลังข้อมูลโทรศัพท์ CallHome wav2vec 2.0 Large ได้คะแนนอัตราข้อผิดพลาดของคำ 34.8% เทียบกับ Whisper Large V2 ที่ 17.6% แม้ว่าทั้งสองจะได้คะแนนที่เหมือนกัน 2.7% ในการอ่านออกเสียงที่ชัดเจน
การเชื่อมต่อโทรศัพท์ที่ไม่ดีทำให้การแปลแย่ลงหรือไม่?
แบนด์วิดท์อย่างเดียวไม่ทำให้แย่ลง แต่การสูญหายของแพ็กเก็ต, jitter และเสียงรบกวนพื้นหลังเป็นปัญหาแยกต่างหากและพวกมันทำให้แย่ลง การทดสอบของเราแยกช่วงความถี่ โดยรักษาระดับเสียงให้คงที่ ดังนั้นจึงวัดแบนด์โทรศัพท์และไม่มีอะไรอื่น การโทรที่มีการขาดหายหรือเสียงรบกวนจากถนนที่รุนแรงจะทำให้การแปลแย่ลงด้วยเหตุผลเดียวกับที่ทำให้ผู้ฟังที่เป็นมนุษย์แย่ลง และคุณภาพของตัวแปลงสัญญาณใดๆ ก็ไม่สามารถชดเชยเสียงพูดที่ไมโครโฟนไม่สามารถจับได้อย่างชัดเจน
วิธีการฉบับเต็ม, ผลลัพธ์รายภาษา, พลังงานทางสถิติ, ข้อจำกัด และสิ่งประดิษฐ์การวัดที่เราลบออกได้รับการบันทึกไว้ที่ livelingo.io/research/phone-line-bandwidth-method.