LiveLingoLiveLingoTry free

GPT-Live แปลภาษา: คุณสมบัติ ข้อจำกัด และความหน่วงที่วัดได้จริง (2026)

GPT-Live-1 และ GPT-Live-1 mini คือโมเดลเสียงแบบ full-duplex ของ OpenAI ที่ฟังและพูดได้พร้อมกัน โดยการแปลภาษาแบบเรียลไทม์เป็นหนึ่งในความสามารถเด่น ทั้งคู่เปิดตัวใน ChatGPT เมื่อ 8 กรกฎาคม 2026 และมาถึง OpenAI API เมื่อ 10 กันยายน 2026 ซึ่งแปลว่าคำกล่าวอ้างเรื่องการแปลถูกวัดได้จริงเสียที ไม่ต้องอนุมานเอาอีกต่อไป คู่มือนี้ครอบคลุมสิ่งที่ปล่อยออกมาจริง วิธีที่การแปลทำงานจริง และสิ่งที่การวัดอิสระแสดงให้เห็นเกี่ยวกับข้อจำกัดของมัน

การเปิดเผยผลประโยชน์ทับซ้อน

คู่มือนี้เผยแพร่โดย LiveLingo (Lunana Global Inc.) ผลิตภัณฑ์แปลเสียงที่แข่งขันกับการแปลด้วยเสียงของ ChatGPT เรามีผลประโยชน์ทางการเงินจากการที่คนใช้ LiveLingo มากขึ้น ข้อเท็จจริงเกี่ยวกับ GPT-Live อ้างอิงจากประกาศ system card และเอกสารนักพัฒนาของ OpenAI รวมถึงการรายงานอิสระช่วงเปิดตัว ทั้งหมดลิงก์ไว้ในเนื้อหาและในส่วนแหล่งอ้างอิง ส่วนตัวเลขในส่วนที่ 5 เป็นการวัดของ LiveLingo เอง เก็บผ่าน OpenAI API บนเสียงชุดเดียวกับที่ให้กับทุกระบบอื่น ข้อมูลดิบรายคำพูดเผยแพร่ที่ livelingo.io/research/gpt-live-1-interpreter-test เพื่อการตรวจสอบอิสระ

คำตอบสั้นๆ: GPT-Live เป็นล่ามแปลสดได้หรือไม่?

ได้ และมันคงบทบาทล่ามไว้ได้อย่างน่าเชื่อถือ แต่ตกหลังเสียงพูดต่อเนื่องไปเรื่อยๆ ใน ChatGPT ให้เริ่มเซสชัน Voice แล้วพูดว่า "แปลทุกอย่างที่ฉันพูดเป็นภาษาสเปนแบบพร้อมกัน" เพราะโมเดลเป็นแบบ full-duplex คำแปลจึงสตรีมออกมาขณะที่คุณยังพูดอยู่ บัญชีฟรีได้ GPT-Live-1 mini ส่วนแพ็กเกจเสียเงิน Go, Plus และ Pro ได้ GPT-Live-1 และตั้งแต่ 10 กันยายน 2026 นักพัฒนาเรียกใช้โดยตรงได้ในชื่อ gpt-live-1 ที่ v1/live/sessions ราคา $0.05 ต่อนาที บวกค่าใช้งานโมเดลเบื้องหลัง เมื่อวัดตลอดเซสชันความยาว 452 วินาที ความหน่วงจนแปลจบของมันไต่จาก 5.7 วินาทีขึ้นไปนิ่งที่ 10 ถึง 14 วินาทีในคู่อังกฤษเป็นสเปน และในคู่อังกฤษเป็นญี่ปุ่นมันแปลได้เพียง 17% ของประโยคภายใน 30 วินาที

1. OpenAI ปล่อยอะไรออกมา และอะไรเปลี่ยนไปในเดือนกันยายน

OpenAI ประกาศ GPT-Live ในวันพุธที่ 8 กรกฎาคม 2026 ผ่านบล็อกโพสต์และไลฟ์สตรีม (Introducing GPT-Live) สองโมเดลที่ปล่อยออกมา: GPT-Live-1 โมเดลเสียงเริ่มต้นใหม่สำหรับแพ็กเกจเสียเงิน Go, Plus และ Pro และ GPT-Live-1 mini ค่าเริ่มต้นใหม่สำหรับบัญชีฟรี (ตาม MacRumors และ The Decoder) ทั้งสองมาแทน Advanced Voice Mode ในฐานะค่าเริ่มต้นของ ChatGPT Voice โดยโหมดเก่ายังเลือกใช้ได้ในการตั้งค่าเสียง

เมื่อ 10 กันยายน 2026 โมเดลมาถึง OpenAI API ซึ่งเป็นความเปลี่ยนแปลงสำคัญที่สุดนับตั้งแต่เปิดตัว ตอนนี้ GPT-Live-1 เรียกใช้ได้ในชื่อ gpt-live-1 ที่ endpoint v1/live/sessions ราคา $0.05 ต่อนาทีของบทสนทนาสำหรับชั้นเสียง โดยโมเดลเบื้องหลังที่ทำหน้าที่ใช้เหตุผลคิดเงินแยกต่างหาก (เอกสารอ้างอิงโมเดล) ก่อนหน้านั้น คำกล่าวอ้างเรื่องการแปลอาศัยเพียงเดโมของ OpenAI และรายงานจากสื่อ ตอนนี้วัดได้โดยตรงแล้ว และส่วนที่ 5 ทำสิ่งนั้นพอดี

คุณสมบัติที่นิยามตัวโมเดลคือ เสียงแบบ full-duplex: โมเดลประมวลผลสิ่งที่ได้ยินขณะที่กำลังพูด ตัดสินใจการโต้ตอบหลายครั้งต่อวินาที จึงถูกขัดจังหวะได้อย่างเป็นธรรมชาติ ตอบรับสั้นๆ ("อือฮึ" "เข้าใจแล้ว") ระหว่างที่คุณพูด หรือเงียบขณะที่คุณคิด (MarkTechPost) งานที่ต้องค้นเว็บ ใช้เหตุผลลึก หรือทำงานแบบ agent GPT-Live จะส่งต่อให้ GPT-5.5 เบื้องหลังและสนทนาต่อไประหว่างรอผลกลับมา ผู้ใช้เลือกระดับการใช้เหตุผลได้สามระดับ (Instant, Medium, High) ระดับสูงจะส่งไปที่ GPT-5.5 Thinking

การประเมินที่ OpenAI เผยแพร่เน้นความสามารถมากกว่าความเร็ว: ที่ระดับ High reasoning GPT-Live-1 ได้ 84.2% บน GPQA เทียบกับ 45.3% ของ Advanced Voice Mode และ 75.2% บน BrowseComp เทียบกับ 0.7% ในการทดสอบความชอบของมนุษย์ ผู้ใช้ชอบ GPT-Live-1 มากกว่า Advanced Voice Mode ใน 75.7% ของบทสนทนา และชอบ mini ใน 69.2% (The Decoder อ้างอิงประกาศของ OpenAI) ส่วนการวัดอิสระ Artificial Analysis จัด GPT-Live-1 อยู่อันดับสองโดยรวมบนดัชนี Speech-to-Speech ที่คะแนน 81.5 และใช้เวลา 1.34 วินาทีถึงเสียงแรก แต่ OpenAI ยังไม่เผยแพร่ตัวเลขความหน่วงเฉพาะของงานแปลเลย

2. การแปลสดทำงานอย่างไรบน GPT-Live

การแปลสดเป็นหนึ่งในความสามารถที่ OpenAI ระบุชื่อไว้ชัดเจนในเอกสารเปิดตัว: สถาปัตยกรรม full-duplex ทำให้โมเดล "โต้ตอบไปมาได้เป็นธรรมชาติขึ้น รับรู้เวลาได้ดีขึ้น และแม้กระทั่งทำการแปลสด" (ประกาศของ OpenAI) ในการบรีฟสื่อ OpenAI เดโมให้โมเดลพูดคำแปลต่อเนื่องขณะที่ผู้นำเสนอกำลังพูด

มันคือพรอมต์ ไม่ใช่โหมด

ไม่มีสวิตช์ล่าม ตัวเลือกคู่ภาษา หรือ UI แปลเฉพาะ คุณเริ่มเซสชัน Voice แล้วสั่งผู้ช่วย: "ช่วยแปลทุกอย่างที่ฉันพูดเป็นภาษาฮินดีแบบพร้อมกัน" จากนั้นโมเดลจะพูดคำแปลออกมาขณะที่คุณพูด และทำต่อไปจนกว่าคุณจะบอกให้หยุดหรือเปลี่ยน นี่เป็นรูปแบบสั่งผ่านพรอมต์แบบเดียวกับที่ ChatGPT Voice มีมาตั้งแต่รุ่น Realtime เดือนพฤษภาคม 2026 สิ่งที่เปลี่ยนคือการส่งมอบแบบ full-duplex ที่ทำให้คำแปลซ้อนทับกับเสียงพูดของคุณได้ แทนที่จะรอให้จบเทิร์น

บทบาทล่ามอยู่ครบ ซึ่งไม่ใช่เรื่องที่เดาได้ล่วงหน้า

รูปแบบความล้มเหลวที่ชัดที่สุดของโมเดลสนทนาที่ถูกสั่งให้ทำหน้าที่ล่าม คือมันตอบผู้พูดแทนที่จะแปลคำพูดนั้น แต่เรื่องนั้นไม่เกิดขึ้น ตลอดเสียงล่าม 27 นาทีในการทดสอบที่วัดจริง ครอบคลุมคู่อังกฤษเป็นสเปน อังกฤษเป็นญี่ปุ่น และจีนเป็นอังกฤษ มันไม่เคยตอบผู้พูดแทนการแปลเลยสักครั้ง: ไม่มีคำถามขอความกระจ่าง ไม่มีความคิดเห็นเสริม ไม่มีการไหลกลับไปเป็นผู้ช่วย การทำตามคำสั่งไม่ใช่จุดที่มันพัง

ข้อแลกเปลี่ยนของการเป็นผู้ช่วยก่อนล่าม

GPT-Live เป็นผู้ช่วยสนทนาทั่วไปที่แปลเมื่อถูกสั่ง ไม่ใช่ล่ามเฉพาะทาง และรูปทรงนั้นส่งผลต่อความเร็วมากกว่าการเชื่อฟัง โมเดลสนทนาพูดด้วยอัตราธรรมชาติ และไม่บีบอัดหรือตัดเนื้อหาทิ้งเมื่อตกหลัง งานล่ามมีข้อกำหนดตรงกันข้าม: ผู้พูดเดินหน้าต่อไม่ว่าอย่างไร ระบบที่ตามไม่ทันจึงต้องสรุปย่อ ข้ามบางส่วน หรือยอมรับความหน่วงที่ไม่มีขอบเขต ในแอปฝั่งผู้บริโภค พฤติกรรมตอบรับสั้นๆ ที่ทำให้บทสนทนารู้สึกเป็นธรรมชาติ ("อือฮึ" "ใช่") ยังแทรกเสียงที่ไม่ใช่คำแปลเข้าไปในเซสชันแปลด้วย และผู้ใช้วันแรกจำนวนมากรายงานว่ามันรบกวน (BigGo)

3. GPT-Live เทียบกับตัวแปลเฉพาะทางของ OpenAI เอง

OpenAI มีพื้นผิวแปลสดสองแบบ และมันคือสแตกคนละตัว เมื่อ 7 พฤษภาคม 2026 OpenAI ปล่อย gpt-realtime-translate ใน Realtime API: โมเดลแปลเสียงต่อเสียงแบบสตรีมที่สร้างมาเฉพาะทาง ฝึกด้วยเสียงล่ามมืออาชีพหลายพันชั่วโมง ถูกตั้งค่าให้คงบทบาทแปลอย่างเดียวและรอบริบทให้พอก่อนสร้างเสียง (ประกาศของ OpenAI) ส่วน GPT-Live คือผู้ช่วยแบบ full-duplex เอนกประสงค์ที่แปลเมื่อถูกขอ ตอนนี้ทั้งคู่เปิดให้นักพัฒนาใช้แล้ว จึงเทียบกันตรงๆ ได้เป็นครั้งแรก

สองพื้นผิวแปลสดของ OpenAI ณ วันที่ 16 กันยายน 2026 ข้อเท็จจริงตามประกาศและเอกสารนักพัฒนาของ OpenAI ส่วนตัวเลขที่วัดได้มาจาก LiveLingo Research
GPT-Live (gpt-live-1)gpt-realtime-translate
คืออะไรผู้ช่วยเสียง full-duplex; แปลผ่านพรอมต์โมเดลแปลเสียงต่อเสียงแบบสตรีมเฉพาะทาง
เปิดตัวChatGPT 8 กรกฎาคม 2026; API 10 กันยายน 20267 พฤษภาคม 2026
การเข้าถึงแอป ChatGPT และ endpoint API /v1/live/sessionsRealtime API, endpoint /v1/realtime/translations
ราคารวมในแพ็กเกจ ChatGPT; $0.05/นาที ผ่าน API บวกค่าโมเดลเบื้องหลัง$0.034 ต่อนาทีของเสียง
ภาษาไม่เผยแพร่; "ภาษาที่พูดกันมากที่สุด" พร้อมเปิดเผยช่องว่างสำเนียงภาษาอินพุต 70+ ภาษา; ภาษาเอาต์พุต 13 ภาษา (มีเอกสาร)
คงบทบาทล่ามใช่เมื่อสั่งชัดเจน; ไม่หลุดบทบาทเลยใน 27 นาทีของการทดสอบใช่; แปลอย่างเดียวโดยการออกแบบ ไม่รับ system prompt
ความหน่วงจนแปลจบ en→esมัธยฐาน 11.72 วินาที ไต่ขึ้นไปนิ่งที่ 10–14 วินาทีมัธยฐาน 2.65 วินาที คงที่
ความครอบคลุมภาษาญี่ปุ่นภายใน 30 วินาที17%98%
บันทึกข้อความtext delta ของเสียงต้นทางและคำแปลtext delta ของเสียงต้นทางและคำแปล

ภาษาเอาต์พุต 13 ภาษาที่มีเอกสารของ gpt-realtime-translate: อังกฤษ สเปน โปรตุเกส ฝรั่งเศส เยอรมัน อิตาลี รัสเซีย จีน ญี่ปุ่น เกาหลี ฮินดี อินโดนีเซีย และเวียดนาม (OpenAI Cookbook) OpenAI ยังไม่เผยแพร่รายชื่อภาษาของ GPT-Live พฤติกรรมที่วัดได้จึงเป็นเครื่องชี้เพียงอย่างเดียว และมันต่างกันมหาศาลตามภาษา

มีสองประเด็นจากสัปดาห์เปิดตัวที่ควรแก้ให้ชัด เพราะการรายงานช่วงแรกสับสนทั้งคู่ ประเด็นแรก: ราคา "$32 ต่อล้านโทเค็นเสียงอินพุต, $64 เอาต์พุต" ที่แชร์กันในบางโพสต์ ไม่เคยเป็นราคาของ GPT-Live แต่เป็นของ gpt-realtime-2 ซึ่งเป็นคนละโมเดล ประเด็นที่สอง: ข้อความช่วงเปิดตัวที่ว่า GPT-Live ไม่มี API เป็นจริงเฉพาะเดือนกรกฎาคมและสิงหาคมเท่านั้น ตอนนี้ไม่จริงแล้ว ตั้งแต่ 10 กันยายน 2026 GPT-Live-1 เรียกใช้ได้ในชื่อ gpt-live-1 ที่ v1/live/sessions ราคา $0.05 ต่อนาทีสำหรับชั้นเสียง บวกค่าใช้งานโมเดลเบื้องหลัง (เอกสารอ้างอิงโมเดล) บทความและสรุปที่ยังบอกว่า "ไม่มี API" คือข้อมูลเก่าค้างจากสัปดาห์เปิดตัว

4. ข้อจำกัดที่ OpenAI และการทดสอบอิสระเปิดเผย

  • ความหน่วงสะสมบนเสียงพูดต่อเนื่อง ความหน่วงจนแปลจบที่วัดได้ไต่จาก 5.7 วินาทีขึ้นไปนิ่งที่ 10 ถึง 14 วินาทีภายในสามนาทีในคู่อังกฤษเป็นสเปน และค้างอยู่ตรงนั้นตลอดเซสชันที่เหลือ
  • ภาษาญี่ปุ่นแย่ลงอย่างรุนแรง มีเพียง 17% ของประโยคที่ถูกแปลภายใน 30 วินาที เทียบกับ 98% ของโมเดลตัวเดียวกันเมื่อแปลเป็นภาษาสเปน และ 20 จาก 90 ประโยคไม่ถูกแปลเลย
  • โควตาการใช้งานมีจริงแต่ไม่เผยแพร่ตัวเลข ศูนย์ช่วยเหลือของ OpenAI ระบุว่าโควตาเสียงต่างกันตามแพ็กเกจและตัวเลือก Voice และอาจเปลี่ยนได้ รายงานตัวเลขจากบุคคลที่สามขัดแย้งกันเอง ให้ถือว่าตัวเลขเฉพาะใดๆ ยังไม่ได้รับการยืนยัน
  • ไม่มีตัวเลขความหน่วงอย่างเป็นทางการ OpenAI ปล่อยเบนช์มาร์กความสามารถ (GPQA, BrowseComp, อัตราความชอบ) แต่ไม่มีการวัดเสียงแรกหรือการตามหลังสำหรับงานแปล
  • ความครอบคลุมภาษาไม่มีเอกสาร "ภาษาที่พูดกันมากที่สุด" พร้อมเปิดเผยสำเนียงไม่ใช่เจ้าของภาษาและช่องว่างความคล่องสำหรับภาษาอื่น
  • เสียงตอบรับปิดสนิทไม่ได้ ในแอปฝั่งผู้บริโภค แม้ว่าคำสั่งให้แปลอย่างเดียวจะอยู่ครบถ้วนโดยไม่มีข้อยกเว้นในการทดสอบผ่าน API
  • ระบบตรวจสอบความปลอดภัยแทรกแซงได้ ตาม GPT-Live system card การมอนิเตอร์แบบเรียลไทม์สามารถบังคับทิศทางหรือขัดจังหวะคำตอบ เล่นข้อความความปลอดภัยแบบเสียง หรือยุติบทสนทนาความเสี่ยงสูง

5. การวัดอิสระบอกอะไร

สิ่งที่เราวัด (และสิ่งที่เราไม่ได้วัด)

ตัวเลขเหล่านี้มาจาก gpt-live-1 ผ่าน OpenAI API โดยสั่งผ่านพรอมต์ให้ทำหน้าที่ล่ามแปลพร้อมกัน วัดเมื่อ 15 กันยายน 2026 มันไม่ใช่การวัดประสบการณ์ ChatGPT ฝั่งผู้บริโภค เพราะบัญชีฟรีรัน GPT-Live-1 mini และตัวแอปยังเพิ่มการตรวจจับเสียงฝั่งไคลเอนต์กับพรอมต์ของตัวเองที่ไม่มี harness ใดแยกออกมาได้ ทุกระบบในการเปรียบเทียบได้รับเสียงชุดเดียวกันที่จังหวะเรียลไทม์เดียวกัน และข้อมูลรายคำพูดเผยแพร่ที่ livelingo.io/research/gpt-live-1-interpreter-test

การทำซ้ำได้

ทุกตัวเลขทำซ้ำได้จากสตรีมเสียงต่อเนื่องชุดเดียวความยาว 452 วินาที จังหวะเล่นแบบเรียลไทม์เดียวกัน และ Python harness ตัวเดียวที่ใช้กับทั้งสี่ระบบอย่างเท่าเทียม ผลภาษาญี่ปุ่นเกิดซ้ำในการรันสองครั้งที่เป็นอิสระต่อกัน ข้อมูลดิบรายคำพูด (per-clip.json) และระเบียบวิธีเผยแพร่ภายใต้ CC-BY 4.0 ที่ livelingo.io/research/gpt-live-1-interpreter-test

ความหน่วงจนแปลจบคือเวลาที่คำแปลของประโยคหนึ่งถูกส่งจนครบ ลบด้วยเวลาที่ผู้พูดพูดประโยคนั้นจบ สตรีมต่อเนื่องชุดเดียว 452 วินาที 90 ประโยค เสียงชุดเดียวกันสำหรับทุกระบบ ระเบียบวิธีฉบับเต็ม: /research/gpt-live-1-interpreter-test
ระบบความหน่วง en→esความหน่วง en→jaความครอบคลุมภาษาญี่ปุ่นภายใน 30 วินาทีตลอดเซสชัน
LiveLingo0.94 วินาที0.88 วินาที100%คงที่
Gemini 3.5 Live Translate1.51 วินาที1.92 วินาที99%คงที่
OpenAI gpt-realtime-translate2.65 วินาที3.33 วินาที98%คงที่
GPT-Live-1 (สั่งผ่านพรอมต์)11.72 วินาทีn/a17%ไต่ขึ้นไปนิ่งที่ 10–14 วินาที

มันไม่เคยหลุดบทบาท ตลอดเสียงล่าม 27 นาที มันไม่เคยตอบผู้พูดแทนการแปลเลย ไม่ว่าทิศทางไหน นั่นเป็นเรื่องยากจริงๆ และโมเดลแปลเฉพาะทางไม่ต้องรับมือกับโจทย์ข้อนี้ด้วยซ้ำ

มันตกหลังไปเรื่อยๆ ในคู่อังกฤษเป็นสเปน ความหน่วงจนแปลจบไต่จาก 5.7 วินาทีที่นาทีที่ศูนย์ ขึ้นไปนิ่งอยู่ระหว่าง 10 ถึง 14 วินาทีภายในนาทีที่สาม แล้วค้างอยู่ตรงนั้น รูปทรงของเส้นนี้สำคัญ: มันไม่ได้ลอยไปไม่มีที่สิ้นสุด แต่ผู้ฟังที่เข้ามาร่วมที่นาทีที่หกจะได้ยินคำแปลที่ตามหลังห้องประชุมอยู่ราวสิบสองวินาที

คู่อังกฤษเป็นญี่ปุ่นพังทลาย มีเพียง 17% ของประโยคที่ถูกแปลภายใน 30 วินาที เทียบกับ 98% ของโมเดลตัวเดียวกันเมื่อแปลเป็นภาษาสเปน มัธยฐานของเอาต์พุตมาช้า 50.7 วินาที และ 20 จาก 90 ประโยคไม่ถูกแปลเลย มันหยุดส่งเอาต์พุตประมาณเจ็ดวินาทีหลังเสียงอินพุตจบ แทนที่จะระบายคิวงานที่ค้างอยู่ออกมา พูดอีกอย่างคือมันไม่ได้ไล่ตามทัน แต่ทิ้งส่วนที่ยังไปไม่ถึง ผลนี้เกิดซ้ำในการรันอิสระสองครั้ง

นี่ไม่ใช่ปัญหาของ OpenAI บนเสียงภาษาญี่ปุ่นชุดเดียวกัน จากบัญชีเดียวกันในวันเดียวกัน gpt-realtime-translate ของ OpenAI เองคง 3.33 วินาทีไว้ได้คงที่และครอบคลุม 98% ของประโยค ความล้มเหลวจึงเป็นของการสั่งโมเดลสนทนาแบบ full-duplex ให้ทำหน้าที่ล่าม ไม่ใช่ของผู้ให้บริการ และตัวเลขภาษาญี่ปุ่นคือเหตุผลที่คอลัมน์ความหน่วงด้านบนเขียนว่า n/a: เมื่อเนื้อหาหนึ่งในห้าไม่เคยมาถึง ค่ามัธยฐานย่อมอธิบายได้เฉพาะส่วนที่รอดมา

6. วิธีใช้ GPT-Live แปลภาษาวันนี้

  1. อัปเดตแอป ChatGPT บน iOS หรือ Android (หรือใช้ chatgpt.com) บัญชีฟรีรัน GPT-Live-1 mini ส่วนบัญชี Go, Plus และ Pro รัน GPT-Live-1
  2. แตะไอคอน Voice ในช่องพิมพ์ข้อความเพื่อเริ่มเซสชัน
  3. ให้คำสั่งแปลตั้งแต่ต้น: "แปลทุกอย่างที่ฉันพูดเป็นภาษาญี่ปุ่นแบบพร้อมกัน ห้ามตอบคำถาม ห้ามแสดงความคิดเห็น แปลอย่างเดียว" ในการทดสอบที่วัดจริง คำสั่งนี้อยู่ครบถ้วนโดยไม่มีข้อยกเว้น
  4. สำหรับบทสนทนาสองทาง ขอทั้งสองทิศทาง: "แปลภาษาอังกฤษของฉันเป็นภาษาญี่ปุ่น และแปลภาษาญี่ปุ่นที่ได้ยินกลับเป็นภาษาอังกฤษ"
  5. ใช้เซสชันสั้นๆ ความหน่วงที่วัดได้ต่ำที่สุดในนาทีแรกและเพิ่มขึ้นราวเท่าตัวภายในนาทีที่สาม การแบ่งบทสนทนายาวเป็นช่วงสั้นๆ จึงช่วยให้คำแปลอยู่ใกล้ผู้พูดมากขึ้น
  6. นักพัฒนาเรียก gpt-live-1 ได้โดยตรงที่ v1/live/sessions หรือจะใช้ gpt-realtime-translate แทนก็ได้ ถ้างานคือการแปล ไม่ใช่การสนทนา

7. เมื่อไหร่ GPT-Live เหมาะ และเมื่อไหร่ไม่เหมาะ

GPT-Live เป็นตัวเลือกที่ถูกต้องเมื่อ

  • คุณต้องการแปลสดฟรีโดยไม่ต้องติดตั้งอะไรเพิ่ม และใช้ ChatGPT อยู่แล้ว ระดับฟรีมีโมเดลเสียงแบบ full-duplex ให้ใช้
  • บทสนทนาสั้น: ถามทาง แลกเปลี่ยนสั้นๆ คุยเล่นระหว่างเดินทาง ความหน่วงยังไม่ทันสะสม และการโต้ตอบครั้งแรกให้ความรู้สึกทันใจ
  • คุณให้คุณค่ากับผู้ช่วยที่อยู่รอบการแปล: ถามคำถามต่อยอด ขอบริบท หรือให้ GPT-5.5 ค้นหาอะไรบางอย่างกลางบทสนทนาได้

เครื่องมืออื่นเหมาะกว่าเมื่อ

  • เสียงพูดต่อเนื่อง การประชุม การบรรยาย หรือการโทรที่ฝ่ายหนึ่งพูดยาวครั้งละหลายนาที คือจุดที่ความหน่วงซึ่งนิ่งอยู่ที่ 10 ถึง 14 วินาทีกลายเป็นประสบการณ์ทั้งหมด
  • คุณกำลังแปลเป็นภาษาญี่ปุ่น หรือภาษาใดก็ตามที่คุณยังไม่ได้ตรวจสอบพฤติกรรมด้วยตัวเอง ความครอบคลุมต่างกันตั้งแต่ 98% ถึง 17% ระหว่างสองภาษาบนโมเดลตัวเดียวกัน
  • คุณต้องการบันทึกสองภาษาที่อ่านได้ระหว่างฟัง GPT-Live ให้บันทึกแชท ไม่ใช่มุมมองต้นฉบับกับคำแปลแบบเคียงข้างที่ไม่มีวันเขียนทับตัวเอง
  • คุณต้องการโทรศัพท์ที่แปลภาษา ไม่มีพื้นผิวไหนของ OpenAI โทรออกไปยังเบอร์โทรศัพท์ได้ LiveLingo โทรออกไปยังเบอร์โทรศัพท์ปกติโดยมีการแปลทำงานบนสาย และผู้รับสายไม่ต้องมีแอป

การยอมรับอย่างตรงไปตรงมา LiveLingo (ผู้เผยแพร่คู่มือนี้) อยู่ในหมวดล่ามเฉพาะทาง ดังนั้นโปรดอ่านการเปรียบเทียบโดยคำนึงถึงข้อนี้ ความเป็นธรรมชาติเชิงสนทนาของ GPT-Live เป็นความก้าวหน้าจริง การผลัดเทิร์นแบบ full-duplex ของมันนำหน้าแอปล่ามเฉพาะทางทุกตัวรวมถึงของเราด้วย ระดับฟรีของมันทำให้เป็นวิธีที่ง่ายที่สุดสำหรับทุกคนที่จะลองการแปลเสียงสดวันนี้ และมันคงบทบาทล่ามไว้ได้ตลอด 27 นาทีโดยไม่หลุดสักครั้ง สิ่งที่มันทำไม่ได้คือตามจังหวะผู้พูดที่ไม่รอใคร สเปกแบบเคียงข้าง: /compare/chatgpt-translation ผลการวัดฉบับเต็ม: /research/gpt-live-1-interpreter-test ไลน์อัปการแปลทั้งหมดของ OpenAI: /th/guides/openai-live-translation

8. คำถามที่พบบ่อย

GPT-Live คืออะไร?

GPT-Live คือตระกูลโมเดลเสียงแบบ full-duplex ของ OpenAI เปิดตัวใน ChatGPT เมื่อ 8 กรกฎาคม 2026 มีสองโมเดล: GPT-Live-1 (ค่าเริ่มต้นสำหรับแพ็กเกจเสียเงิน Go, Plus และ Pro) และ GPT-Live-1 mini (ค่าเริ่มต้นสำหรับผู้ใช้ฟรี) ต่างจาก Advanced Voice Mode ที่มันมาแทนที่ GPT-Live ฟังและพูดได้พร้อมกัน จึงถูกขัดจังหวะได้อย่างเป็นธรรมชาติ ตอบรับสั้นๆ ระหว่างที่คุณพูด และแปลสดได้ขณะที่คุณยังพูดอยู่ มันส่งต่อคำถามซับซ้อนให้ GPT-5.5 เบื้องหลัง ใช้งานได้บน iOS, Android และ chatgpt.com และตั้งแต่ 10 กันยายน 2026 นักพัฒนาเรียกใช้ได้ผ่าน OpenAI API ในชื่อโมเดล gpt-live-1

GPT-Live แปลภาษาแบบเรียลไทม์ได้หรือไม่?

ได้ และในการทดสอบที่วัดจริง มันไม่เคยหลุดบทบาทล่ามเลยตลอดเสียง 27 นาที การเรียกใช้ทำผ่านพรอมต์ ไม่ใช่สวิตช์โหมด: บอกผู้ช่วยว่า "แปลทุกอย่างที่ฉันพูดเป็นภาษาญี่ปุ่นแบบพร้อมกัน" แล้วมันจะพูดคำแปลต่อเนื่องขณะที่คุณพูด ข้อจำกัดอยู่ที่ความเร็ว ไม่ใช่การเชื่อฟัง: ความหน่วงจนแปลจบไต่จาก 5.7 วินาทีขึ้นไปนิ่งที่ 10 ถึง 14 วินาทีในคู่อังกฤษเป็นสเปน ภายในเซสชันความยาว 452 วินาที

GPT-Live มี API หรือไม่?

มี ตั้งแต่ 10 กันยายน 2026 GPT-Live-1 ใช้งานได้ในชื่อโมเดล gpt-live-1 ที่ endpoint v1/live/sessions ราคา $0.05 ต่อนาทีของบทสนทนาสำหรับชั้นเสียง โดยโมเดลเบื้องหลังที่ทำหน้าที่ใช้เหตุผลคิดเงินแยกต่างหาก นี่เปลี่ยนไปจากวันเปิดตัวใน ChatGPT เมื่อ 8 กรกฎาคม ซึ่งตอนนั้น GPT-Live ใช้ได้ใน ChatGPT เท่านั้น นอกจากนี้ OpenAI ยังมีโมเดลแปลเฉพาะทางแยกต่างหากคือ gpt-realtime-translate ราคา $0.034 ต่อนาที รองรับภาษาอินพุต 70+ ภาษาและภาษาเอาต์พุต 13 ภาษา

GPT-Live เพิ่มความหน่วงเท่าไหร่เวลาแปล?

วัดผ่าน API เมื่อ 15 กันยายน 2026: มัธยฐาน 11.72 วินาทีกว่าจะส่งคำแปลของประโยคหนึ่งจนจบในคู่อังกฤษเป็นสเปน โดยไต่ขึ้นตลอดเซสชันจาก 5.7 วินาทีที่นาทีที่ศูนย์ ไปนิ่งที่ 10 ถึง 14 วินาทีภายในนาทีที่สาม บนเสียงชุดเดียวกัน gpt-realtime-translate ของ OpenAI เองวัดได้ 2.65 วินาที Gemini 3.5 Live Translate 1.51 วินาที และ LiveLingo 0.94 วินาที ทั้งสามคงที่ตลอด 452 วินาทีเดียวกันโดยไม่ลอยขึ้น

ทำไม GPT-Live ถึงมีปัญหากับการแปลภาษาญี่ปุ่น?

มันตกหลังไกลจนเลิกไล่ตาม มีเพียง 17% ของประโยคภาษาญี่ปุ่นที่ถูกแปลภายใน 30 วินาทีหลังพูดจบ เทียบกับ 98% ของโมเดลตัวเดียวกันเมื่อแปลเป็นภาษาสเปน มัธยฐานของเอาต์พุตมาช้า 50.7 วินาที และ 20 จาก 90 ประโยคไม่ถูกแปลเลย ผลนี้เกิดซ้ำในการรันสองครั้ง ขณะที่ gpt-realtime-translate ซึ่งเป็นโมเดลเฉพาะทางของ OpenAI ครอบคลุม 98% ที่ 3.33 วินาทีคงที่บนเสียงชุดเดียวกัน ดังนั้นปัญหานี้เป็นเรื่องเฉพาะของการสั่งโมเดลสนทนาให้ทำหน้าที่แปล ไม่ใช่ข้อจำกัดของภาษาญี่ปุ่นฝั่ง OpenAI

GPT-Live ฟรีหรือไม่?

ใน ChatGPT ฟรี โดยแบ่งตามระดับแพ็กเกจ GPT-Live-1 mini เป็นโมเดลเสียงเริ่มต้นสำหรับบัญชีฟรี ส่วนแพ็กเกจเสียเงิน Go, Plus และ Pro ได้ GPT-Live-1 ตัวใหญ่กว่า ไม่มีการเปิดตัวแพ็กเกจสมัครสมาชิกใหม่ และโควตาการใช้เสียงต่างกันตามแพ็กเกจโดยไม่เผยแพร่ตัวเลขนาที ส่วน API แยกต่างหากและคิดตามการใช้งานที่ $0.05 ต่อนาทีสำหรับชั้นเสียง บวกค่าใช้งานโมเดลเบื้องหลัง

GPT-Live รองรับภาษาอะไรบ้างสำหรับการแปล?

OpenAI ยังไม่เผยแพร่รายชื่อภาษา เอกสารเปิดตัวบอกว่าเสียงถูกปรับให้เหมาะกับ "ภาษาที่พูดกันมากที่สุด" และเปิดเผยช่องว่างด้านสำเนียงและความคล่องสำหรับภาษาอื่น พฤติกรรมที่วัดได้ต่างกันมากตามภาษา: โมเดลตัวเดียวกันครอบคลุมประโยคภาษาสเปน 98% ภายใน 30 วินาที แต่ครอบคลุมภาษาญี่ปุ่นเพียง 17% ส่วนโมเดลแปลฝั่งนักพัฒนาของ OpenAI คือ gpt-realtime-translate มีเอกสารระบุภาษาอินพุต 70+ ภาษาและภาษาเอาต์พุต 13 ภาษา: อังกฤษ สเปน โปรตุเกส ฝรั่งเศส เยอรมัน อิตาลี รัสเซีย จีน ญี่ปุ่น เกาหลี ฮินดี อินโดนีเซีย และเวียดนาม

GPT-Live เทียบกับ Gemini Live ในด้านการแปลเป็นอย่างไร?

เดิมพันสถาปัตยกรรมคนละแบบ และตอนนี้วัดได้ทั้งคู่แล้ว GPT-Live เป็นผู้ช่วยสนทนาแบบ full-duplex ที่แปลเมื่อถูกสั่ง ส่วน Gemini 3.5 Live Translate ของ Google เป็นโมเดลแปลเสียงต่อเสียงแบบสตรีมเฉพาะทาง บนเสียงชุดเดียวกันความยาว 452 วินาที Gemini คงความหน่วงจนแปลจบไว้ที่ 1.51 วินาทีในคู่อังกฤษเป็นสเปน และ 1.92 วินาทีเมื่อแปลเป็นภาษาญี่ปุ่น ขณะที่ gpt-live-1 ไต่ขึ้นไปนิ่งที่ 10 ถึง 14 วินาทีในภาษาสเปน และครอบคลุมประโยคภาษาญี่ปุ่นเพียง 17% ภายใน 30 วินาที เส้นทางแปลเฉพาะทางคงระยะห่างคงที่ไว้ได้ แทนที่จะสะสมความหน่วง

จะสลับกลับไปใช้ Advanced Voice Mode จาก GPT-Live ได้อย่างไร?

เปิดการตั้งค่าเสียงของ ChatGPT แล้วเลือก Advanced Voice Mode GPT-Live เข้ามาแทนที่เป็นค่าเริ่มต้นเมื่อ 8 กรกฎาคม 2026 แต่ OpenAI ยังคงให้เลือกโหมดเก่าได้สำหรับผู้ใช้ที่ต้องการฟีเจอร์ที่ GPT-Live ไม่รองรับ เช่น วิดีโอและการแชร์หน้าจอ

จะหยุด GPT-Live ไม่ให้ขัดจังหวะหรือพูด "อือฮึ" ได้อย่างไร?

คุณปิดพฤติกรรมตอบรับสั้นๆ นี้แบบสนิทไม่ได้ในแอปฝั่งผู้บริโภค วิธีเลี่ยงคือให้คำสั่งชัดเจนตั้งแต่ต้นเซสชัน เช่น "แปลเฉพาะสิ่งที่ฉันพูด ไม่ต้องเพิ่มอะไรอื่น" ในการทดสอบผ่าน API ที่วัดจริง คำสั่งนี้อยู่ครบถ้วนโดยไม่หลุดบทบาทเลยตลอด 27 นาที ดังนั้นบทบาทล่ามเองเชื่อถือได้ แม้การพูดแทรกเชิงสนทนาจะยังเกิดขึ้นได้ใน ChatGPT ถ้าพฤติกรรมนี้ขัดขวางการใช้งานของคุณ Advanced Voice Mode ยังเลือกใช้ได้ในการตั้งค่าเสียง

ตอนนี้ควรใช้เครื่องมือไหนเป็นล่ามแปลสดสำหรับบทสนทนา?

สำหรับการแลกเปลี่ยนสั้นๆ GPT-Live ดีและใช้ฟรีได้ใน ChatGPT ส่วนเสียงพูดต่อเนื่องอย่างการประชุม การบรรยาย หรือการโทรยาว ควรใช้เส้นทางที่สร้างมาเฉพาะทาง วัดบนเสียงชุดเดียวกันความยาว 452 วินาที ความหน่วงจนแปลจบคือ 0.94 วินาทีสำหรับ LiveLingo, 1.51 วินาทีสำหรับ Gemini 3.5 Live Translate และ 2.65 วินาทีสำหรับ gpt-realtime-translate ของ OpenAI เอง ทั้งหมดคงที่ เทียบกับ 10 ถึง 14 วินาทีที่ไต่ขึ้นของ gpt-live-1 แบบสั่งผ่านพรอมต์ ส่วนการโทรแปลภาษาไปยังเบอร์โทรศัพท์ปกติ ไม่มีพื้นผิวไหนของ OpenAI โทรออกได้ นั่นคือหมวดผลิตภัณฑ์อีกหมวดหนึ่ง

9. แหล่งอ้างอิง

  • OpenAI. Introducing GPT-Live. OpenAI blog, July 8, 2026. openai.com
  • OpenAI Developers. GPT-Live-1 model reference (การเปิดให้ใช้ผ่าน API, endpoint, ราคา). developers.openai.com
  • OpenAI. GPT-Live system card. OpenAI Deployment Safety, July 2026. deploymentsafety.openai.com
  • OpenAI. ChatGPT Voice (help center). help.openai.com
  • TechCrunch. OpenAI releases new voice models for more natural live conversations, July 8, 2026. techcrunch.com
  • MarkTechPost. OpenAI Releases GPT-Live and GPT-Live-1 mini: Full-Duplex Voice Models That Delegate Deeper Reasoning to GPT-5.5, July 8, 2026. marktechpost.com
  • MacRumors. OpenAI Introduces GPT-Live to Make ChatGPT Voice Feel Like a Real Conversation, July 8, 2026. macrumors.com
  • The Decoder. ChatGPT can now listen and talk at the same time, July 2026. the-decoder.com
  • SiliconANGLE. OpenAI launches GPT-Live voice model series ahead of broad GPT-5.6 release, July 8, 2026. siliconangle.com
  • Simon Willison. Introducing GPT-Live (บันทึกจากการเข้าถึงรุ่นพรีวิว), July 8, 2026. simonwillison.net
  • OpenAI Developers. gpt-realtime-translate model reference และ realtime translation guide. developers.openai.com
  • Artificial Analysis. Speech to Speech Quality Index (อันดับของ GPT-Live-1 และเวลาถึงเสียงแรก). artificialanalysis.ai
  • LiveLingo Research. GPT-Live-1 Interpreter Test, 15 กันยายน 2026 ข้อมูลรายคำพูดภายใต้ CC-BY 4.0. livelingo.io/research/gpt-live-1-interpreter-test
  • LiveLingo Research. Real-Time Voice Translation Benchmark 2026. livelingo.io/research/benchmark-2026. Dataset DOI: 10.5281/zenodo.21250032
  • LiveLingo. ChatGPT Translation in 2026: Voice Mode, gpt-realtime-translate API, and Whisper Compared. livelingo.io/guides/openai-live-translation

อัปเดตเมื่อ 16 กันยายน 2026 เพื่อสะท้อนว่า GPT-Live-1 มาถึง OpenAI API เมื่อ 10 กันยายน 2026 และเพื่อเพิ่มการวัดอิสระชุดแรกของพฤติกรรมการแปลของมัน ชื่อโมเดล การจับคู่ระดับแพ็กเกจ endpoint และราคา ตรวจสอบกับเอกสารนักพัฒนาของ OpenAI เมื่อ 16 กันยายน 2026 ตัวเลขที่วัดเป็นของโมเดลระดับ API ไม่ใช่ของประสบการณ์ ChatGPT ฝั่งผู้บริโภค และ OpenAI อาจเปลี่ยนระดับแพ็กเกจ โควตา ความครอบคลุมภาษา และพฤติกรรมโมเดลได้อย่างรวดเร็ว