LiveLingoLiveLingoTry free

GPT-Live dịch trực tiếp: Tính năng, giới hạn và độ trễ đo được (2026)

GPT-Live-1 và GPT-Live-1 mini là hai mô hình giọng nói song công toàn phần của OpenAI: chúng nghe và nói cùng lúc, và phiên dịch trực tiếp là một trong những năng lực nổi bật nhất. Chúng ra mắt trong ChatGPT ngày 8/7/2026 và lên API của OpenAI ngày 10/9/2026, nghĩa là tuyên bố về dịch thuật cuối cùng cũng có thể đo được thay vì phải phỏng đoán. Hướng dẫn này bao gồm những gì đã được phát hành, dịch thuật thực sự hoạt động thế nào, và phép đo độc lập nay cho thấy gì về các giới hạn của nó.

Xung đột lợi ích

Hướng dẫn này được xuất bản bởi LiveLingo (Lunana Global Inc.), một sản phẩm dịch giọng nói cạnh tranh với tính năng dịch bằng giọng nói của ChatGPT. Chúng tôi có lợi ích tài chính trong việc LiveLingo được sử dụng. Các tuyên bố thực tế về GPT-Live được dẫn nguồn từ thông báo, system card và tài liệu nhà phát triển của OpenAI, cùng các bài đưa tin ra mắt độc lập, tất cả được liên kết trong bài và ở phần Nguồn. Các phép đo ở Phần 5 là của chính LiveLingo, thực hiện qua API của OpenAI trên cùng đoạn âm thanh đã đưa cho mọi hệ thống khác, với dữ liệu theo từng phát ngôn được công bố tại livelingo.io/research/gpt-live-1-interpreter-test để kiểm chứng độc lập.

Trả lời nhanh: GPT-Live có phiên dịch trực tiếp được không?

Có, và nó giữ vai phiên dịch rất đáng tin cậy, nhưng nó tụt lại ngày một xa trên giọng nói liên tục. Trong ChatGPT, bắt đầu một phiên Voice và nói điều gì đó như "dịch đồng thời mọi thứ tôi nói sang tiếng Tây Ban Nha." Vì các mô hình là song công toàn phần, bản dịch được phát ngay trong khi bạn còn đang nói. Tài khoản miễn phí dùng GPT-Live-1 mini; các gói trả phí Go, Plus và Pro dùng GPT-Live-1. Từ ngày 10/9/2026, nhà phát triển cũng có thể gọi trực tiếp gpt-live-1 tại v1/live/sessions với giá $0.05 mỗi phút cộng chi phí mô hình nền. Đo trên một phiên dài 452 giây, độ trễ hoàn tất của nó tăng từ 5.7 giây lên mức ổn định 10 đến 14 giây ở chiều Anh sang Tây Ban Nha, và ở chiều Anh sang Nhật nó chỉ dịch được 17% số câu trong vòng 30 giây.

1. OpenAI đã phát hành gì, và điều gì đã thay đổi trong tháng 9

OpenAI công bố GPT-Live vào thứ Tư, ngày 8 tháng 7 năm 2026 trong một bài blog và buổi livestream (Introducing GPT-Live). Hai mô hình được phát hành: GPT-Live-1, mô hình giọng nói mặc định mới cho các gói trả phí Go, Plus và Pro, và GPT-Live-1 mini, mặc định mới cho tài khoản miễn phí (theo MacRumors và The Decoder). Cả hai thay thế Advanced Voice Mode làm mặc định của ChatGPT Voice, và chế độ cũ vẫn có thể chọn lại trong cài đặt giọng nói.

Ngày 10/9/2026, các mô hình đã lên API của OpenAI, đây là thay đổi quan trọng nhất kể từ lúc ra mắt. GPT-Live-1 nay gọi được dưới tên gpt-live-1 tại endpoint v1/live/sessions, giá $0.05 mỗi phút hội thoại cho tầng giọng nói, còn mô hình nền xử lý suy luận được tính phí riêng (tài liệu mô hình). Trước đó, tuyên bố về dịch thuật chỉ dựa vào bản demo của OpenAI và các bài đưa tin. Giờ nó đo được trực tiếp, và Phần 5 làm đúng việc đó.

Tính năng định hình sản phẩm là âm thanh song công toàn phần: mô hình xử lý những gì nó nghe được trong khi đang nói, đưa ra quyết định tương tác nhiều lần mỗi giây, nên có thể bị ngắt lời một cách tự nhiên, đáp lại bằng lời đệm ("mhmm," "got it") trong khi bạn nói, hoặc giữ im lặng khi bạn suy nghĩ (MarkTechPost). Với bất cứ điều gì cần tìm kiếm web, suy luận sâu hơn hoặc tác vụ agent, GPT-Live ủy quyền cho GPT-5.5 chạy nền và giữ cuộc trò chuyện tiếp diễn trong khi chờ kết quả trả về. Người dùng có thể chọn ba mức suy luận (Instant, Medium, High); các mức cao hơn định tuyến sang GPT-5.5 Thinking.

Các đánh giá được OpenAI công bố tập trung vào năng lực thay vì tốc độ: ở mức suy luận High, GPT-Live-1 đạt 84.2% trên GPQA so với 45.3% của Advanced Voice Mode, và 75.2% trên BrowseComp so với 0.7%. Trong thử nghiệm sở thích con người, GPT-Live-1 được ưa thích hơn Advanced Voice Mode trong 75.7% các cuộc trò chuyện, và bản mini là 69.2% (The Decoder, dẫn thông báo của OpenAI). Ở phía độc lập, Artificial Analysis xếp GPT-Live-1 hạng nhì tổng thể trên chỉ số Speech-to-Speech với 81.5 điểm, và 1.34 giây tới âm thanh đầu tiên. OpenAI vẫn không công bố số liệu độ trễ riêng cho dịch thuật.

2. Phiên dịch trực tiếp hoạt động thế nào trên GPT-Live

Phiên dịch trực tiếp là một trong những năng lực OpenAI nêu tên rõ ràng trong tài liệu ra mắt: kiến trúc song công toàn phần cho phép mô hình "tương tác qua lại tự nhiên hơn, giữ cảm nhận thời gian tốt hơn, và thậm chí thực hiện phiên dịch trực tiếp" (thông báo của OpenAI). Trong các buổi họp báo, OpenAI đã demo mô hình nói bản dịch liên tục trong khi người thuyết trình đang nói.

Là một câu lệnh, không phải một chế độ

Không có nút bật phiên dịch, bộ chọn cặp ngôn ngữ hay UI dịch thuật chuyên dụng. Bạn bắt đầu một phiên Voice và ra chỉ dẫn cho trợ lý: "Tôi muốn bạn dịch đồng thời mọi thứ tôi đang nói sang tiếng Hindi." Mô hình sau đó nói bản dịch trong khi bạn nói, và tiếp tục cho đến khi bạn bảo nó dừng hoặc đổi hướng. Đây là cùng mẫu hình kích hoạt bằng câu lệnh mà ChatGPT Voice đã có từ bản phát hành Realtime tháng 5/2026; điều thay đổi là cách phát song công toàn phần, cho phép bản dịch chồng lên lời nói của bạn thay vì chờ hết lượt.

Vai phiên dịch được giữ vững, điều này không hiển nhiên

Kiểu hỏng rõ ràng nhất khi bảo một mô hình hội thoại làm phiên dịch là nó trả lời người nói thay vì dịch lời họ. Điều đó đã không xảy ra. Suốt 27 phút âm thanh được phiên dịch trong các phép đo, trải trên các chiều Anh sang Tây Ban Nha, Anh sang Nhật và Trung sang Anh, nó chưa một lần nào đáp lời người nói thay vì dịch: không hỏi lại, không bình luận, không trôi về hành vi trợ lý. Khả năng tuân thủ chỉ dẫn không phải là chỗ nó hỏng.

Đánh đổi của mô hình trợ-lý-trước-tiên

GPT-Live là một trợ lý hội thoại tổng quát dịch theo yêu cầu, không phải một phiên dịch viên chuyên dụng, và hình dạng đó gây hệ quả về nhịp độ chứ không phải về sự tuân thủ. Một mô hình hội thoại nói ở tốc độ tự nhiên và không nén cũng không bỏ bớt nội dung khi nó tụt lại phía sau. Công việc phiên dịch có yêu cầu ngược lại: người nói cứ tiếp tục bất kể điều gì, nên một hệ thống không theo kịp buộc phải tóm tắt, bỏ qua, hoặc chấp nhận độ trễ không giới hạn. Trong ứng dụng người tiêu dùng, chính hành vi lời đệm khiến cuộc trò chuyện tự nhiên ("mhmm," "yeah") lại chèn âm thanh không phải bản dịch vào một phiên dịch, và người dùng ngày đầu phản ánh rộng rãi rằng điều này gây khó chịu (BigGo).

3. GPT-Live so với trình dịch chuyên dụng của OpenAI

OpenAI cung cấp hai bề mặt phiên dịch trực tiếp khác nhau, và đó là hai stack khác nhau. Ngày 7/5/2026, OpenAI phát hành gpt-realtime-translate trong Realtime API: một mô hình dịch giọng nói sang giọng nói streaming chuyên dụng, được huấn luyện trên hàng nghìn giờ âm thanh phiên dịch viên chuyên nghiệp, được cấu hình để chỉ làm dịch thuật và chờ đủ ngữ cảnh trước khi tạo giọng nói (thông báo của OpenAI). GPT-Live là trợ lý song công toàn phần đa dụng, dịch khi được yêu cầu. Cả hai nay đều mở cho nhà phát triển, nên lần đầu tiên có thể so sánh trực tiếp.

Hai bề mặt phiên dịch trực tiếp của OpenAI tính đến ngày 16/9/2026. Dữ kiện theo thông báo và tài liệu nhà phát triển của OpenAI; số liệu đo theo LiveLingo Research.
GPT-Live (gpt-live-1)gpt-realtime-translate
Bản chấtTrợ lý giọng nói song công toàn phần; dịch bằng câu lệnhMô hình dịch giọng nói sang giọng nói streaming chuyên dụng
Ngày phát hànhChatGPT 8/7/2026; API 10/9/20267/5/2026
Truy cậpỨng dụng ChatGPT cộng endpoint API /v1/live/sessionsRealtime API, endpoint /v1/realtime/translations
GiáBao gồm trong các gói ChatGPT; $0.05/phút qua API cộng chi phí mô hình nền$0.034 mỗi phút âm thanh
Ngôn ngữChưa công bố; "hầu hết các ngôn ngữ được nói nhiều," có tiết lộ về hạn chế giọngHơn 70 ngôn ngữ đầu vào; 13 ngôn ngữ đầu ra (có tài liệu)
Giữ vai phiên dịchCó khi được chỉ dẫn; không một lần rời vai trong 27 phút thử nghiệmCó; chỉ-dịch theo thiết kế, không nhận system prompt
Độ trễ hoàn tất, Anh→Tây Ban NhaTrung vị 11.72 s, tăng lên mức ổn định 10–14 sTrung vị 2.65 s, phẳng
Độ phủ tiếng Nhật trong 30 s17%98%
Bản ghi văn bảnText delta của lời nguồn và lời đầu raText delta của cả lời nguồn và lời đã dịch

13 ngôn ngữ đầu ra được ghi trong tài liệu của gpt-realtime-translate: tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Pháp, Đức, Ý, Nga, Trung, Nhật, Hàn, Hindi, Indonesia và tiếng Việt (OpenAI Cookbook). OpenAI vẫn chưa công bố danh sách ngôn ngữ của GPT-Live, nên hành vi đo được là chỉ dẫn duy nhất, và nó khác nhau rất mạnh theo ngôn ngữ.

Hai điểm đính chính từ tuần ra mắt đáng nói rõ, vì các bài đưa tin sớm làm sai lệch cả hai và nhiều bài vẫn chưa được cập nhật. Thứ nhất, các con số giá "$32 mỗi triệu token âm thanh đầu vào, $64 đầu ra" lan truyền trong một số bài viết thuộc về gpt-realtime-2, một mô hình khác, chứ không phải GPT-Live. Thứ hai, và quan trọng hơn: tuyên bố GPT-Live không có API nay đã lỗi thời. Điều đó đúng vào ngày 8/7/2026, nhưng từ ngày 10/9/2026 GPT-Live-1 đã có trên API của OpenAI dưới tên gpt-live-1 tại v1/live/sessions, giá $0.05 mỗi phút cho tầng giọng nói cộng chi phí mô hình nền tính riêng.

4. Những giới hạn được OpenAI và thử nghiệm độc lập tiết lộ

  • Độ trễ tích lũy trên giọng nói liên tục. Độ trễ hoàn tất đo được tăng từ 5.7 giây lên mức ổn định 10 đến 14 giây trong vòng ba phút ở chiều Anh sang Tây Ban Nha, rồi giữ nguyên ở đó suốt phần còn lại của phiên.
  • Tiếng Nhật suy giảm nghiêm trọng. 17% số câu được dịch trong vòng 30 giây, so với 98% của chính mô hình đó khi dịch sang tiếng Tây Ban Nha, và 20 trong 90 câu không bao giờ được dịch.
  • Giới hạn sử dụng có thật nhưng không được công bố. Trung tâm trợ giúp của OpenAI nêu rõ giới hạn sử dụng giọng nói thay đổi theo gói và tùy chọn Voice, và có thể thay đổi. Các báo cáo bên thứ ba về con số cụ thể mâu thuẫn nhau; hãy coi mọi con số cụ thể là chưa được xác minh.
  • Không có số liệu độ trễ chính thức. OpenAI phát hành các benchmark năng lực (GPQA, BrowseComp, tỷ lệ ưa thích) nhưng không có phép đo nào về âm thanh đầu tiên hay độ tụt hậu dành riêng cho dịch thuật.
  • Độ phủ ngôn ngữ không có tài liệu. "Hầu hết các ngôn ngữ được nói nhiều," với giọng không bản xứ và thiếu trôi chảy được tiết lộ cho các ngôn ngữ còn lại.
  • Lời đệm không thể tắt hẳn trong ứng dụng người tiêu dùng, dù chỉ dẫn chỉ-dịch rõ ràng được giữ không một ngoại lệ nào trong thử nghiệm qua API.
  • Giám sát an toàn có thể chen vào. Theo system card của GPT-Live, giám sát thời gian thực có thể điều hướng hoặc ngắt một phản hồi, phát một thông điệp an toàn bằng giọng nói, hoặc kết thúc các cuộc trò chuyện rủi ro cao.

5. Đo lường độc lập cho thấy gì

Chúng tôi đo gì (và không đo gì)

Các con số này lấy từ gpt-live-1 qua API của OpenAI, được ra lệnh đóng vai phiên dịch viên đồng thời, đo ngày 15/9/2026. Chúng không phải là phép đo trải nghiệm người tiêu dùng của ChatGPT: tài khoản miễn phí chạy GPT-Live-1 mini, và ứng dụng còn thêm phát hiện giọng nói phía client cùng câu lệnh riêng của nó mà không harness nào tách biệt được. Mọi hệ thống trong bảng so sánh đều nhận cùng một đoạn âm thanh với cùng nhịp thời gian thực, và dữ liệu theo từng phát ngôn được công bố tại livelingo.io/research/gpt-live-1-interpreter-test.

Độ trễ hoàn tất là thời điểm bản dịch của một câu được đọc xong, trừ đi thời điểm người nói nói xong câu đó. Một luồng liên tục dài 452 giây, 90 câu, cùng một âm thanh cho mọi hệ thống. Phương pháp luận đầy đủ: /research/gpt-live-1-interpreter-test.
Hệ thốngĐộ trễ Anh→Tây Ban NhaĐộ trễ Anh→NhậtĐộ phủ tiếng Nhật trong 30 sDiễn biến trong phiên
LiveLingo0.94 s0.88 s100%Phẳng
Gemini 3.5 Live Translate1.51 s1.92 s99%Phẳng
OpenAI gpt-realtime-translate2.65 s3.33 s98%Phẳng
GPT-Live-1 (ra lệnh bằng câu lệnh)11.72 skhông áp dụng17%Tăng lên 10–14 s

Nó không bao giờ phá vai. Suốt 27 phút âm thanh được phiên dịch, nó chưa một lần trả lời người nói thay vì dịch lời họ, ở cả hai chiều. Đó là việc thực sự khó, và các mô hình dịch chuyên dụng thậm chí không phải thử làm.

Nó tụt lại ngày một xa. Ở chiều Anh sang Tây Ban Nha, độ trễ hoàn tất tăng từ 5.7 giây ở phút đầu lên mức ổn định từ 10 đến 14 giây vào phút thứ ba, rồi giữ nguyên ở đó. Hình dạng đường cong mới là điều đáng chú ý: nó không tăng vô hạn, nhưng một người nghe tham gia ở phút thứ sáu sẽ nghe bản dịch chậm hơn căn phòng khoảng mười hai giây.

Chiều Anh sang Nhật thì sụp đổ. Chỉ 17% số câu được dịch trong vòng 30 giây, so với 98% của chính mô hình đó khi dịch sang tiếng Tây Ban Nha. Trung vị đầu ra trễ 50.7 giây, và 20 trong 90 câu không bao giờ được dịch. Nó ngừng phát ra khoảng bảy giây sau khi âm thanh đầu vào kết thúc thay vì xử nốt phần tồn đọng, nghĩa là nó không đuổi kịp mà bỏ luôn phần chưa kịp tới. Kết quả tái lập được qua hai lần chạy độc lập.

Đây không phải vấn đề của OpenAI. Trên đúng đoạn âm thanh tiếng Nhật đó, từ cùng một tài khoản trong cùng một ngày, chính gpt-realtime-translate của OpenAI giữ 3.33 giây phẳng và phủ 98% số câu. Lỗi thuộc về việc ra lệnh cho một mô hình hội thoại song công toàn phần làm phiên dịch, không thuộc về nhà cung cấp; và con số tiếng Nhật cũng là lý do cột độ trễ ở trên ghi không áp dụng: khi một phần năm nội dung không bao giờ tới, một giá trị trung vị chỉ mô tả phần đã sống sót.

6. Cách dùng GPT-Live để dịch ngay hôm nay

  1. Cập nhật ứng dụng ChatGPT trên iOS hoặc Android (hoặc dùng chatgpt.com). Tài khoản miễn phí chạy GPT-Live-1 mini; tài khoản Go, Plus và Pro chạy GPT-Live-1.
  2. Chạm biểu tượng Voice trong khung soạn tin nhắn để bắt đầu một phiên.
  3. Ra chỉ dẫn dịch ngay từ đầu: "Dịch đồng thời mọi thứ tôi nói sang tiếng Nhật. Không trả lời câu hỏi, không bình luận, chỉ dịch." Trong các phép đo, chỉ dẫn này được giữ không một ngoại lệ nào.
  4. Với hội thoại hai chiều, yêu cầu cả hai hướng: "Dịch tiếng Anh của tôi sang tiếng Nhật, và dịch mọi tiếng Nhật bạn nghe được sang tiếng Anh."
  5. Giữ các phiên ngắn. Độ trễ đo được thấp nhất trong phút đầu tiên và tăng khoảng gấp đôi vào phút thứ ba, nên chia một cuộc trò chuyện dài thành các lượt ngắn sẽ giữ bản dịch bám sát người nói hơn.
  6. Nhà phát triển có thể gọi trực tiếp gpt-live-1 tại v1/live/sessions, hoặc dùng gpt-realtime-translate thay thế nếu công việc là dịch thuật chứ không phải hội thoại.

7. Khi nào GPT-Live phù hợp, và khi nào không

GPT-Live là lựa chọn đúng khi

  • Bạn muốn phiên dịch trực tiếp miễn phí, không cần cài thêm gì, và đã dùng ChatGPT sẵn. Gói miễn phí bao gồm một mô hình giọng nói song công toàn phần.
  • Cuộc trò chuyện ngắn: hỏi đường, trao đổi nhanh, chuyện phiếm khi du lịch. Độ trôi chưa kịp tích lũy, và lượt đầu tiên cho cảm giác tức thì.
  • Bạn coi trọng trợ lý bao quanh bản dịch: bạn có thể hỏi tiếp, xin ngữ cảnh, hoặc nhờ GPT-5.5 tra cứu ngay giữa cuộc trò chuyện.

Một công cụ khác phù hợp hơn khi

  • Giọng nói là liên tục. Một cuộc họp, một bài giảng, hay một cuộc gọi mà một bên nói liền nhiều phút chính là nơi mức trễ ổn định 10 đến 14 giây trở thành toàn bộ trải nghiệm.
  • Bạn đang dịch sang tiếng Nhật, hoặc bất kỳ ngôn ngữ nào bạn chưa tự kiểm chứng hành vi. Độ phủ dao động từ 98% xuống 17% giữa hai ngôn ngữ trên cùng một mô hình.
  • Bạn cần bản ghi hai ngôn ngữ dễ đọc trong khi nghe. GPT-Live cho bạn một nhật ký chat, không phải màn hình nguồn-và-bản-dịch song song không bao giờ tự viết lại.
  • Bạn cần cuộc gọi điện thoại có phiên dịch. Không bề mặt OpenAI nào quay số điện thoại. LiveLingo thực hiện cuộc gọi đi tới số điện thoại thường với phiên dịch chạy ngay trên đường truyền, người nhận không cần ứng dụng.

Một sự thừa nhận trung thực. LiveLingo (đơn vị xuất bản hướng dẫn này) thuộc danh mục trình phiên dịch chuyên dụng, nên hãy đọc phần so sánh với điều đó trong đầu. Độ tự nhiên trong hội thoại của GPT-Live là một bước tiến thực sự, cơ chế luân phiên song công toàn phần của nó đi trước mọi ứng dụng phiên dịch chuyên dụng, kể cả của chúng tôi, gói miễn phí khiến nó là cách dễ nhất để bất kỳ ai thử phiên dịch giọng nói trực tiếp ngay hôm nay, và nó giữ vai phiên dịch suốt 27 phút không một lần sai lệch. Điều nó không làm được là bám kịp một người nói không chịu chờ. Thông số so sánh song song: /compare/chatgpt-translation. Toàn bộ số liệu đo: /research/gpt-live-1-interpreter-test. Toàn bộ danh mục dịch thuật của OpenAI: /vi/guides/openai-live-translation.

8. Câu hỏi thường gặp

GPT-Live là gì?

GPT-Live là họ mô hình giọng nói song công toàn phần của OpenAI, ra mắt trong ChatGPT ngày 8/7/2026. Hai mô hình được phát hành: GPT-Live-1 (mặc định cho các gói trả phí Go, Plus và Pro) và GPT-Live-1 mini (mặc định cho người dùng miễn phí). Khác với Advanced Voice Mode mà nó thay thế, GPT-Live nghe và nói cùng lúc, nên có thể bị ngắt lời tự nhiên, chèn lời đệm trong khi bạn nói, và phiên dịch trực tiếp ngay khi bạn còn đang nói. Nó ủy quyền các câu hỏi phức tạp cho GPT-5.5 chạy nền. Nó chạy trên iOS, Android và chatgpt.com, và từ ngày 10/9/2026 nhà phát triển cũng gọi được nó dưới tên gpt-live-1 trên API của OpenAI.

GPT-Live có dịch thời gian thực được không?

Có, và trong các phép đo nó chưa từng rời vai phiên dịch suốt 27 phút âm thanh. Dịch thuật được kích hoạt bằng câu lệnh thay vì nút chuyển chế độ: bảo trợ lý "dịch đồng thời mọi thứ tôi nói sang tiếng Nhật" và nó sẽ nói bản dịch liên tục trong khi bạn nói. Hạn chế nằm ở nhịp độ, không phải ở sự tuân thủ: độ trễ hoàn tất tăng từ 5.7 giây lên mức ổn định 10 đến 14 giây ở chiều Anh sang Tây Ban Nha trong một phiên dài 452 giây.

GPT-Live có API không?

Có, từ ngày 10/9/2026. GPT-Live-1 có sẵn dưới tên mô hình gpt-live-1 tại endpoint v1/live/sessions, giá $0.05 mỗi phút hội thoại cho tầng giọng nói, còn mô hình nền xử lý suy luận được tính phí riêng. Điều này đã thay đổi so với lần ra mắt ngày 8/7 trong ChatGPT, khi GPT-Live chỉ có trong ChatGPT. OpenAI cũng cung cấp một mô hình dịch chuyên dụng riêng, gpt-realtime-translate, giá $0.034 mỗi phút với hơn 70 ngôn ngữ đầu vào và 13 ngôn ngữ đầu ra.

GPT-Live làm bản dịch chậm đi bao nhiêu?

Đo qua API ngày 15/9/2026: trung vị 11.72 giây để hoàn tất việc đọc xong bản dịch một câu ở chiều Anh sang Tây Ban Nha, tăng dần trong phiên từ 5.7 giây ở phút đầu lên mức ổn định 10 đến 14 giây vào phút thứ ba. Trên cùng âm thanh đó, chính gpt-realtime-translate của OpenAI đo được 2.65 giây, Gemini 3.5 Live Translate 1.51 giây và LiveLingo 0.94 giây, cả ba đều phẳng suốt 452 giây thay vì trôi dần.

Vì sao GPT-Live gặp khó khi dịch sang tiếng Nhật?

Nó tụt lại xa đến mức không còn đuổi kịp. Chỉ 17% số câu tiếng Nhật được dịch trong vòng 30 giây kể từ khi nói ra, so với 98% của chính mô hình đó khi dịch sang tiếng Tây Ban Nha; trung vị đầu ra trễ 50.7 giây, và 20 trong 90 câu không bao giờ được dịch. Kết quả tái lập được qua hai lần chạy. Mô hình chuyên dụng gpt-realtime-translate của OpenAI phủ 98% ở mức 3.33 giây phẳng trên cùng âm thanh, nên đây là vấn đề riêng của việc ra lệnh cho một mô hình hội thoại làm phiên dịch, chứ không phải giới hạn tiếng Nhật của OpenAI.

GPT-Live có miễn phí không?

Trong ChatGPT thì có, với sự phân tầng. GPT-Live-1 mini là mô hình giọng nói mặc định cho tài khoản miễn phí; các gói trả phí Go, Plus và Pro dùng GPT-Live-1 lớn hơn. Không có gói đăng ký mới nào được giới thiệu, và giới hạn sử dụng giọng nói thay đổi theo gói mà không có mức trần phút được công bố. API là một đường riêng, tính theo mức dùng ở $0.05 mỗi phút cho tầng giọng nói cộng chi phí mô hình nền.

GPT-Live hỗ trợ những ngôn ngữ nào cho dịch thuật?

OpenAI chưa công bố danh sách ngôn ngữ. Tài liệu ra mắt nói giọng nói được tối ưu cho "hầu hết các ngôn ngữ được nói nhiều" và tiết lộ hạn chế về giọng và độ trôi chảy với các ngôn ngữ còn lại. Hành vi đo được khác nhau rất mạnh theo ngôn ngữ: cùng một mô hình phủ 98% số câu tiếng Tây Ban Nha trong vòng 30 giây nhưng chỉ 17% với tiếng Nhật. Mô hình dịch dành cho nhà phát triển của OpenAI, gpt-realtime-translate, ghi rõ hơn 70 ngôn ngữ đầu vào và 13 ngôn ngữ đầu ra: tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Pháp, Đức, Ý, Nga, Trung, Nhật, Hàn, Hindi, Indonesia và tiếng Việt.

GPT-Live so với Gemini Live về dịch thuật thì thế nào?

Hai cách đặt cược kiến trúc khác nhau, và giờ cả hai đều đo được. GPT-Live là trợ lý hội thoại song công toàn phần dịch theo yêu cầu. Gemini 3.5 Live Translate của Google là mô hình dịch giọng nói sang giọng nói streaming chuyên dụng. Trên cùng 452 giây âm thanh, Gemini giữ độ trễ hoàn tất phẳng ở 1.51 giây với chiều Anh sang Tây Ban Nha và 1.92 giây sang tiếng Nhật, trong khi gpt-live-1 tăng lên mức ổn định 10 đến 14 giây với tiếng Tây Ban Nha và chỉ phủ 17% số câu tiếng Nhật trong vòng 30 giây. Một đường dịch chuyên dụng giữ được độ lệch không đổi thay vì tích lũy độ trễ.

Làm sao chuyển lại Advanced Voice Mode từ GPT-Live?

Mở cài đặt giọng nói của ChatGPT và chọn Advanced Voice Mode. GPT-Live đã thay thế nó làm mặc định từ ngày 8/7/2026, nhưng OpenAI vẫn giữ chế độ cũ để chọn lại cho những người dùng cần các tính năng mà GPT-Live không hỗ trợ, như video và chia sẻ màn hình.

Làm sao để GPT-Live ngừng ngắt lời hoặc nói "mhmm"?

Bạn không thể tắt hẳn hành vi lời đệm trong ứng dụng người tiêu dùng. Cách khắc phục là ra chỉ dẫn rõ ràng ngay đầu phiên, chẳng hạn "chỉ dịch những gì tôi nói, không thêm gì khác." Trong các phép đo qua API, chỉ dẫn đó được giữ trọn vẹn, không một lần rời vai nào suốt 27 phút, nên bản thân vai phiên dịch là đáng tin cậy, dù các câu chen ngang mang tính trò chuyện vẫn có thể xuất hiện trong ChatGPT. Nếu hành vi này cản trở trường hợp sử dụng của bạn, Advanced Voice Mode vẫn có thể chọn lại trong cài đặt giọng nói.

Ngay bây giờ nên dùng công cụ nào để phiên dịch hội thoại trực tiếp?

Với các trao đổi ngắn, GPT-Live tốt và miễn phí ngay trong ChatGPT. Với giọng nói liên tục như một cuộc họp, một bài giảng hay một cuộc gọi dài, hãy dùng một đường chuyên dụng. Đo trên cùng 452 giây âm thanh, độ trễ hoàn tất là 0.94 giây với LiveLingo, 1.51 giây với Gemini 3.5 Live Translate và 2.65 giây với chính gpt-realtime-translate của OpenAI, tất cả đều phẳng, so với mức tăng dần 10 đến 14 giây của gpt-live-1 khi được ra lệnh dịch. Với cuộc gọi có phiên dịch tới số điện thoại thường, không bề mặt OpenAI nào quay số được; đó là một danh mục sản phẩm khác.

9. Nguồn

Cập nhật ngày 16/9/2026 để phản ánh việc GPT-Live-1 lên API của OpenAI ngày 10/9/2026, và để bổ sung các phép đo độc lập đầu tiên về hành vi dịch thuật của nó. Tên mô hình, phân tầng gói, endpoint và giá được đối chiếu với tài liệu nhà phát triển của OpenAI ngày 16/9/2026. Các phép đo là của mô hình trên API, không phải của trải nghiệm người tiêu dùng ChatGPT; OpenAI có thể thay đổi phân tầng, giới hạn, độ phủ ngôn ngữ và hành vi mô hình rất nhanh.

Sẵn sàng phá vỡ rào cản ngôn ngữ?

Dùng thử LiveLingo miễn phí: dịch giọng nói thời gian thực mỗi ngày, không cần thẻ tín dụng. Nâng cấp Pro để có cuộc gọi dịch thuật, ghi chú cuộc họp AI và 300 phút mỗi tháng.

Dùng thử LiveLingo miễn phí