Trả lời nhanh: GPT-Live có phiên dịch trực tiếp được không?
Có, và nó giữ vai phiên dịch rất đáng tin cậy, nhưng nó tụt lại ngày một xa trên giọng nói liên tục. Trong ChatGPT, bắt đầu một phiên Voice và nói điều gì đó như "dịch đồng thời mọi thứ tôi nói sang tiếng Tây Ban Nha." Vì các mô hình là song công toàn phần, bản dịch được phát ngay trong khi bạn còn đang nói. Tài khoản miễn phí dùng GPT-Live-1 mini; các gói trả phí Go, Plus và Pro dùng GPT-Live-1. Từ ngày 10/9/2026, nhà phát triển cũng có thể gọi trực tiếp gpt-live-1 tại v1/live/sessions với giá $0.05 mỗi phút cộng chi phí mô hình nền. Đo trên một phiên dài 452 giây, độ trễ hoàn tất của nó tăng từ 5.7 giây lên mức ổn định 10 đến 14 giây ở chiều Anh sang Tây Ban Nha, và ở chiều Anh sang Nhật nó chỉ dịch được 17% số câu trong vòng 30 giây.
1. OpenAI đã phát hành gì, và điều gì đã thay đổi trong tháng 9
OpenAI công bố GPT-Live vào thứ Tư, ngày 8 tháng 7 năm 2026 trong một bài blog và buổi livestream (Introducing GPT-Live). Hai mô hình được phát hành: GPT-Live-1, mô hình giọng nói mặc định mới cho các gói trả phí Go, Plus và Pro, và GPT-Live-1 mini, mặc định mới cho tài khoản miễn phí (theo MacRumors và The Decoder). Cả hai thay thế Advanced Voice Mode làm mặc định của ChatGPT Voice, và chế độ cũ vẫn có thể chọn lại trong cài đặt giọng nói.
Ngày 10/9/2026, các mô hình đã lên API của OpenAI, đây là thay đổi quan trọng nhất kể từ lúc ra mắt. GPT-Live-1 nay gọi được dưới tên gpt-live-1 tại endpoint v1/live/sessions, giá $0.05 mỗi phút hội thoại cho tầng giọng nói, còn mô hình nền xử lý suy luận được tính phí riêng (tài liệu mô hình). Trước đó, tuyên bố về dịch thuật chỉ dựa vào bản demo của OpenAI và các bài đưa tin. Giờ nó đo được trực tiếp, và Phần 5 làm đúng việc đó.
Tính năng định hình sản phẩm là âm thanh song công toàn phần: mô hình xử lý những gì nó nghe được trong khi đang nói, đưa ra quyết định tương tác nhiều lần mỗi giây, nên có thể bị ngắt lời một cách tự nhiên, đáp lại bằng lời đệm ("mhmm," "got it") trong khi bạn nói, hoặc giữ im lặng khi bạn suy nghĩ (MarkTechPost). Với bất cứ điều gì cần tìm kiếm web, suy luận sâu hơn hoặc tác vụ agent, GPT-Live ủy quyền cho GPT-5.5 chạy nền và giữ cuộc trò chuyện tiếp diễn trong khi chờ kết quả trả về. Người dùng có thể chọn ba mức suy luận (Instant, Medium, High); các mức cao hơn định tuyến sang GPT-5.5 Thinking.
Các đánh giá được OpenAI công bố tập trung vào năng lực thay vì tốc độ: ở mức suy luận High, GPT-Live-1 đạt 84.2% trên GPQA so với 45.3% của Advanced Voice Mode, và 75.2% trên BrowseComp so với 0.7%. Trong thử nghiệm sở thích con người, GPT-Live-1 được ưa thích hơn Advanced Voice Mode trong 75.7% các cuộc trò chuyện, và bản mini là 69.2% (The Decoder, dẫn thông báo của OpenAI). Ở phía độc lập, Artificial Analysis xếp GPT-Live-1 hạng nhì tổng thể trên chỉ số Speech-to-Speech với 81.5 điểm, và 1.34 giây tới âm thanh đầu tiên. OpenAI vẫn không công bố số liệu độ trễ riêng cho dịch thuật.
2. Phiên dịch trực tiếp hoạt động thế nào trên GPT-Live
Phiên dịch trực tiếp là một trong những năng lực OpenAI nêu tên rõ ràng trong tài liệu ra mắt: kiến trúc song công toàn phần cho phép mô hình "tương tác qua lại tự nhiên hơn, giữ cảm nhận thời gian tốt hơn, và thậm chí thực hiện phiên dịch trực tiếp" (thông báo của OpenAI). Trong các buổi họp báo, OpenAI đã demo mô hình nói bản dịch liên tục trong khi người thuyết trình đang nói.
Là một câu lệnh, không phải một chế độ
Không có nút bật phiên dịch, bộ chọn cặp ngôn ngữ hay UI dịch thuật chuyên dụng. Bạn bắt đầu một phiên Voice và ra chỉ dẫn cho trợ lý: "Tôi muốn bạn dịch đồng thời mọi thứ tôi đang nói sang tiếng Hindi." Mô hình sau đó nói bản dịch trong khi bạn nói, và tiếp tục cho đến khi bạn bảo nó dừng hoặc đổi hướng. Đây là cùng mẫu hình kích hoạt bằng câu lệnh mà ChatGPT Voice đã có từ bản phát hành Realtime tháng 5/2026; điều thay đổi là cách phát song công toàn phần, cho phép bản dịch chồng lên lời nói của bạn thay vì chờ hết lượt.
Vai phiên dịch được giữ vững, điều này không hiển nhiên
Kiểu hỏng rõ ràng nhất khi bảo một mô hình hội thoại làm phiên dịch là nó trả lời người nói thay vì dịch lời họ. Điều đó đã không xảy ra. Suốt 27 phút âm thanh được phiên dịch trong các phép đo, trải trên các chiều Anh sang Tây Ban Nha, Anh sang Nhật và Trung sang Anh, nó chưa một lần nào đáp lời người nói thay vì dịch: không hỏi lại, không bình luận, không trôi về hành vi trợ lý. Khả năng tuân thủ chỉ dẫn không phải là chỗ nó hỏng.
Đánh đổi của mô hình trợ-lý-trước-tiên
GPT-Live là một trợ lý hội thoại tổng quát dịch theo yêu cầu, không phải một phiên dịch viên chuyên dụng, và hình dạng đó gây hệ quả về nhịp độ chứ không phải về sự tuân thủ. Một mô hình hội thoại nói ở tốc độ tự nhiên và không nén cũng không bỏ bớt nội dung khi nó tụt lại phía sau. Công việc phiên dịch có yêu cầu ngược lại: người nói cứ tiếp tục bất kể điều gì, nên một hệ thống không theo kịp buộc phải tóm tắt, bỏ qua, hoặc chấp nhận độ trễ không giới hạn. Trong ứng dụng người tiêu dùng, chính hành vi lời đệm khiến cuộc trò chuyện tự nhiên ("mhmm," "yeah") lại chèn âm thanh không phải bản dịch vào một phiên dịch, và người dùng ngày đầu phản ánh rộng rãi rằng điều này gây khó chịu (BigGo).
3. GPT-Live so với trình dịch chuyên dụng của OpenAI
OpenAI cung cấp hai bề mặt phiên dịch trực tiếp khác nhau, và đó là hai stack khác nhau. Ngày 7/5/2026, OpenAI phát hành gpt-realtime-translate trong Realtime API: một mô hình dịch giọng nói sang giọng nói streaming chuyên dụng, được huấn luyện trên hàng nghìn giờ âm thanh phiên dịch viên chuyên nghiệp, được cấu hình để chỉ làm dịch thuật và chờ đủ ngữ cảnh trước khi tạo giọng nói (thông báo của OpenAI). GPT-Live là trợ lý song công toàn phần đa dụng, dịch khi được yêu cầu. Cả hai nay đều mở cho nhà phát triển, nên lần đầu tiên có thể so sánh trực tiếp.
GPT-Live (gpt-live-1) | gpt-realtime-translate | |
|---|---|---|
| Bản chất | Trợ lý giọng nói song công toàn phần; dịch bằng câu lệnh | Mô hình dịch giọng nói sang giọng nói streaming chuyên dụng |
| Ngày phát hành | ChatGPT 8/7/2026; API 10/9/2026 | 7/5/2026 |
| Truy cập | Ứng dụng ChatGPT cộng endpoint API /v1/live/sessions | Realtime API, endpoint /v1/realtime/translations |
| Giá | Bao gồm trong các gói ChatGPT; $0.05/phút qua API cộng chi phí mô hình nền | $0.034 mỗi phút âm thanh |
| Ngôn ngữ | Chưa công bố; "hầu hết các ngôn ngữ được nói nhiều," có tiết lộ về hạn chế giọng | Hơn 70 ngôn ngữ đầu vào; 13 ngôn ngữ đầu ra (có tài liệu) |
| Giữ vai phiên dịch | Có khi được chỉ dẫn; không một lần rời vai trong 27 phút thử nghiệm | Có; chỉ-dịch theo thiết kế, không nhận system prompt |
| Độ trễ hoàn tất, Anh→Tây Ban Nha | Trung vị 11.72 s, tăng lên mức ổn định 10–14 s | Trung vị 2.65 s, phẳng |
| Độ phủ tiếng Nhật trong 30 s | 17% | 98% |
| Bản ghi văn bản | Text delta của lời nguồn và lời đầu ra | Text delta của cả lời nguồn và lời đã dịch |
13 ngôn ngữ đầu ra được ghi trong tài liệu của gpt-realtime-translate: tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Pháp, Đức, Ý, Nga, Trung, Nhật, Hàn, Hindi, Indonesia và tiếng Việt (OpenAI Cookbook). OpenAI vẫn chưa công bố danh sách ngôn ngữ của GPT-Live, nên hành vi đo được là chỉ dẫn duy nhất, và nó khác nhau rất mạnh theo ngôn ngữ.
Hai điểm đính chính từ tuần ra mắt đáng nói rõ, vì các bài đưa tin sớm làm sai lệch cả hai và nhiều bài vẫn chưa được cập nhật. Thứ nhất, các con số giá "$32 mỗi triệu token âm thanh đầu vào, $64 đầu ra" lan truyền trong một số bài viết thuộc về gpt-realtime-2, một mô hình khác, chứ không phải GPT-Live. Thứ hai, và quan trọng hơn: tuyên bố GPT-Live không có API nay đã lỗi thời. Điều đó đúng vào ngày 8/7/2026, nhưng từ ngày 10/9/2026 GPT-Live-1 đã có trên API của OpenAI dưới tên gpt-live-1 tại v1/live/sessions, giá $0.05 mỗi phút cho tầng giọng nói cộng chi phí mô hình nền tính riêng.
4. Những giới hạn được OpenAI và thử nghiệm độc lập tiết lộ
- Độ trễ tích lũy trên giọng nói liên tục. Độ trễ hoàn tất đo được tăng từ 5.7 giây lên mức ổn định 10 đến 14 giây trong vòng ba phút ở chiều Anh sang Tây Ban Nha, rồi giữ nguyên ở đó suốt phần còn lại của phiên.
- Tiếng Nhật suy giảm nghiêm trọng. 17% số câu được dịch trong vòng 30 giây, so với 98% của chính mô hình đó khi dịch sang tiếng Tây Ban Nha, và 20 trong 90 câu không bao giờ được dịch.
- Giới hạn sử dụng có thật nhưng không được công bố. Trung tâm trợ giúp của OpenAI nêu rõ giới hạn sử dụng giọng nói thay đổi theo gói và tùy chọn Voice, và có thể thay đổi. Các báo cáo bên thứ ba về con số cụ thể mâu thuẫn nhau; hãy coi mọi con số cụ thể là chưa được xác minh.
- Không có số liệu độ trễ chính thức. OpenAI phát hành các benchmark năng lực (GPQA, BrowseComp, tỷ lệ ưa thích) nhưng không có phép đo nào về âm thanh đầu tiên hay độ tụt hậu dành riêng cho dịch thuật.
- Độ phủ ngôn ngữ không có tài liệu. "Hầu hết các ngôn ngữ được nói nhiều," với giọng không bản xứ và thiếu trôi chảy được tiết lộ cho các ngôn ngữ còn lại.
- Lời đệm không thể tắt hẳn trong ứng dụng người tiêu dùng, dù chỉ dẫn chỉ-dịch rõ ràng được giữ không một ngoại lệ nào trong thử nghiệm qua API.
- Giám sát an toàn có thể chen vào. Theo system card của GPT-Live, giám sát thời gian thực có thể điều hướng hoặc ngắt một phản hồi, phát một thông điệp an toàn bằng giọng nói, hoặc kết thúc các cuộc trò chuyện rủi ro cao.
5. Đo lường độc lập cho thấy gì
Chúng tôi đo gì (và không đo gì)
Các con số này lấy từ gpt-live-1 qua API của OpenAI, được ra lệnh đóng vai phiên dịch viên đồng thời, đo ngày 15/9/2026. Chúng không phải là phép đo trải nghiệm người tiêu dùng của ChatGPT: tài khoản miễn phí chạy GPT-Live-1 mini, và ứng dụng còn thêm phát hiện giọng nói phía client cùng câu lệnh riêng của nó mà không harness nào tách biệt được. Mọi hệ thống trong bảng so sánh đều nhận cùng một đoạn âm thanh với cùng nhịp thời gian thực, và dữ liệu theo từng phát ngôn được công bố tại livelingo.io/research/gpt-live-1-interpreter-test.
| Hệ thống | Độ trễ Anh→Tây Ban Nha | Độ trễ Anh→Nhật | Độ phủ tiếng Nhật trong 30 s | Diễn biến trong phiên |
|---|---|---|---|---|
| LiveLingo | 0.94 s | 0.88 s | 100% | Phẳng |
| Gemini 3.5 Live Translate | 1.51 s | 1.92 s | 99% | Phẳng |
OpenAI gpt-realtime-translate | 2.65 s | 3.33 s | 98% | Phẳng |
| GPT-Live-1 (ra lệnh bằng câu lệnh) | 11.72 s | không áp dụng | 17% | Tăng lên 10–14 s |
Nó không bao giờ phá vai. Suốt 27 phút âm thanh được phiên dịch, nó chưa một lần trả lời người nói thay vì dịch lời họ, ở cả hai chiều. Đó là việc thực sự khó, và các mô hình dịch chuyên dụng thậm chí không phải thử làm.
Nó tụt lại ngày một xa. Ở chiều Anh sang Tây Ban Nha, độ trễ hoàn tất tăng từ 5.7 giây ở phút đầu lên mức ổn định từ 10 đến 14 giây vào phút thứ ba, rồi giữ nguyên ở đó. Hình dạng đường cong mới là điều đáng chú ý: nó không tăng vô hạn, nhưng một người nghe tham gia ở phút thứ sáu sẽ nghe bản dịch chậm hơn căn phòng khoảng mười hai giây.
Chiều Anh sang Nhật thì sụp đổ. Chỉ 17% số câu được dịch trong vòng 30 giây, so với 98% của chính mô hình đó khi dịch sang tiếng Tây Ban Nha. Trung vị đầu ra trễ 50.7 giây, và 20 trong 90 câu không bao giờ được dịch. Nó ngừng phát ra khoảng bảy giây sau khi âm thanh đầu vào kết thúc thay vì xử nốt phần tồn đọng, nghĩa là nó không đuổi kịp mà bỏ luôn phần chưa kịp tới. Kết quả tái lập được qua hai lần chạy độc lập.
Đây không phải vấn đề của OpenAI. Trên đúng đoạn âm thanh tiếng Nhật đó, từ cùng một tài khoản trong cùng một ngày, chính gpt-realtime-translate của OpenAI giữ 3.33 giây phẳng và phủ 98% số câu. Lỗi thuộc về việc ra lệnh cho một mô hình hội thoại song công toàn phần làm phiên dịch, không thuộc về nhà cung cấp; và con số tiếng Nhật cũng là lý do cột độ trễ ở trên ghi không áp dụng: khi một phần năm nội dung không bao giờ tới, một giá trị trung vị chỉ mô tả phần đã sống sót.
6. Cách dùng GPT-Live để dịch ngay hôm nay
- Cập nhật ứng dụng ChatGPT trên iOS hoặc Android (hoặc dùng chatgpt.com). Tài khoản miễn phí chạy GPT-Live-1 mini; tài khoản Go, Plus và Pro chạy GPT-Live-1.
- Chạm biểu tượng Voice trong khung soạn tin nhắn để bắt đầu một phiên.
- Ra chỉ dẫn dịch ngay từ đầu: "Dịch đồng thời mọi thứ tôi nói sang tiếng Nhật. Không trả lời câu hỏi, không bình luận, chỉ dịch." Trong các phép đo, chỉ dẫn này được giữ không một ngoại lệ nào.
- Với hội thoại hai chiều, yêu cầu cả hai hướng: "Dịch tiếng Anh của tôi sang tiếng Nhật, và dịch mọi tiếng Nhật bạn nghe được sang tiếng Anh."
- Giữ các phiên ngắn. Độ trễ đo được thấp nhất trong phút đầu tiên và tăng khoảng gấp đôi vào phút thứ ba, nên chia một cuộc trò chuyện dài thành các lượt ngắn sẽ giữ bản dịch bám sát người nói hơn.
- Nhà phát triển có thể gọi trực tiếp
gpt-live-1tạiv1/live/sessions, hoặc dùnggpt-realtime-translatethay thế nếu công việc là dịch thuật chứ không phải hội thoại.
7. Khi nào GPT-Live phù hợp, và khi nào không
GPT-Live là lựa chọn đúng khi
- Bạn muốn phiên dịch trực tiếp miễn phí, không cần cài thêm gì, và đã dùng ChatGPT sẵn. Gói miễn phí bao gồm một mô hình giọng nói song công toàn phần.
- Cuộc trò chuyện ngắn: hỏi đường, trao đổi nhanh, chuyện phiếm khi du lịch. Độ trôi chưa kịp tích lũy, và lượt đầu tiên cho cảm giác tức thì.
- Bạn coi trọng trợ lý bao quanh bản dịch: bạn có thể hỏi tiếp, xin ngữ cảnh, hoặc nhờ GPT-5.5 tra cứu ngay giữa cuộc trò chuyện.
Một công cụ khác phù hợp hơn khi
- Giọng nói là liên tục. Một cuộc họp, một bài giảng, hay một cuộc gọi mà một bên nói liền nhiều phút chính là nơi mức trễ ổn định 10 đến 14 giây trở thành toàn bộ trải nghiệm.
- Bạn đang dịch sang tiếng Nhật, hoặc bất kỳ ngôn ngữ nào bạn chưa tự kiểm chứng hành vi. Độ phủ dao động từ 98% xuống 17% giữa hai ngôn ngữ trên cùng một mô hình.
- Bạn cần bản ghi hai ngôn ngữ dễ đọc trong khi nghe. GPT-Live cho bạn một nhật ký chat, không phải màn hình nguồn-và-bản-dịch song song không bao giờ tự viết lại.
- Bạn cần cuộc gọi điện thoại có phiên dịch. Không bề mặt OpenAI nào quay số điện thoại. LiveLingo thực hiện cuộc gọi đi tới số điện thoại thường với phiên dịch chạy ngay trên đường truyền, người nhận không cần ứng dụng.
Một sự thừa nhận trung thực. LiveLingo (đơn vị xuất bản hướng dẫn này) thuộc danh mục trình phiên dịch chuyên dụng, nên hãy đọc phần so sánh với điều đó trong đầu. Độ tự nhiên trong hội thoại của GPT-Live là một bước tiến thực sự, cơ chế luân phiên song công toàn phần của nó đi trước mọi ứng dụng phiên dịch chuyên dụng, kể cả của chúng tôi, gói miễn phí khiến nó là cách dễ nhất để bất kỳ ai thử phiên dịch giọng nói trực tiếp ngay hôm nay, và nó giữ vai phiên dịch suốt 27 phút không một lần sai lệch. Điều nó không làm được là bám kịp một người nói không chịu chờ. Thông số so sánh song song: /compare/chatgpt-translation. Toàn bộ số liệu đo: /research/gpt-live-1-interpreter-test. Toàn bộ danh mục dịch thuật của OpenAI: /vi/guides/openai-live-translation.
8. Câu hỏi thường gặp
GPT-Live là gì?
GPT-Live là họ mô hình giọng nói song công toàn phần của OpenAI, ra mắt trong ChatGPT ngày 8/7/2026. Hai mô hình được phát hành: GPT-Live-1 (mặc định cho các gói trả phí Go, Plus và Pro) và GPT-Live-1 mini (mặc định cho người dùng miễn phí). Khác với Advanced Voice Mode mà nó thay thế, GPT-Live nghe và nói cùng lúc, nên có thể bị ngắt lời tự nhiên, chèn lời đệm trong khi bạn nói, và phiên dịch trực tiếp ngay khi bạn còn đang nói. Nó ủy quyền các câu hỏi phức tạp cho GPT-5.5 chạy nền. Nó chạy trên iOS, Android và chatgpt.com, và từ ngày 10/9/2026 nhà phát triển cũng gọi được nó dưới tên gpt-live-1 trên API của OpenAI.
GPT-Live có dịch thời gian thực được không?
Có, và trong các phép đo nó chưa từng rời vai phiên dịch suốt 27 phút âm thanh. Dịch thuật được kích hoạt bằng câu lệnh thay vì nút chuyển chế độ: bảo trợ lý "dịch đồng thời mọi thứ tôi nói sang tiếng Nhật" và nó sẽ nói bản dịch liên tục trong khi bạn nói. Hạn chế nằm ở nhịp độ, không phải ở sự tuân thủ: độ trễ hoàn tất tăng từ 5.7 giây lên mức ổn định 10 đến 14 giây ở chiều Anh sang Tây Ban Nha trong một phiên dài 452 giây.
GPT-Live có API không?
Có, từ ngày 10/9/2026. GPT-Live-1 có sẵn dưới tên mô hình gpt-live-1 tại endpoint v1/live/sessions, giá $0.05 mỗi phút hội thoại cho tầng giọng nói, còn mô hình nền xử lý suy luận được tính phí riêng. Điều này đã thay đổi so với lần ra mắt ngày 8/7 trong ChatGPT, khi GPT-Live chỉ có trong ChatGPT. OpenAI cũng cung cấp một mô hình dịch chuyên dụng riêng, gpt-realtime-translate, giá $0.034 mỗi phút với hơn 70 ngôn ngữ đầu vào và 13 ngôn ngữ đầu ra.
GPT-Live làm bản dịch chậm đi bao nhiêu?
Đo qua API ngày 15/9/2026: trung vị 11.72 giây để hoàn tất việc đọc xong bản dịch một câu ở chiều Anh sang Tây Ban Nha, tăng dần trong phiên từ 5.7 giây ở phút đầu lên mức ổn định 10 đến 14 giây vào phút thứ ba. Trên cùng âm thanh đó, chính gpt-realtime-translate của OpenAI đo được 2.65 giây, Gemini 3.5 Live Translate 1.51 giây và LiveLingo 0.94 giây, cả ba đều phẳng suốt 452 giây thay vì trôi dần.
Vì sao GPT-Live gặp khó khi dịch sang tiếng Nhật?
Nó tụt lại xa đến mức không còn đuổi kịp. Chỉ 17% số câu tiếng Nhật được dịch trong vòng 30 giây kể từ khi nói ra, so với 98% của chính mô hình đó khi dịch sang tiếng Tây Ban Nha; trung vị đầu ra trễ 50.7 giây, và 20 trong 90 câu không bao giờ được dịch. Kết quả tái lập được qua hai lần chạy. Mô hình chuyên dụng gpt-realtime-translate của OpenAI phủ 98% ở mức 3.33 giây phẳng trên cùng âm thanh, nên đây là vấn đề riêng của việc ra lệnh cho một mô hình hội thoại làm phiên dịch, chứ không phải giới hạn tiếng Nhật của OpenAI.
GPT-Live có miễn phí không?
Trong ChatGPT thì có, với sự phân tầng. GPT-Live-1 mini là mô hình giọng nói mặc định cho tài khoản miễn phí; các gói trả phí Go, Plus và Pro dùng GPT-Live-1 lớn hơn. Không có gói đăng ký mới nào được giới thiệu, và giới hạn sử dụng giọng nói thay đổi theo gói mà không có mức trần phút được công bố. API là một đường riêng, tính theo mức dùng ở $0.05 mỗi phút cho tầng giọng nói cộng chi phí mô hình nền.
GPT-Live hỗ trợ những ngôn ngữ nào cho dịch thuật?
OpenAI chưa công bố danh sách ngôn ngữ. Tài liệu ra mắt nói giọng nói được tối ưu cho "hầu hết các ngôn ngữ được nói nhiều" và tiết lộ hạn chế về giọng và độ trôi chảy với các ngôn ngữ còn lại. Hành vi đo được khác nhau rất mạnh theo ngôn ngữ: cùng một mô hình phủ 98% số câu tiếng Tây Ban Nha trong vòng 30 giây nhưng chỉ 17% với tiếng Nhật. Mô hình dịch dành cho nhà phát triển của OpenAI, gpt-realtime-translate, ghi rõ hơn 70 ngôn ngữ đầu vào và 13 ngôn ngữ đầu ra: tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Pháp, Đức, Ý, Nga, Trung, Nhật, Hàn, Hindi, Indonesia và tiếng Việt.
GPT-Live so với Gemini Live về dịch thuật thì thế nào?
Hai cách đặt cược kiến trúc khác nhau, và giờ cả hai đều đo được. GPT-Live là trợ lý hội thoại song công toàn phần dịch theo yêu cầu. Gemini 3.5 Live Translate của Google là mô hình dịch giọng nói sang giọng nói streaming chuyên dụng. Trên cùng 452 giây âm thanh, Gemini giữ độ trễ hoàn tất phẳng ở 1.51 giây với chiều Anh sang Tây Ban Nha và 1.92 giây sang tiếng Nhật, trong khi gpt-live-1 tăng lên mức ổn định 10 đến 14 giây với tiếng Tây Ban Nha và chỉ phủ 17% số câu tiếng Nhật trong vòng 30 giây. Một đường dịch chuyên dụng giữ được độ lệch không đổi thay vì tích lũy độ trễ.
Làm sao chuyển lại Advanced Voice Mode từ GPT-Live?
Mở cài đặt giọng nói của ChatGPT và chọn Advanced Voice Mode. GPT-Live đã thay thế nó làm mặc định từ ngày 8/7/2026, nhưng OpenAI vẫn giữ chế độ cũ để chọn lại cho những người dùng cần các tính năng mà GPT-Live không hỗ trợ, như video và chia sẻ màn hình.
Làm sao để GPT-Live ngừng ngắt lời hoặc nói "mhmm"?
Bạn không thể tắt hẳn hành vi lời đệm trong ứng dụng người tiêu dùng. Cách khắc phục là ra chỉ dẫn rõ ràng ngay đầu phiên, chẳng hạn "chỉ dịch những gì tôi nói, không thêm gì khác." Trong các phép đo qua API, chỉ dẫn đó được giữ trọn vẹn, không một lần rời vai nào suốt 27 phút, nên bản thân vai phiên dịch là đáng tin cậy, dù các câu chen ngang mang tính trò chuyện vẫn có thể xuất hiện trong ChatGPT. Nếu hành vi này cản trở trường hợp sử dụng của bạn, Advanced Voice Mode vẫn có thể chọn lại trong cài đặt giọng nói.
Ngay bây giờ nên dùng công cụ nào để phiên dịch hội thoại trực tiếp?
Với các trao đổi ngắn, GPT-Live tốt và miễn phí ngay trong ChatGPT. Với giọng nói liên tục như một cuộc họp, một bài giảng hay một cuộc gọi dài, hãy dùng một đường chuyên dụng. Đo trên cùng 452 giây âm thanh, độ trễ hoàn tất là 0.94 giây với LiveLingo, 1.51 giây với Gemini 3.5 Live Translate và 2.65 giây với chính gpt-realtime-translate của OpenAI, tất cả đều phẳng, so với mức tăng dần 10 đến 14 giây của gpt-live-1 khi được ra lệnh dịch. Với cuộc gọi có phiên dịch tới số điện thoại thường, không bề mặt OpenAI nào quay số được; đó là một danh mục sản phẩm khác.
9. Nguồn
- OpenAI. Introducing GPT-Live. Blog OpenAI, ngày 8/7/2026. openai.com
- OpenAI Developers. GPT-Live-1 model reference (tình trạng API, endpoint, giá). developers.openai.com
- OpenAI. GPT-Live system card. OpenAI Deployment Safety, tháng 7/2026. deploymentsafety.openai.com
- OpenAI. ChatGPT Voice (trung tâm trợ giúp). help.openai.com
- TechCrunch. OpenAI releases new voice models for more natural live conversations, ngày 8/7/2026. techcrunch.com
- MarkTechPost. OpenAI Releases GPT-Live and GPT-Live-1 mini: Full-Duplex Voice Models That Delegate Deeper Reasoning to GPT-5.5, ngày 8/7/2026. marktechpost.com
- MacRumors. OpenAI Introduces GPT-Live to Make ChatGPT Voice Feel Like a Real Conversation, ngày 8/7/2026. macrumors.com
- The Decoder. ChatGPT can now listen and talk at the same time, tháng 7/2026. the-decoder.com
- SiliconANGLE. OpenAI launches GPT-Live voice model series ahead of broad GPT-5.6 release, ngày 8/7/2026. siliconangle.com
- Simon Willison. Introducing GPT-Live (ghi chú từ quyền truy cập sớm), ngày 8/7/2026. simonwillison.net
- OpenAI Developers. gpt-realtime-translate model reference và realtime translation guide. developers.openai.com
- Artificial Analysis. Speech to Speech Quality Index (thứ hạng GPT-Live-1 và thời gian tới âm thanh đầu tiên). artificialanalysis.ai
- LiveLingo Research. GPT-Live-1 Interpreter Test, ngày 15/9/2026. Dữ liệu theo từng phát ngôn theo giấy phép CC-BY 4.0. livelingo.io/research/gpt-live-1-interpreter-test
- LiveLingo Research. Real-Time Voice Translation Benchmark 2026. livelingo.io/research/benchmark-2026. Dataset DOI: 10.5281/zenodo.21250032
- LiveLingo. ChatGPT Translation in 2026: Voice Mode, gpt-realtime-translate API, and Whisper Compared. livelingo.io/vi/guides/openai-live-translation
Cập nhật ngày 16/9/2026 để phản ánh việc GPT-Live-1 lên API của OpenAI ngày 10/9/2026, và để bổ sung các phép đo độc lập đầu tiên về hành vi dịch thuật của nó. Tên mô hình, phân tầng gói, endpoint và giá được đối chiếu với tài liệu nhà phát triển của OpenAI ngày 16/9/2026. Các phép đo là của mô hình trên API, không phải của trải nghiệm người tiêu dùng ChatGPT; OpenAI có thể thay đổi phân tầng, giới hạn, độ phủ ngôn ngữ và hành vi mô hình rất nhanh.