LiveLingoLiveLingoTry free

GPT-Live 即時翻譯:功能、限制與實測延遲 (2026)

GPT-Live-1 與 GPT-Live-1 mini 是 OpenAI 的全雙工語音模型:它們能同時聆聽與說話,而即時翻譯是主打功能之一。兩者於 2026 年 7 月 8 日在 ChatGPT 首發,並於 2026 年 9 月 10 日進入 OpenAI API,這代表「能即時翻譯」這個說法終於可以被實測,而不只是被假設。本指南涵蓋發布的內容、翻譯實際如何運作,以及獨立測量現在對它的限制揭露了什麼。

利益衝突聲明

本指南由 LiveLingo(Lunana Global Inc.)發布,這是一款與 ChatGPT 語音翻譯競爭的語音翻譯產品。我們對 LiveLingo 的普及有經濟利益。關於 GPT-Live 的事實陳述均引用 OpenAI 的公告、系統卡與開發者文件,以及獨立的上市報導,來源皆於內文與「資料來源」章節標註連結。第 5 節的測量數據是 LiveLingo 自行完成的,透過 OpenAI API 取得,使用的音訊與給其他所有系統的完全相同;每個片段的原始資料公開於 livelingo.io/research/gpt-live-1-interpreter-test,供獨立驗證。

快速解答:GPT-Live 能做即時翻譯嗎?

能,而且它能可靠地守住口譯角色,但在持續性的語音上會逐漸落後。在 ChatGPT 裡啟動語音對話,說一句「把我說的話同步翻譯成西班牙文」即可。由於這些模型是全雙工的,翻譯會在你還在說話時就串流輸出。免費帳號使用 GPT-Live-1 mini;付費的 Go、Plus、Pro 方案使用 GPT-Live-1。自 2026 年 9 月 10 日起,開發者也能直接以 gpt-live-1 呼叫它,端點為 v1/live/sessions,語音層每分鐘 $0.05,後端模型用量另計。在一段 452 秒的實測中,它的完成延遲從 5.7 秒攀升到英轉西的 10 至 14 秒高原區;英轉日則只有 17% 的句子在 30 秒內被譯出。

1. OpenAI 發布了什麼,以及 9 月的關鍵變化

OpenAI 於 2026 年 7 月 8 日星期三,以部落格文章與直播的形式發布 GPT-Live(Introducing GPT-Live)。共推出兩個模型:GPT-Live-1,付費 Go、Plus、Pro 方案的新預設語音模型;以及 GPT-Live-1 mini,免費帳號的新預設(依據 MacRumors 與 The Decoder)。兩者皆取代進階語音模式成為 ChatGPT 語音的預設,舊模式仍可在語音設定中選用。

2026 年 9 月 10 日,這些模型進入了 OpenAI API,這是上市以來最重要的一項改變。GPT-Live-1 現在可以在 v1/live/sessions 端點以 gpt-live-1 呼叫,語音層每分鐘對話 $0.05,後端負責推理的模型另外計費(模型文件)。在那之前,「能即時翻譯」這個說法只能仰賴 OpenAI 的示範與媒體報導;現在它可以被直接測量,而第 5 節做的正是這件事。

核心特色是全雙工音訊:模型在說話的同時處理聽到的內容,每秒做出多次互動決策,因此可以被自然打斷、在你說話時以附和聲回應(「嗯哼」「了解」),或在你思考時保持安靜(MarkTechPost)。凡是需要網路搜尋、深度推理或代理工作的任務,GPT-Live 會在背景委派給 GPT-5.5,並在結果回傳的同時讓對話繼續進行。使用者可選擇三種推理層級(Instant、Medium、High);較高層級會路由至 GPT-5.5 Thinking。

OpenAI 公布的評測聚焦在能力而非速度:在 High 推理層級下,GPT-Live-1 在 GPQA 上得分 84.2%,進階語音模式為 45.3%;在 BrowseComp 上為 75.2% 對 0.7%。人類偏好測試中,GPT-Live-1 在 75.7% 的對話中勝過進階語音模式,mini 為 69.2%(The Decoder,引用 OpenAI 公告)。獨立來源方面,Artificial Analysis 在其語音轉語音(Speech-to-Speech)指數上把 GPT-Live-1 排在整體第二名,得分 81.5,首次音訊時間為 1.34 秒。OpenAI 至今仍未公布任何針對翻譯的延遲數據。

2. GPT-Live 的即時翻譯如何運作

即時翻譯是 OpenAI 在發布資料中明確點名的能力之一:全雙工架構讓模型「能進行更自然的來回對話、更準確掌握時間感,甚至進行即時翻譯」(OpenAI 公告)。在媒體簡報中,OpenAI 示範了模型在講者說話的同時說出連續翻譯。

它是提示語,不是模式

沒有翻譯開關、語言配對選擇器或專門的翻譯 UI。你啟動語音對話後直接指示助理:「請把我說的話同步翻譯成印地語。」模型便會在你說話時輸出口語翻譯,直到你叫它停止或切換為止。這與 ChatGPT 語音自 2026 年 5 月 Realtime 版本以來的提示語觸發模式相同;改變的是全雙工的輸出方式,讓翻譯可以與你的語音重疊,而不必等你這一輪講完。

角色守得住,而這並不理所當然

一個被要求做口譯的對話式模型,最明顯的失敗模式就是:它回答講者,而不是翻譯講者。這件事沒有發生。在實測的 27 分鐘口譯音訊中,涵蓋英轉西、英轉日與中轉英,它一次也沒有用回答取代翻譯:沒有澄清式提問、沒有評論、沒有滑回助理行為。指令遵循並不是它出問題的地方。

「助理優先」的取捨

GPT-Live 是一個隨需求翻譯的通用對話助理,不是專用口譯員,而這種產品形態影響的是速度,不是服從度。對話式模型以自然語速說話,落後時既不會壓縮內容,也不會捨棄內容。口譯的要求正好相反:講者不會等人,所以跟不上的系統就必須摘要、跳過,或是接受無上限的延遲。在消費者版應用程式裡,讓對話顯得自然的附和行為(「嗯哼」「對」)也會在翻譯過程中注入與翻譯無關的音訊,上市首日就有大量使用者反映附和聲造成干擾(BigGo)。

3. GPT-Live 與 OpenAI 專用翻譯模型的比較

OpenAI 提供兩個不同的即時翻譯介面,而且是不同的技術堆疊。2026 年 5 月 7 日,OpenAI 在 Realtime API 中發布 gpt-realtime-translate:一個專為串流語音轉語音翻譯打造的模型,以數千小時的專業口譯音訊訓練,設計為只做翻譯、等待足夠語境後才輸出語音(OpenAI 公告)。GPT-Live 則是被要求時才翻譯的通用全雙工助理。兩者現在都開放給開發者,因此首次有可能做直接比較。

截至 2026 年 9 月 16 日,OpenAI 的兩個即時翻譯介面。事實部分依據 OpenAI 的公告與開發者文件;測量數據依據 LiveLingo Research。
GPT-Live(gpt-live-1)gpt-realtime-translate
定位全雙工語音助理;以提示語觸發翻譯專用串流語音轉語音翻譯模型
發布日期ChatGPT 2026 年 7 月 8 日;API 2026 年 9 月 10 日2026 年 5 月 7 日
存取方式ChatGPT 應用程式,加上 API 端點 /v1/live/sessionsRealtime API,端點 /v1/realtime/translations
價格包含在 ChatGPT 方案中;API 每分鐘 $0.05 加上後端模型費用每分鐘音訊 $0.034
語言未公布;「大多數常用語言」,已揭露口音缺口70+ 種輸入語言;13 種輸出語言(有文件記載)
維持翻譯角色有明確指令時會;27 分鐘實測中零次角色破功會;設計上只做翻譯,無系統提示
完成延遲(英→西)中位數 11.72 秒,攀升至 10–14 秒高原區中位數 2.65 秒,全程平穩
日文 30 秒內涵蓋率17%98%
逐字稿來源與輸出的逐字稿增量來源與譯文語音的文字增量

gpt-realtime-translate 文件記載的 13 種輸出語言:英文、西班牙文、葡萄牙文、法文、德文、義大利文、俄文、中文、日文、韓文、印地文、印尼文與越南文(OpenAI Cookbook)。OpenAI 至今仍未公布 GPT-Live 的語言清單,因此實測行為是唯一的依據,而它在不同語言之間的差異極大。

另外值得澄清一個至今仍在流傳的誤解:GPT-Live 的 API 定價不是某些貼文所說的「每百萬音訊輸入 token $32、輸出 $64」,那組數字屬於另一個模型 gpt-realtime-2。gpt-live-1 的實際計費方式是語音層每分鐘對話 $0.05,後端模型用量另計。

4. OpenAI 與獨立測試揭露的限制

  • 持續性語音會累積延遲。實測的完成延遲在英轉西情境下,三分鐘內從 5.7 秒攀升到 10 至 14 秒的高原區,並在整段對話的剩餘時間維持在那裡。
  • 日文嚴重劣化。只有 17% 的句子在 30 秒內被譯出,而同一個模型翻成西班牙文時是 98%,且 90 個句子中有 20 句完全沒有被翻譯。
  • 使用上限確實存在但未公布。OpenAI 說明中心表示語音使用上限依方案與語音選項而異且可能調整。第三方報導的具體數字彼此矛盾;任何具體數字都應視為未經證實。
  • 沒有官方延遲數據。OpenAI 發布了能力基準(GPQA、BrowseComp、偏好率),但沒有任何針對翻譯的首次音訊或落後測量。
  • 語言覆蓋範圍沒有文件記載。「大多數常用語言」,其他語言則揭露有非母語口音與流利度不足。
  • 附和聲在消費者版應用程式裡無法完全關閉,不過在 API 測試中,一句明確的「只做翻譯」指令毫無例外地守住了。
  • 安全監控可能介入。依據 GPT-Live 系統卡,即時監控可以引導或中斷回應、播放語音安全訊息,或終止高風險對話。

5. 獨立實測揭露了什麼

我們測量了什麼(以及沒有測量什麼)

以下數字來自透過 OpenAI API 呼叫的 gpt-live-1,以提示語要求它擔任同步口譯員,測量日期為 2026 年 9 月 15 日。這些不是 ChatGPT 消費者體驗的數字:免費帳號執行的是 GPT-Live-1 mini,而應用程式本身又加上了測試工具無法隔離的用戶端語音偵測與自有提示語。比較中的每一個系統都接收完全相同的音訊,並以完全相同的即時速度播放;每個片段的原始資料公開於 livelingo.io/research/gpt-live-1-interpreter-test。

可重現性

每個數字都可以由同一段 452 秒的連續音訊、同樣的四個系統端點,以及同一套 Python 測試工具重現。每個片段的原始資料(per-clip.json)與完整方法論皆以 CC-BY 4.0 授權公開於 livelingo.io/research/gpt-live-1-interpreter-test。

「完成延遲」是指一句話的譯文完整送達的時刻,減去講者說完那句話的時刻。單一段 452 秒連續語流、90 個句子,所有系統接收完全相同的音訊。完整方法:/research/gpt-live-1-interpreter-test。
系統英→西延遲英→日延遲日文 30 秒內涵蓋率整段對話的走勢
LiveLingo0.94 秒0.88 秒100%平穩
Gemini 3.5 Live Translate1.51 秒1.92 秒99%平穩
OpenAI gpt-realtime-translate2.65 秒3.33 秒98%平穩
GPT-Live-1(提示語驅動)11.72 秒不適用17%攀升至 10–14 秒

它從不脫離角色。在 27 分鐘的口譯音訊中,它雙向都沒有出現「用回答取代翻譯」的情形。這其實相當困難,而專用翻譯模型根本不需要面對這個考驗。

它會逐漸落後。在英轉西的情境下,完成延遲從第 0 分鐘的 5.7 秒攀升到第 3 分鐘的 10 至 14 秒之間,之後就停在那裡。這個曲線的形狀很重要:延遲並非無上限,但一個在第 6 分鐘才加入的聽眾,聽到的翻譯大約落後現場十二秒。

英轉日則是崩潰。只有 17% 的句子在 30 秒內被譯出,而同一個模型翻成西班牙文時是 98%。輸出中位數晚了 50.7 秒,90 個句子中有 20 句完全沒有被翻譯。它在音訊結束後約七秒就停止輸出,而不是把積壓的內容消化完,也就是說它並沒有追上進度,而是放棄了還沒處理到的部分。這個結果在兩次獨立執行中都重現。

這不是 OpenAI 的問題。在完全相同的日文音訊上,使用同一個帳號、同一天執行,OpenAI 自家的 gpt-realtime-translate 維持平穩的 3.33 秒,涵蓋率 98%。問題出在「以提示語要求一個全雙工對話模型去做口譯」這件事本身,而不是供應商。日文那一欄的延遲之所以標示為不適用,原因也在這裡:當五分之一的內容根本沒有送達,中位數描述的就只是倖存下來的那一部分。

6. 現在如何用 GPT-Live 做翻譯

  1. 將 iOS 或 Android 上的 ChatGPT 應用程式更新至最新版本(或使用 chatgpt.com)。免費帳號執行 GPT-Live-1 mini;Go、Plus、Pro 帳號執行 GPT-Live-1。
  2. 點擊訊息輸入框中的語音圖示開始對話。
  3. 一開始就下達翻譯指令:「把我說的每句話同步翻譯成日文。不要回答問題、不要評論,只做翻譯。」在實測中,這個指令毫無例外地守住了。
  4. 要進行雙向對話,就要求雙向翻譯:「把我的英文翻譯成日文,把你聽到的日文翻譯成英文。」
  5. 把對話切短。實測延遲在第一分鐘最低,到第三分鐘大約翻倍,因此把長對話拆成數段較短的交流,可以讓翻譯更貼近講者。
  6. 開發者可以在 v1/live/sessions 直接呼叫 gpt-live-1;如果任務是翻譯而非對話,改用 gpt-realtime-translate 會更合適。

7. GPT-Live 適合與不適合的情境

GPT-Live 是正確選擇,當

  • 你想要免費、零安裝的即時翻譯,而且本來就在用 ChatGPT。免費方案就包含一個全雙工語音模型。
  • 對話很短:問路、快速交流、旅行閒聊。延遲來不及累積,而第一輪交流的反應是即時的。
  • 你重視翻譯之外的助理能力:可以追問問題、獲取背景資訊,或讓 GPT-5.5 在對話中途幫你查資料。

其他工具更合適,當

  • 語音是持續性的。會議、演講,或一方一講就是好幾分鐘的通話,正是實測中那個 10 至 14 秒延遲高原區會主宰整個體驗的場景。
  • 你要翻譯成日文,或任何你還沒驗證過其表現的語言。在同一個模型上,兩種語言的涵蓋率相差 98% 到 17%。
  • 你需要邊聽邊看可閱讀的雙語逐字稿。GPT-Live 給你的是對話紀錄,不是永不回改的來源與譯文並排畫面。
  • 你需要翻譯電話通話。OpenAI 的任何介面都無法撥打電話號碼。LiveLingo 能撥出電話到一般電話號碼並在線路上運行翻譯,對方不需要安裝任何應用程式。

誠實的讓步。發布本指南的 LiveLingo 屬於專用翻譯工具類別,請帶著這一點來看這份比較。GPT-Live 的對話自然度是真正的進步,它的全雙工輪替能力領先包括我們在內的所有專用翻譯應用程式,它的免費方案讓它成為今天任何人體驗即時語音翻譯最容易的方式,而且它在 27 分鐘內一次也沒有脫離口譯角色。它做不到的,是跟上一個不會停下來等人的講者。並排規格比較:/compare/chatgpt-translation。完整測量數據:/research/gpt-live-1-interpreter-test。

8. 常見問題

GPT-Live 是什麼?

GPT-Live 是 OpenAI 於 2026 年 7 月 8 日在 ChatGPT 首發的全雙工語音模型系列,共推出兩個模型:GPT-Live-1(付費 Go、Plus、Pro 方案的預設)與 GPT-Live-1 mini(免費用戶的預設)。與被它取代的進階語音模式不同,GPT-Live 能同時聆聽與說話,因此可以被自然打斷、在你說話時附和,並在你還在說話的同時進行即時翻譯。它會在背景把複雜問題委派給 GPT-5.5。它支援 iOS、Android 與 chatgpt.com,並且自 2026 年 9 月 10 日起,開發者也能在 OpenAI API 中以 gpt-live-1 呼叫它。

GPT-Live 可以即時翻譯嗎?

可以,而且在實測中,它在 27 分鐘的音訊裡從未脫離口譯角色。翻譯是以提示語觸發,而非模式切換:對助理說「把我說的話同步翻譯成日文」,它就會在你說話的同時說出連續的翻譯。它的限制在於速度,而不是服從度:在一段 452 秒的對話中,英轉西的完成延遲從 5.7 秒一路攀升到 10 至 14 秒的高原區。

GPT-Live 有 API 嗎?

有,自 2026 年 9 月 10 日起開放。GPT-Live-1 以模型名稱 gpt-live-1 提供,端點為 v1/live/sessions,語音層每分鐘對話 $0.05,後端負責推理的模型另外計費。這是相對於 7 月 8 日 ChatGPT 首發時的改變,當時 GPT-Live 僅限 ChatGPT 使用。OpenAI 另外還提供一個專為翻譯打造的模型 gpt-realtime-translate,每分鐘 $0.034,支援 70+ 種輸入語言與 13 種輸出語言。

GPT-Live 翻譯時會延遲多久?

於 2026 年 9 月 15 日透過 API 測量:英轉西的句子完整送達時間中位數為 11.72 秒,並在對話過程中從第 0 分鐘的 5.7 秒攀升到第 3 分鐘的 10 至 14 秒高原區。在完全相同的音訊上,OpenAI 自家的 gpt-realtime-translate 測得 2.65 秒、Gemini 3.5 Live Translate 1.51 秒、LiveLingo 0.94 秒,三者在同樣的 452 秒裡都保持平穩,不會漂移。

為什麼 GPT-Live 翻譯日文會出問題?

它落後到再也追不回來。只有 17% 的日文句子在說出後 30 秒內被翻譯出來,而同一個模型翻成西班牙文時是 98%;輸出中位數晚了 50.7 秒,90 個句子中有 20 句完全沒有被翻譯。這個結果在兩次執行中都重現。在相同音訊上,OpenAI 專用的 gpt-realtime-translate 以 3.33 秒平穩涵蓋 98% 的句子,因此這是「要求一個對話式模型去做口譯」所特有的問題,而不是 OpenAI 日文能力的限制。

GPT-Live 免費嗎?

在 ChatGPT 裡免費,但有方案區分。GPT-Live-1 mini 是免費 ChatGPT 帳號的預設語音模型;付費 Go、Plus、Pro 方案使用較大的 GPT-Live-1。沒有推出新的訂閱方案,語音使用上限依方案而異且未公布固定的分鐘數。API 則是另一回事,按量計費:語音層每分鐘 $0.05,後端模型用量另計。

GPT-Live 與進階語音模式有什麼不同?

進階語音模式是語音對語音但採輪流制:等偵測到靜音、判定你說完了才回覆。GPT-Live 是單一全雙工模型,在產生輸出的同時處理傳入音訊,每秒做出多次互動決策。它可以被半句話打斷、在你說話時附和、在你思考時保持安靜,並在背景把複雜問題交給 GPT-5.5。在 OpenAI 的人類偏好測試中,GPT-Live-1 在 75.7% 的對話中勝過進階語音模式。進階語音模式仍可在設定中選用。

GPT-Live 的翻譯支援哪些語言?

OpenAI 尚未公布 GPT-Live 的語言清單。發布資料表示語音針對「大多數常用語言」最佳化,並揭露其他語言的口音與流利度缺口。實測行為在不同語言之間差異極大:同一個模型在 30 秒內涵蓋了 98% 的西班牙文句子,日文卻只有 17%。OpenAI 面向開發者的翻譯模型 gpt-realtime-translate 文件記載 70+ 種輸入語言與 13 種輸出語言:英文、西班牙文、葡萄牙文、法文、德文、義大利文、俄文、中文、日文、韓文、印地文、印尼文與越南文。

GPT-Live 與 Gemini Live 在翻譯上如何比較?

兩者押注不同的架構路線,而且現在都可以實測。GPT-Live 是隨需求翻譯的全雙工對話助理。Google 的 Gemini 3.5 Live Translate 是專門的串流語音轉語音模型。在完全相同的 452 秒音訊上,Gemini 的完成延遲在英轉西維持平穩的 1.51 秒、英轉日 1.92 秒,而 gpt-live-1 在西班牙文攀升到 10 至 14 秒的高原區,日文則只有 17% 的句子在 30 秒內譯出。專用的翻譯路徑會維持固定的時間差,而不是持續累積延遲。

如何從 GPT-Live 切換回進階語音模式?

開啟 ChatGPT 的語音設定,選擇進階語音模式即可。GPT-Live 自 2026 年 7 月 8 日起取代它成為預設,但 OpenAI 保留了舊模式供使用者選用,因為部分功能 GPT-Live 並不支援,例如視訊與螢幕分享。

如何讓 GPT-Live 不要插話或發出附和聲(「嗯嗯」「好」等)?

在消費者版應用程式裡,附和行為無法完全關閉。可行的做法是在對話一開始明確下指令,例如「只翻譯我說的話,不要加任何其他內容」。在 API 實測中,這個指令完全奏效:27 分鐘內零次角色破功,因此口譯角色本身是可靠的,只是在 ChatGPT 裡,對話式的插話仍有可能出現。如果這個行為妨礙你的使用情境,仍可在語音設定中選用進階語音模式。

現在做即時對話翻譯,該選哪個工具?

如果只是短暫的來回交流,GPT-Live 很好用,而且在 ChatGPT 裡免費。如果是持續性的語音,例如會議、演講或長時間通話,請改用專用路徑。在完全相同的 452 秒音訊上,完成延遲為 LiveLingo 0.94 秒、Gemini 3.5 Live Translate 1.51 秒、OpenAI 自家的 gpt-realtime-translate 2.65 秒,三者全程平穩,而以提示語驅動的 gpt-live-1 則一路攀升到 10 至 14 秒。至於撥打一般電話號碼的翻譯通話,OpenAI 的任何介面都無法撥號;那是另一個產品類別。

9. 資料來源

本文於 2026 年 9 月 16 日更新,反映 GPT-Live-1 於 2026 年 9 月 10 日進入 OpenAI API,並加入其翻譯行為的首批獨立測量。模型名稱、方案對應、端點與定價均於 2026 年 9 月 16 日對照 OpenAI 的開發者文件完成核實。本文的測量針對的是 API 模型,不是 ChatGPT 消費者體驗;OpenAI 可能很快調整方案、限制、語言覆蓋範圍與模型行為。