LiveLingoLiveLingoTry free

GPT-Live 实时翻译:功能、限制与实测延迟 (2026)

GPT-Live-1和GPT-Live-1 mini是OpenAI的全双工语音模型:它们边听边说,实时翻译是其头条能力之一。两者于2026年7月8日在ChatGPT首发,并于2026年9月10日登陆OpenAI API,这意味着"能做实时翻译"这个说法终于可以被测量,而不只是被假定。本指南涵盖发布了什么、翻译功能实际如何工作,以及独立测量现在揭示出的限制。

利益冲突声明

本指南由LiveLingo(Lunana Global Inc.)发布,这是一款与ChatGPT语音翻译存在竞争关系的语音翻译产品。我们对LiveLingo的推广有经济利益。关于GPT-Live的事实性陈述均来源于OpenAI的公告、系统卡片和开发者文档,以及独立的首发报道,全部在正文和来源部分标注链接。第5节的测量是LiveLingo自己做的,通过OpenAI API进行,使用的音频与提供给其他所有系统的完全相同;逐条数据发布在livelingo.io/research/gpt-live-1-interpreter-test,可供独立验证。

快速解答:GPT-Live能做实时翻译吗?

能,而且它能可靠地守住口译员角色,但在持续语音中会逐渐落后。在ChatGPT里开始一次语音会话,说类似"把我说的所有内容同声传译成西班牙语"。由于这些模型是全双工的,翻译会在你还在说话时流式输出。免费账户使用GPT-Live-1 mini;付费Go、Plus和Pro方案使用GPT-Live-1。自2026年9月10日起,开发者也可以直接以gpt-live-1调用它,端点为v1/live/sessions,语音层每分钟$0.05,后端模型用量另计。在一段452秒的实测会话中,它的完成延迟从5.7秒升到10到14秒的平台期(英译西),而英译日在30秒内只翻出了17%的句子。

1. OpenAI发布了什么,以及9月发生了什么变化

OpenAI于2026年7月8日星期三通过博客文章和直播宣布了GPT-Live(Introducing GPT-Live)。共发布两个模型:GPT-Live-1,付费Go、Plus和Pro方案的新默认语音模型;以及GPT-Live-1 mini,免费账户的新默认模型(据MacRumors和The Decoder报道)。两者取代Advanced Voice Mode成为ChatGPT语音的默认模型,旧模式仍可在语音设置中选择。

2026年9月10日,这些模型登陆了OpenAI API,这是首发以来最重要的变化。GPT-Live-1现在可以通过v1/live/sessions端点以gpt-live-1调用,语音层按每分钟对话$0.05计费,负责推理的后端模型另行计费(模型文档)。在此之前,它的翻译能力只有OpenAI的演示和媒体报道作为依据。现在它可以被直接测量,第5节做的正是这件事。

其决定性特性是全双工音频:模型在说话的同时处理听到的内容,每秒做出多次交互决策,因此可以被自然打断,在你说话时给出附和回应("嗯嗯""明白"),或在你思考时保持沉默(MarkTechPost)。对于需要网络搜索、深度推理或代理式工作的任务,GPT-Live会在后台委托给GPT-5.5,并在结果返回期间继续对话。用户可以选择三档推理级别(Instant、Medium、High);较高级别会路由到GPT-5.5 Thinking。

OpenAI发布的评估侧重能力而非速度:在High推理级别下,GPT-Live-1在GPQA上得分84.2%,而Advanced Voice Mode为45.3%;在BrowseComp上为75.2%对0.7%。在人类偏好测试中,GPT-Live-1在75.7%的对话中优于Advanced Voice Mode,mini为69.2%(The Decoder,引自OpenAI公告)。独立方面,Artificial Analysis将GPT-Live-1列为其语音到语音综合指数的第二名,得分81.5,首个音频输出耗时1.34秒。OpenAI至今仍未公布任何针对翻译场景的延迟数据。

2. GPT-Live的实时翻译如何工作

实时翻译是OpenAI在发布材料中明确点名的能力之一:全双工架构让模型能够"进行更自然的往复对话、更好地把握时间感,甚至进行实时翻译"(OpenAI公告)。在媒体简报会上,OpenAI演示了模型在演讲者说话的同时输出连续翻译。

它是一个提示词,不是一个模式

没有翻译开关、语言对选择器或专门的翻译界面。你开始一次语音会话并指示助手:"请把我说的所有内容同声传译成印地语。"模型随后会在你说话时输出口语翻译,并持续到你让它停止或切换为止。这与ChatGPT语音自2026年5月Realtime版本以来一直采用的提示词调用模式相同;变化在于全双工的交付方式,让翻译可以与你的语音重叠,而不是等你的发言回合结束。

角色守得住,这一点并不显而易见

让一个对话模型去做口译,最容易出现的失败是它回答说话者,而不是翻译说话者。这种情况没有发生。在实测的27分钟口译音频中,涵盖英译西、英译日和中译英,它一次也没有回答说话者:没有澄清提问,没有评论,也没有滑回助手模式。问题不出在指令遵循上。

助手优先的取舍

GPT-Live是按需翻译的通用对话助手,不是专职口译员,而这个定位影响的是速度,不是服从性。对话模型以自然语速说话,落后时既不压缩内容也不丢弃内容。口译的要求恰好相反:说话者不会等你,因此跟不上的系统必须概括、跳过,或者接受无上限的延迟。在消费者应用里,让对话显得自然的附和行为("嗯嗯""是的")也会向翻译会话注入非翻译音频,首日用户普遍反映这令人烦扰(BigGo)。

3. GPT-Live与OpenAI专用翻译模型对比

OpenAI提供了两个不同的实时翻译界面,而且它们是两套技术栈。2026年5月7日,OpenAI在Realtime API中发布了gpt-realtime-translate:一个专为流式语音到语音翻译打造的模型,以数千小时专业口译员音频训练,被配置为只做翻译,并在产生语音前等待足够的上下文(OpenAI公告)。GPT-Live则是按需翻译的通用全双工助手。现在两者都对开发者开放,因此首次可以做直接对比。

截至2026年9月16日OpenAI的两个实时翻译界面。事实性信息来自OpenAI的公告与开发者文档;测量数据来自LiveLingo研究。
GPT-Live(gpt-live-1)gpt-realtime-translate
是什么全双工语音助手;通过提示词翻译专用流式语音到语音翻译模型
发布时间ChatGPT 2026年7月8日;API 2026年9月10日2026年5月7日
访问方式ChatGPT应用,以及API端点 /v1/live/sessionsRealtime API,端点 /v1/realtime/translations
价格包含在ChatGPT方案中;API每分钟$0.05,后端模型另计每分钟音频$0.034
语言未公布;"大多数常用语言",已披露口音缺陷70多种输入语言;13种输出语言(有文档)
保持翻译角色给出指令后可以;27分钟实测零次角色脱离是;设计上只做翻译,不接受系统提示
完成延迟(英译西)中位数11.72秒,升至10到14秒平台期中位数2.65秒,保持平稳
日语30秒内覆盖率17%98%
转录源语音与输出语音的转录增量源语音与翻译语音的文本增量

gpt-realtime-translate有文档记载的13种输出语言:英语、西班牙语、葡萄牙语、法语、德语、意大利语、俄语、中文、日语、韩语、印地语、印尼语和越南语(OpenAI Cookbook)。OpenAI至今仍未公布GPT-Live的语言列表,因此实测表现是唯一的判断依据,而它在不同语言之间差异极大。

4. OpenAI与独立测试披露的限制

  • 持续语音会累积滞后。实测的完成延迟在英译西中于三分钟内从5.7秒升到10到14秒的平台期,并在会话剩余时间里维持在那里。
  • 日语严重退化。30秒内只有17%的句子被翻译出来,而同一模型翻成西班牙语时是98%,且90句中有20句根本没有被翻译。
  • 使用限额真实存在但未公布。OpenAI帮助中心说明语音使用限额因方案和语音选项而异且可能变化。第三方报道的具体数字相互矛盾;任何具体数字都应视为未经证实。
  • 没有官方延迟数据。OpenAI发布了能力基准(GPQA、BrowseComp、偏好率),但没有针对翻译的首音频或滞后测量。
  • 语言覆盖没有文档。"大多数常用语言",对其他语言披露了非母语口音和流利度缺陷。
  • 消费者应用中的附和声无法完全关闭,不过在API测试中,一条明确的"只做翻译"指令毫无例外地守住了。
  • 安全监控可能插话。根据GPT-Live系统卡片,实时监控可以引导或打断回应、播放语音安全提示,或终止高风险对话。

5. 独立测量显示了什么

我们测量了什么(以及没有测量什么)

这些数字来自通过OpenAI API调用的gpt-live-1,被提示扮演同声传译员,测量时间为2026年9月15日。它们不是ChatGPT消费者体验的测量结果:免费账户运行的是GPT-Live-1 mini,而且应用本身叠加了客户端语音检测和自己的提示词,任何测试框架都无法将其隔离。对比中的每个系统都收到了完全相同的音频,并以相同的实时节奏播放;逐条数据发布在livelingo.io/research/gpt-live-1-interpreter-test。

可复现性

每个数字都可由同一段452秒公有领域音频、相同的模型端点和同一套Python测试框架复现。逐条完成延迟与覆盖率数据(per-clip.json,CC-BY 4.0)与完整方法论发布在livelingo.io/research/gpt-live-1-interpreter-test。

完成延迟=一句话的译文完整送出的时刻,减去说话者说完这句话的时刻。单段452秒连续音频,90个句子,所有系统使用完全相同的音频。完整方法论:/research/gpt-live-1-interpreter-test。
系统英译西延迟英译日延迟日语30秒内覆盖率全程表现
LiveLingo0.94秒0.88秒100%平稳
Gemini 3.5 Live Translate1.51秒1.92秒99%平稳
OpenAI gpt-realtime-translate2.65秒3.33秒98%平稳
GPT-Live-1(提示词驱动)11.72秒不适用17%升至10到14秒

它从不跳出角色。在27分钟的口译音频中,两个方向上它都没有回答过说话者,而始终在翻译。这件事本身相当不容易,而专用翻译模型甚至不需要去尝试。

它会逐渐落后。在英译西中,完成延迟从第0分钟的5.7秒升到第3分钟的10到14秒平台期,然后停在那里。这个形状很关键:延迟不是无上限的,但在第6分钟加入的听众,听到的译文比现场落后大约十二秒。

英译日则直接崩掉。只有17%的句子在30秒内被翻译出来,而同一模型翻成西班牙语时是98%。输出中位数迟到50.7秒,90句中有20句根本没有被翻译。它在音频结束后约七秒就停止输出,而不是继续消化积压,也就是说它没有追赶,而是放弃了没来得及处理的内容。该结果在两次独立运行中都复现了。

这不是OpenAI的问题。在完全相同的日语音频上,用同一个账户在同一天测试,OpenAI自家的gpt-realtime-translate稳定在3.33秒并覆盖了98%的句子。问题出在"提示一个全双工对话模型去做口译"这个做法上,而不是供应商身上。这也是上表日语一列写着不适用的原因:当五分之一的内容从未送达时,中位数只描述了幸存下来的那部分。

6. 今天如何用GPT-Live做翻译

  1. 更新iOS或Android上的ChatGPT应用(或使用chatgpt.com)。免费账户运行GPT-Live-1 mini;Go、Plus和Pro账户运行GPT-Live-1。
  2. 点按消息输入框中的语音图标开始会话。
  3. 一开始就给出翻译指令:"把我说的所有内容同声传译成日语。不要回答问题,不要评论,只做翻译。"在实测中,这条指令毫无例外地守住了。
  4. 需要双向对话时,要求两个方向:"把我的英语翻译成日语,把你听到的任何日语翻译成英语。"
  5. 让会话保持简短。实测延迟在第一分钟最低,到第三分钟大致翻倍,因此把长对话拆成若干短交流,可以让译文更贴近说话者。
  6. 开发者可以通过v1/live/sessions直接调用gpt-live-1;如果任务是翻译而不是对话,改用gpt-realtime-translate更合适。

7. GPT-Live适合的场景,以及不适合的场景

GPT-Live是正确选择的情况

  • 你想要免费、零安装的实时翻译,且已经在使用ChatGPT。免费版就包含一个全双工语音模型。
  • 对话简短:问路、简单交流、旅行寒暄。延迟还来不及累积,第一轮交流的反应相当即时。
  • 你看重翻译之外的助手能力:可以追问、获取背景信息,或让GPT-5.5在对话中途帮你查资料。

其他工具更合适的情况

  • 语音是持续的。会议、讲座,或一方一口气说上几分钟的通话,正是实测中10到14秒延迟平台期主导整个体验的场景。
  • 你要翻译成日语,或任何你尚未验证过其表现的语言。在同一个模型上,两种语言的覆盖率从98%跌到了17%。
  • 你需要边听边看的可读双语转录。GPT-Live给你的是聊天记录,不是永不改写的源文与译文并排视图。
  • 你需要翻译电话通话。OpenAI的任何界面都不能拨打电话号码。LiveLingo可向普通电话号码拨打带实时翻译的去电,对方无需安装任何应用。

诚实的让步。发布本指南的LiveLingo属于专用翻译工具类别,请带着这一点阅读上面的对比。GPT-Live的对话自然度是实实在在的进步,其全双工轮替能力领先于包括我们在内的每一个专用翻译应用,其免费版让任何人今天都能以最低门槛体验实时语音翻译,而且它连续27分钟保持口译员角色没有一次失手。它做不到的,是跟上一个不会等你的说话者。并排规格对比:/compare/chatgpt-translation。完整测量数据:/research/gpt-live-1-interpreter-test。OpenAI完整的翻译产品线:/zh/guides/openai-live-translation。

8. 常见问题

什么是GPT-Live?

GPT-Live是OpenAI的全双工语音模型系列,于2026年7月8日在ChatGPT首发。共发布两个模型:GPT-Live-1(付费Go、Plus与Pro方案的默认模型)和GPT-Live-1 mini(免费用户的默认模型)。与它取代的Advanced Voice Mode不同,GPT-Live可以边听边说,因此可以被自然打断,在你说话时给出附和回应,并在你还在说话时进行实时翻译。它会在后台将复杂问题委托给GPT-5.5。它可在iOS、Android和chatgpt.com上使用;自2026年9月10日起,开发者也可以在OpenAI API中以gpt-live-1调用它。

GPT-Live能进行实时翻译吗?

能,而且在实测中它连续27分钟的音频里从未脱离口译员角色。翻译通过提示词调用,而不是模式开关:告诉助手"把我说的所有内容同声传译成日语",它就会在你说话的同时输出连续翻译。它的短板是速度,不是服从性:在一段452秒的会话中,英译西的完成延迟从5.7秒升到了10到14秒的平台期。

GPT-Live是免费的吗?

在ChatGPT里是免费的,但按订阅层级区分。GPT-Live-1 mini是免费ChatGPT账户的默认语音模型;付费Go、Plus和Pro方案使用更大的GPT-Live-1。没有推出新的订阅计划,语音使用限额因方案而异且未公布固定的分钟上限。API是另一回事,按量计费:语音层每分钟$0.05,后端模型用量另计。

GPT-Live有API吗?

有,自2026年9月10日起。GPT-Live-1以模型名gpt-live-1在v1/live/sessions端点提供,语音层按每分钟对话$0.05计费,负责推理的后端模型另行计费。这与7月8日ChatGPT首发时的情况不同,当时GPT-Live仅限ChatGPT使用。OpenAI另外还提供一个专用翻译模型gpt-realtime-translate,每分钟$0.034,支持70多种输入语言和13种输出语言。

GPT-Live翻译时会产生多大延迟?

2026年9月15日通过API实测:英译西说完一句话到译文完整送出的中位数为11.72秒,并在会话过程中从第0分钟的5.7秒升到第3分钟的10到14秒平台期。在完全相同的音频上,OpenAI自家的gpt-realtime-translate为2.65秒,Gemini 3.5 Live Translate为1.51秒,LiveLingo为0.94秒,三者在同样的452秒里都保持平稳,没有漂移。

为什么GPT-Live的日语翻译表现很差?

它落后到再也追不回来。只有17%的日语句子在说出后30秒内被翻译出来,而同一个模型翻成西班牙语时是98%;输出中位数迟到50.7秒,90句中有20句根本没有被翻译。该结果在两次独立运行中都复现了。在同一段音频上,OpenAI专用的gpt-realtime-translate覆盖98%的句子且稳定在3.33秒,因此这是"用对话模型做口译"这一做法的问题,而不是OpenAI日语能力的限制。

GPT-Live与Advanced Voice Mode有什么不同?

Advanced Voice Mode是语音到语音的,但采用轮流模式:它等待静默来判断你说完了,然后再回答。GPT-Live是单一的全双工模型,在生成输出的同时处理传入音频,每秒做出多次交互决策。它可以被中途打断,在你说话时给出附和回应,在你思考时保持安静,并在后台把复杂问题交给GPT-5.5处理。在OpenAI的人类偏好测试中,GPT-Live-1在75.7%的对话中优于Advanced Voice Mode。Advanced Voice Mode仍可在设置中选择。

GPT-Live的翻译支持哪些语言?

OpenAI尚未公布GPT-Live的语言列表。发布材料称语音针对"大多数常用语言"优化,并披露其他语言存在口音和流利度缺陷。实测表现因语言差异极大:同一个模型在30秒内覆盖了98%的西班牙语句子,但日语只有17%。OpenAI面向开发者的翻译模型gpt-realtime-translate有文档记载支持70多种输入语言和13种输出语言:英语、西班牙语、葡萄牙语、法语、德语、意大利语、俄语、中文、日语、韩语、印地语、印尼语和越南语。

GPT-Live与Gemini Live在翻译上如何比较?

两者押注了不同的架构方向,而且现在都可以测量了。GPT-Live是按需翻译的全双工对话助手。Google的Gemini 3.5 Live Translate是专用的流式语音到语音翻译模型。在完全相同的452秒音频上,Gemini的完成延迟在英译西为稳定的1.51秒、英译日为1.92秒,而gpt-live-1在西班牙语上升到10到14秒的平台期,日语在30秒内只覆盖了17%的句子。专用翻译通道保持恒定的延迟偏移,而不会不断累积。

如何从GPT-Live切换回Advanced Voice Mode?

打开ChatGPT的语音设置,选择Advanced Voice Mode。GPT-Live于2026年7月8日取代它成为默认模式,但OpenAI保留了旧模式供用户选择,以便使用GPT-Live尚不支持的功能,例如视频和屏幕共享。

如何让GPT-Live不再插话或发出附和声("嗯""好的"等)?

在消费者应用中,你无法完全关闭这种附和行为。变通方法是在会话开始时给出明确指令,例如"只翻译我说的内容,不要添加任何别的"。在API实测中,这条指令完全守住了:27分钟内零次角色脱离,说明口译员角色本身是可靠的,只是在ChatGPT里仍可能出现对话式插话。如果该行为妨碍你的使用场景,Advanced Voice Mode仍可在语音设置中选择。

现在做实时对话翻译该用哪个工具?

短交流用GPT-Live很好,而且在ChatGPT里免费。持续语音(会议、讲座、长通话)则应该用专用方案。在完全相同的452秒音频上实测,完成延迟为:LiveLingo 0.94秒、Gemini 3.5 Live Translate 1.51秒、OpenAI自家的gpt-realtime-translate 2.65秒,三者全程平稳,而提示词驱动的gpt-live-1则一路升到10到14秒。至于向普通电话号码拨打的翻译通话,OpenAI的任何界面都不能拨号;那是另一个产品类别。

9. 来源

本文于2026年9月16日更新,以反映GPT-Live-1于2026年9月10日登陆OpenAI API,并加入其翻译表现的首批独立测量。模型名称、层级对应、端点和定价已于2026年9月16日对照OpenAI的开发者文档核实。文中的测量针对的是API模型,不是ChatGPT消费者体验;OpenAI可能快速调整层级、限额、语言覆盖和模型行为。