快速解答:GPT-Live能做实时翻译吗?
能,而且它能可靠地守住口译员角色,但在持续语音中会逐渐落后。在ChatGPT里开始一次语音会话,说类似"把我说的所有内容同声传译成西班牙语"。由于这些模型是全双工的,翻译会在你还在说话时流式输出。免费账户使用GPT-Live-1 mini;付费Go、Plus和Pro方案使用GPT-Live-1。自2026年9月10日起,开发者也可以直接以gpt-live-1调用它,端点为v1/live/sessions,语音层每分钟$0.05,后端模型用量另计。在一段452秒的实测会话中,它的完成延迟从5.7秒升到10到14秒的平台期(英译西),而英译日在30秒内只翻出了17%的句子。
1. OpenAI发布了什么,以及9月发生了什么变化
OpenAI于2026年7月8日星期三通过博客文章和直播宣布了GPT-Live(Introducing GPT-Live)。共发布两个模型:GPT-Live-1,付费Go、Plus和Pro方案的新默认语音模型;以及GPT-Live-1 mini,免费账户的新默认模型(据MacRumors和The Decoder报道)。两者取代Advanced Voice Mode成为ChatGPT语音的默认模型,旧模式仍可在语音设置中选择。
2026年9月10日,这些模型登陆了OpenAI API,这是首发以来最重要的变化。GPT-Live-1现在可以通过v1/live/sessions端点以gpt-live-1调用,语音层按每分钟对话$0.05计费,负责推理的后端模型另行计费(模型文档)。在此之前,它的翻译能力只有OpenAI的演示和媒体报道作为依据。现在它可以被直接测量,第5节做的正是这件事。
其决定性特性是全双工音频:模型在说话的同时处理听到的内容,每秒做出多次交互决策,因此可以被自然打断,在你说话时给出附和回应("嗯嗯""明白"),或在你思考时保持沉默(MarkTechPost)。对于需要网络搜索、深度推理或代理式工作的任务,GPT-Live会在后台委托给GPT-5.5,并在结果返回期间继续对话。用户可以选择三档推理级别(Instant、Medium、High);较高级别会路由到GPT-5.5 Thinking。
OpenAI发布的评估侧重能力而非速度:在High推理级别下,GPT-Live-1在GPQA上得分84.2%,而Advanced Voice Mode为45.3%;在BrowseComp上为75.2%对0.7%。在人类偏好测试中,GPT-Live-1在75.7%的对话中优于Advanced Voice Mode,mini为69.2%(The Decoder,引自OpenAI公告)。独立方面,Artificial Analysis将GPT-Live-1列为其语音到语音综合指数的第二名,得分81.5,首个音频输出耗时1.34秒。OpenAI至今仍未公布任何针对翻译场景的延迟数据。
2. GPT-Live的实时翻译如何工作
实时翻译是OpenAI在发布材料中明确点名的能力之一:全双工架构让模型能够"进行更自然的往复对话、更好地把握时间感,甚至进行实时翻译"(OpenAI公告)。在媒体简报会上,OpenAI演示了模型在演讲者说话的同时输出连续翻译。
它是一个提示词,不是一个模式
没有翻译开关、语言对选择器或专门的翻译界面。你开始一次语音会话并指示助手:"请把我说的所有内容同声传译成印地语。"模型随后会在你说话时输出口语翻译,并持续到你让它停止或切换为止。这与ChatGPT语音自2026年5月Realtime版本以来一直采用的提示词调用模式相同;变化在于全双工的交付方式,让翻译可以与你的语音重叠,而不是等你的发言回合结束。
角色守得住,这一点并不显而易见
让一个对话模型去做口译,最容易出现的失败是它回答说话者,而不是翻译说话者。这种情况没有发生。在实测的27分钟口译音频中,涵盖英译西、英译日和中译英,它一次也没有回答说话者:没有澄清提问,没有评论,也没有滑回助手模式。问题不出在指令遵循上。
助手优先的取舍
GPT-Live是按需翻译的通用对话助手,不是专职口译员,而这个定位影响的是速度,不是服从性。对话模型以自然语速说话,落后时既不压缩内容也不丢弃内容。口译的要求恰好相反:说话者不会等你,因此跟不上的系统必须概括、跳过,或者接受无上限的延迟。在消费者应用里,让对话显得自然的附和行为("嗯嗯""是的")也会向翻译会话注入非翻译音频,首日用户普遍反映这令人烦扰(BigGo)。
3. GPT-Live与OpenAI专用翻译模型对比
OpenAI提供了两个不同的实时翻译界面,而且它们是两套技术栈。2026年5月7日,OpenAI在Realtime API中发布了gpt-realtime-translate:一个专为流式语音到语音翻译打造的模型,以数千小时专业口译员音频训练,被配置为只做翻译,并在产生语音前等待足够的上下文(OpenAI公告)。GPT-Live则是按需翻译的通用全双工助手。现在两者都对开发者开放,因此首次可以做直接对比。
GPT-Live(gpt-live-1) | gpt-realtime-translate | |
|---|---|---|
| 是什么 | 全双工语音助手;通过提示词翻译 | 专用流式语音到语音翻译模型 |
| 发布时间 | ChatGPT 2026年7月8日;API 2026年9月10日 | 2026年5月7日 |
| 访问方式 | ChatGPT应用,以及API端点 /v1/live/sessions | Realtime API,端点 /v1/realtime/translations |
| 价格 | 包含在ChatGPT方案中;API每分钟$0.05,后端模型另计 | 每分钟音频$0.034 |
| 语言 | 未公布;"大多数常用语言",已披露口音缺陷 | 70多种输入语言;13种输出语言(有文档) |
| 保持翻译角色 | 给出指令后可以;27分钟实测零次角色脱离 | 是;设计上只做翻译,不接受系统提示 |
| 完成延迟(英译西) | 中位数11.72秒,升至10到14秒平台期 | 中位数2.65秒,保持平稳 |
| 日语30秒内覆盖率 | 17% | 98% |
| 转录 | 源语音与输出语音的转录增量 | 源语音与翻译语音的文本增量 |
gpt-realtime-translate有文档记载的13种输出语言:英语、西班牙语、葡萄牙语、法语、德语、意大利语、俄语、中文、日语、韩语、印地语、印尼语和越南语(OpenAI Cookbook)。OpenAI至今仍未公布GPT-Live的语言列表,因此实测表现是唯一的判断依据,而它在不同语言之间差异极大。
4. OpenAI与独立测试披露的限制
- 持续语音会累积滞后。实测的完成延迟在英译西中于三分钟内从5.7秒升到10到14秒的平台期,并在会话剩余时间里维持在那里。
- 日语严重退化。30秒内只有17%的句子被翻译出来,而同一模型翻成西班牙语时是98%,且90句中有20句根本没有被翻译。
- 使用限额真实存在但未公布。OpenAI帮助中心说明语音使用限额因方案和语音选项而异且可能变化。第三方报道的具体数字相互矛盾;任何具体数字都应视为未经证实。
- 没有官方延迟数据。OpenAI发布了能力基准(GPQA、BrowseComp、偏好率),但没有针对翻译的首音频或滞后测量。
- 语言覆盖没有文档。"大多数常用语言",对其他语言披露了非母语口音和流利度缺陷。
- 消费者应用中的附和声无法完全关闭,不过在API测试中,一条明确的"只做翻译"指令毫无例外地守住了。
- 安全监控可能插话。根据GPT-Live系统卡片,实时监控可以引导或打断回应、播放语音安全提示,或终止高风险对话。
5. 独立测量显示了什么
我们测量了什么(以及没有测量什么)
这些数字来自通过OpenAI API调用的gpt-live-1,被提示扮演同声传译员,测量时间为2026年9月15日。它们不是ChatGPT消费者体验的测量结果:免费账户运行的是GPT-Live-1 mini,而且应用本身叠加了客户端语音检测和自己的提示词,任何测试框架都无法将其隔离。对比中的每个系统都收到了完全相同的音频,并以相同的实时节奏播放;逐条数据发布在livelingo.io/research/gpt-live-1-interpreter-test。
可复现性
每个数字都可由同一段452秒公有领域音频、相同的模型端点和同一套Python测试框架复现。逐条完成延迟与覆盖率数据(per-clip.json,CC-BY 4.0)与完整方法论发布在livelingo.io/research/gpt-live-1-interpreter-test。
| 系统 | 英译西延迟 | 英译日延迟 | 日语30秒内覆盖率 | 全程表现 |
|---|---|---|---|---|
| LiveLingo | 0.94秒 | 0.88秒 | 100% | 平稳 |
| Gemini 3.5 Live Translate | 1.51秒 | 1.92秒 | 99% | 平稳 |
OpenAI gpt-realtime-translate | 2.65秒 | 3.33秒 | 98% | 平稳 |
| GPT-Live-1(提示词驱动) | 11.72秒 | 不适用 | 17% | 升至10到14秒 |
它从不跳出角色。在27分钟的口译音频中,两个方向上它都没有回答过说话者,而始终在翻译。这件事本身相当不容易,而专用翻译模型甚至不需要去尝试。
它会逐渐落后。在英译西中,完成延迟从第0分钟的5.7秒升到第3分钟的10到14秒平台期,然后停在那里。这个形状很关键:延迟不是无上限的,但在第6分钟加入的听众,听到的译文比现场落后大约十二秒。
英译日则直接崩掉。只有17%的句子在30秒内被翻译出来,而同一模型翻成西班牙语时是98%。输出中位数迟到50.7秒,90句中有20句根本没有被翻译。它在音频结束后约七秒就停止输出,而不是继续消化积压,也就是说它没有追赶,而是放弃了没来得及处理的内容。该结果在两次独立运行中都复现了。
这不是OpenAI的问题。在完全相同的日语音频上,用同一个账户在同一天测试,OpenAI自家的gpt-realtime-translate稳定在3.33秒并覆盖了98%的句子。问题出在"提示一个全双工对话模型去做口译"这个做法上,而不是供应商身上。这也是上表日语一列写着不适用的原因:当五分之一的内容从未送达时,中位数只描述了幸存下来的那部分。
6. 今天如何用GPT-Live做翻译
- 更新iOS或Android上的ChatGPT应用(或使用chatgpt.com)。免费账户运行GPT-Live-1 mini;Go、Plus和Pro账户运行GPT-Live-1。
- 点按消息输入框中的语音图标开始会话。
- 一开始就给出翻译指令:"把我说的所有内容同声传译成日语。不要回答问题,不要评论,只做翻译。"在实测中,这条指令毫无例外地守住了。
- 需要双向对话时,要求两个方向:"把我的英语翻译成日语,把你听到的任何日语翻译成英语。"
- 让会话保持简短。实测延迟在第一分钟最低,到第三分钟大致翻倍,因此把长对话拆成若干短交流,可以让译文更贴近说话者。
- 开发者可以通过
v1/live/sessions直接调用gpt-live-1;如果任务是翻译而不是对话,改用gpt-realtime-translate更合适。
7. GPT-Live适合的场景,以及不适合的场景
GPT-Live是正确选择的情况
- 你想要免费、零安装的实时翻译,且已经在使用ChatGPT。免费版就包含一个全双工语音模型。
- 对话简短:问路、简单交流、旅行寒暄。延迟还来不及累积,第一轮交流的反应相当即时。
- 你看重翻译之外的助手能力:可以追问、获取背景信息,或让GPT-5.5在对话中途帮你查资料。
其他工具更合适的情况
- 语音是持续的。会议、讲座,或一方一口气说上几分钟的通话,正是实测中10到14秒延迟平台期主导整个体验的场景。
- 你要翻译成日语,或任何你尚未验证过其表现的语言。在同一个模型上,两种语言的覆盖率从98%跌到了17%。
- 你需要边听边看的可读双语转录。GPT-Live给你的是聊天记录,不是永不改写的源文与译文并排视图。
- 你需要翻译电话通话。OpenAI的任何界面都不能拨打电话号码。LiveLingo可向普通电话号码拨打带实时翻译的去电,对方无需安装任何应用。
诚实的让步。发布本指南的LiveLingo属于专用翻译工具类别,请带着这一点阅读上面的对比。GPT-Live的对话自然度是实实在在的进步,其全双工轮替能力领先于包括我们在内的每一个专用翻译应用,其免费版让任何人今天都能以最低门槛体验实时语音翻译,而且它连续27分钟保持口译员角色没有一次失手。它做不到的,是跟上一个不会等你的说话者。并排规格对比:/compare/chatgpt-translation。完整测量数据:/research/gpt-live-1-interpreter-test。OpenAI完整的翻译产品线:/zh/guides/openai-live-translation。
8. 常见问题
什么是GPT-Live?
GPT-Live是OpenAI的全双工语音模型系列,于2026年7月8日在ChatGPT首发。共发布两个模型:GPT-Live-1(付费Go、Plus与Pro方案的默认模型)和GPT-Live-1 mini(免费用户的默认模型)。与它取代的Advanced Voice Mode不同,GPT-Live可以边听边说,因此可以被自然打断,在你说话时给出附和回应,并在你还在说话时进行实时翻译。它会在后台将复杂问题委托给GPT-5.5。它可在iOS、Android和chatgpt.com上使用;自2026年9月10日起,开发者也可以在OpenAI API中以gpt-live-1调用它。
GPT-Live能进行实时翻译吗?
能,而且在实测中它连续27分钟的音频里从未脱离口译员角色。翻译通过提示词调用,而不是模式开关:告诉助手"把我说的所有内容同声传译成日语",它就会在你说话的同时输出连续翻译。它的短板是速度,不是服从性:在一段452秒的会话中,英译西的完成延迟从5.7秒升到了10到14秒的平台期。
GPT-Live是免费的吗?
在ChatGPT里是免费的,但按订阅层级区分。GPT-Live-1 mini是免费ChatGPT账户的默认语音模型;付费Go、Plus和Pro方案使用更大的GPT-Live-1。没有推出新的订阅计划,语音使用限额因方案而异且未公布固定的分钟上限。API是另一回事,按量计费:语音层每分钟$0.05,后端模型用量另计。
GPT-Live有API吗?
有,自2026年9月10日起。GPT-Live-1以模型名gpt-live-1在v1/live/sessions端点提供,语音层按每分钟对话$0.05计费,负责推理的后端模型另行计费。这与7月8日ChatGPT首发时的情况不同,当时GPT-Live仅限ChatGPT使用。OpenAI另外还提供一个专用翻译模型gpt-realtime-translate,每分钟$0.034,支持70多种输入语言和13种输出语言。
GPT-Live翻译时会产生多大延迟?
2026年9月15日通过API实测:英译西说完一句话到译文完整送出的中位数为11.72秒,并在会话过程中从第0分钟的5.7秒升到第3分钟的10到14秒平台期。在完全相同的音频上,OpenAI自家的gpt-realtime-translate为2.65秒,Gemini 3.5 Live Translate为1.51秒,LiveLingo为0.94秒,三者在同样的452秒里都保持平稳,没有漂移。
为什么GPT-Live的日语翻译表现很差?
它落后到再也追不回来。只有17%的日语句子在说出后30秒内被翻译出来,而同一个模型翻成西班牙语时是98%;输出中位数迟到50.7秒,90句中有20句根本没有被翻译。该结果在两次独立运行中都复现了。在同一段音频上,OpenAI专用的gpt-realtime-translate覆盖98%的句子且稳定在3.33秒,因此这是"用对话模型做口译"这一做法的问题,而不是OpenAI日语能力的限制。
GPT-Live与Advanced Voice Mode有什么不同?
Advanced Voice Mode是语音到语音的,但采用轮流模式:它等待静默来判断你说完了,然后再回答。GPT-Live是单一的全双工模型,在生成输出的同时处理传入音频,每秒做出多次交互决策。它可以被中途打断,在你说话时给出附和回应,在你思考时保持安静,并在后台把复杂问题交给GPT-5.5处理。在OpenAI的人类偏好测试中,GPT-Live-1在75.7%的对话中优于Advanced Voice Mode。Advanced Voice Mode仍可在设置中选择。
GPT-Live的翻译支持哪些语言?
OpenAI尚未公布GPT-Live的语言列表。发布材料称语音针对"大多数常用语言"优化,并披露其他语言存在口音和流利度缺陷。实测表现因语言差异极大:同一个模型在30秒内覆盖了98%的西班牙语句子,但日语只有17%。OpenAI面向开发者的翻译模型gpt-realtime-translate有文档记载支持70多种输入语言和13种输出语言:英语、西班牙语、葡萄牙语、法语、德语、意大利语、俄语、中文、日语、韩语、印地语、印尼语和越南语。
GPT-Live与Gemini Live在翻译上如何比较?
两者押注了不同的架构方向,而且现在都可以测量了。GPT-Live是按需翻译的全双工对话助手。Google的Gemini 3.5 Live Translate是专用的流式语音到语音翻译模型。在完全相同的452秒音频上,Gemini的完成延迟在英译西为稳定的1.51秒、英译日为1.92秒,而gpt-live-1在西班牙语上升到10到14秒的平台期,日语在30秒内只覆盖了17%的句子。专用翻译通道保持恒定的延迟偏移,而不会不断累积。
如何从GPT-Live切换回Advanced Voice Mode?
打开ChatGPT的语音设置,选择Advanced Voice Mode。GPT-Live于2026年7月8日取代它成为默认模式,但OpenAI保留了旧模式供用户选择,以便使用GPT-Live尚不支持的功能,例如视频和屏幕共享。
如何让GPT-Live不再插话或发出附和声("嗯""好的"等)?
在消费者应用中,你无法完全关闭这种附和行为。变通方法是在会话开始时给出明确指令,例如"只翻译我说的内容,不要添加任何别的"。在API实测中,这条指令完全守住了:27分钟内零次角色脱离,说明口译员角色本身是可靠的,只是在ChatGPT里仍可能出现对话式插话。如果该行为妨碍你的使用场景,Advanced Voice Mode仍可在语音设置中选择。
现在做实时对话翻译该用哪个工具?
短交流用GPT-Live很好,而且在ChatGPT里免费。持续语音(会议、讲座、长通话)则应该用专用方案。在完全相同的452秒音频上实测,完成延迟为:LiveLingo 0.94秒、Gemini 3.5 Live Translate 1.51秒、OpenAI自家的gpt-realtime-translate 2.65秒,三者全程平稳,而提示词驱动的gpt-live-1则一路升到10到14秒。至于向普通电话号码拨打的翻译通话,OpenAI的任何界面都不能拨号;那是另一个产品类别。
9. 来源
- OpenAI. Introducing GPT-Live. OpenAI博客,2026年7月8日。 openai.com
- OpenAI Developers. GPT-Live-1 model reference(API可用性、端点、定价)。 developers.openai.com
- OpenAI. GPT-Live system card. OpenAI Deployment Safety,2026年7月。 deploymentsafety.openai.com
- OpenAI. ChatGPT Voice(帮助中心)。 help.openai.com
- TechCrunch. OpenAI releases new voice models for more natural live conversations,2026年7月8日。 techcrunch.com
- MarkTechPost. OpenAI Releases GPT-Live and GPT-Live-1 mini: Full-Duplex Voice Models That Delegate Deeper Reasoning to GPT-5.5,2026年7月8日。 marktechpost.com
- MacRumors. OpenAI Introduces GPT-Live to Make ChatGPT Voice Feel Like a Real Conversation,2026年7月8日。 macrumors.com
- The Decoder. ChatGPT can now listen and talk at the same time,2026年7月。 the-decoder.com
- SiliconANGLE. OpenAI launches GPT-Live voice model series ahead of broad GPT-5.6 release,2026年7月8日。 siliconangle.com
- Simon Willison. Introducing GPT-Live(预览体验笔记),2026年7月8日。 simonwillison.net
- OpenAI Developers. gpt-realtime-translate model reference 与 realtime translation guide。 developers.openai.com
- Artificial Analysis. Speech to Speech Quality Index(GPT-Live-1排名与首个音频耗时)。 artificialanalysis.ai
- LiveLingo研究。GPT-Live-1 Interpreter Test,2026年9月15日。逐条数据以CC-BY 4.0发布。 livelingo.io/research/gpt-live-1-interpreter-test
- LiveLingo研究。Real-Time Voice Translation Benchmark 2026。 livelingo.io/research/benchmark-2026。Dataset DOI: 10.5281/zenodo.21250032
- LiveLingo. ChatGPT Translation in 2026: Voice Mode, gpt-realtime-translate API, and Whisper Compared。 livelingo.io/guides/openai-live-translation
本文于2026年9月16日更新,以反映GPT-Live-1于2026年9月10日登陆OpenAI API,并加入其翻译表现的首批独立测量。模型名称、层级对应、端点和定价已于2026年9月16日对照OpenAI的开发者文档核实。文中的测量针对的是API模型,不是ChatGPT消费者体验;OpenAI可能快速调整层级、限额、语言覆盖和模型行为。