LiveLingoLiveLingoTry free

GPT-Liveのリアルタイム翻訳:機能、制限、実測レイテンシ(2026年)

GPT-Live-1とGPT-Live-1 miniはOpenAIの全二重音声モデルです。聞くことと話すことを同時に行い、リアルタイム翻訳は目玉機能の1つに挙げられています。2026年7月8日にChatGPTでデビューし、2026年9月10日にOpenAI APIに到達したことで、翻訳能力の主張をようやく推測ではなく実測で確かめられるようになりました。本ガイドでは、何が出荷されたのか、翻訳が実際にどう動くのか、そして独立測定が明らかにした限界を解説します。

利益相反の開示

本ガイドはLiveLingo(Lunana Global Inc.)が公開しています。LiveLingoはChatGPTの音声翻訳と競合する音声翻訳製品であり、当社にはLiveLingoの普及に関する金銭的利害があります。GPT-Liveに関する事実の記述は、OpenAIの発表、システムカード、開発者文書、および独立したローンチ報道に基づき、すべて本文中と出典セクションにリンクしています。セクション5の測定値はLiveLingo自身のもので、OpenAI APIを通じて、他のすべてのシステムに与えたのと同じ音声に対して取得しました。発話ごとの生データはlivelingo.io/research/gpt-live-1-interpreter-testで公開されており、独立に検証できます。

即答:GPT-Liveはリアルタイム翻訳ができる?

できます。通訳としての役割は確実に維持されますが、連続する発話では次第に遅れが拡大します。ChatGPTでVoiceセッションを開始し、「私が話す内容をすべてスペイン語に同時通訳して」のように指示します。モデルは全二重のため、話している間に翻訳が流れます。無料アカウントはGPT-Live-1 mini、有料のGo、Plus、ProプランはGPT-Live-1です。2026年9月10日以降は、開発者がgpt-live-1をv1/live/sessionsで直接呼び出すこともできます。価格は1分あたり$0.05(音声レイヤー分)に加えてバックエンドモデルの利用料です。452秒のセッションでの実測では、訳出完了遅延が5.7秒から10〜14秒のプラトーまで拡大し(英語からスペイン語)、英語から日本語では30秒以内に訳出できた文がわずか17%でした。

1. OpenAIが出荷したもの、そして9月に変わったこと

OpenAIは2026年7月8日(水)、ブログ記事とライブ配信でGPT-Liveを発表しました(Introducing GPT-Live)。出荷されたのは2モデルです。有料のGo、Plus、Proプランの新しいデフォルト音声モデルとなるGPT-Live-1と、無料アカウントの新しいデフォルトとなるGPT-Live-1 miniです(MacRumorsおよびThe Decoder)。両モデルはAdvanced Voice Modeに代わってChatGPT Voiceのデフォルトとなり、旧モードは音声設定から引き続き選択できます。

2026年9月10日、これらのモデルがOpenAI APIに到達しました。これがローンチ以降で最も重要な変化です。GPT-Live-1は現在、v1/live/sessionsエンドポイントでgpt-live-1として呼び出せます。価格は会話1分あたり$0.05(音声レイヤー分)で、推論を担当するバックエンドモデルは別途課金されます(モデルリファレンス)。それまで翻訳能力の主張はOpenAIのデモとプレス報道に依拠するしかありませんでした。いまは直接測定でき、セクション5でまさにそれを行っています。

目玉機能は全二重(フルデュプレックス)音声です。モデルは話しながら聞いた内容を処理し、毎秒何度も対話判断を行うため、自然に割り込まれたり、ユーザーの発話中に相づち(「mhmm」「got it」)を返したり、考えている間は沈黙したりできます(MarkTechPost)。Web検索、深い推論、エージェント的な作業が必要な場合、GPT-LiveはバックグラウンドでGPT-5.5に委譲し、結果が返るまで会話を続けます。推論レベルは3段階(Instant、Medium、High)から選べ、上位レベルはGPT-5.5 Thinkingにルーティングされます。

OpenAIが公開した評価は速度ではなく能力に焦点を当てています。High推論のGPT-Live-1はGPQAで84.2%(Advanced Voice Modeは45.3%)、BrowseCompで75.2%(同0.7%)を記録。人間による選好テストでは、GPT-Live-1が75.7%、miniが69.2%の会話でAdvanced Voice Modeより好まれました(The Decoder、OpenAI発表を引用)。独立した評価としては、Artificial AnalysisがGPT-Live-1を音声間(Speech-to-Speech)インデックスで81.5点の総合2位に位置づけ、初回音声までを1.34秒としています。ただしOpenAI自身は、いまだに翻訳に特化したレイテンシ数値を公開していません。

2. GPT-Liveのリアルタイム翻訳の仕組み

リアルタイム翻訳は、OpenAIがローンチ資料で明示的に挙げた機能の1つです。全二重アーキテクチャによりモデルは「より自然なやり取りを行い、時間感覚をより良く保ち、ライブ翻訳まで実行できる」とされています(OpenAI発表)。プレス向けブリーフィングでは、発表者が話している間にモデルが翻訳を話し続けるデモが披露されました。

モードではなくプロンプトで起動

翻訳トグルも言語ペア選択も専用の翻訳UIもありません。Voiceセッションを開始し、「私が話す内容をすべてヒンディー語に同時通訳してほしい」とアシスタントに指示します。モデルは発話に合わせて翻訳音声を流し、停止や切り替えを指示するまで続けます。これは2026年5月のRealtimeリリース以降ChatGPT Voiceが持っていたプロンプト起動型と同じパターンで、変わったのは全二重の出力方式です。翻訳が話し終わりを待たず、発話に重なって流れるようになりました。

役割は崩れない、これは自明ではない

会話型モデルに通訳を指示したときの典型的な失敗は、話者の発言を訳す代わりに話者に返答してしまうことです。それは起きませんでした。実測テストでは、英語からスペイン語、英語から日本語、中国語から英語にわたる27分間の通訳音声を通じて、話者に返答してしまったことは一度もありません。確認の質問も、コメントも、アシスタント的な振る舞いへの逆戻りもありませんでした。破綻するのは指示の順守ではないのです。

アシスタント優先のトレードオフ

GPT-Liveは要求に応じて翻訳する汎用の会話アシスタントであり、専用の通訳ではありません。この形が影響するのは、指示の順守ではなくペースです。会話型モデルは自然な速度で話し、遅れたときに内容を圧縮したり省いたりしません。通訳の要件はその逆です。話者はこちらの都合に関係なく話し続けるため、追いつけないシステムは要約するか、飛ばすか、際限のない遅延を受け入れるしかありません。消費者向けアプリでは、会話を自然にする相づち(「mhmm」「yeah」)が翻訳セッションに翻訳以外の音声を混入させ、初日のユーザーはこれを煩わしいと広く報告しました(BigGo)。

3. GPT-LiveとOpenAIの専用翻訳モデルの比較

OpenAIは2つの異なるリアルタイム翻訳面を出荷しており、それらは別のスタックです。2026年5月7日、OpenAIはRealtime APIでgpt-realtime-translateをリリースしました。プロ通訳者の音声を数千時間学習した専用のストリーミング音声間翻訳モデルで、翻訳専任にとどまり、十分な文脈を待ってから発話するよう構成されています(OpenAI発表)。GPT-Liveは、求められたときに翻訳する汎用の全二重アシスタントです。両者とも開発者が利用できるようになったため、直接比較が初めて可能になりました。

2026年9月16日時点のOpenAIの2つのリアルタイム翻訳面。事実はOpenAIの発表と開発者文書、測定値はLiveLingo Researchに基づく。
GPT-Live(gpt-live-1)gpt-realtime-translate
概要全二重音声アシスタント。プロンプトで翻訳専用のストリーミング音声間翻訳モデル
リリースChatGPT版2026年7月8日、API版2026年9月10日2026年5月7日
アクセスChatGPTアプリとAPIエンドポイント/v1/live/sessionsRealtime API、エンドポイント/v1/realtime/translations
価格ChatGPTプランに含まれる。API経由は$0.05/分とバックエンドモデル利用料音声1分あたり$0.034
対応言語非公開。「主要な話し言葉」、アクセントの欠落を開示入力70以上の言語、出力13言語(文書化済み)
翻訳者役割の維持指示すれば維持。27分のテストで役割逸脱ゼロあり。設計上翻訳専任、システムプロンプトなし
訳出完了遅延(英語→スペイン語)中央値11.72秒、10〜14秒のプラトーまで拡大中央値2.65秒、横ばい
日本語の30秒以内カバレッジ17%98%
トランスクリプトソース音声と出力音声のテキストデルタソース音声と翻訳音声のテキストデルタ

gpt-realtime-translateが文書化する13の出力言語は、英語、スペイン語、ポルトガル語、フランス語、ドイツ語、イタリア語、ロシア語、中国語、日本語、韓国語、ヒンディー語、インドネシア語、ベトナム語です(OpenAI Cookbook)。OpenAIはGPT-Liveの言語リストをいまだ公開していないため、実測の挙動だけが手がかりであり、それは言語によって極端に変わります。

4. OpenAIと独立テストが開示する制限

  • 連続発話では遅延が蓄積する。英語からスペイン語では、訳出完了遅延が3分以内に5.7秒から10〜14秒のプラトーまで拡大し、セッションの残りの間そこにとどまりました。
  • 日本語は大きく劣化する。30秒以内に訳出できた文は17%で、同じモデルのスペイン語向けの98%と対照的でした。90文のうち20文はまったく訳出されませんでした。
  • 利用上限は実在するが非公開。OpenAIのヘルプセンターは、音声の利用上限はプランとVoiceオプションによって異なり変更され得ると述べています。サードパーティが報じる具体値は互いに矛盾しており、特定の数字は未検証として扱うべきです。
  • レイテンシの公表値なし。OpenAIは能力ベンチマーク(GPQA、BrowseComp、選好率)を公開しましたが、翻訳に関する初回音声や遅延の測定値は公開していません。
  • 言語カバレッジは文書化されていない。「主要な話し言葉」とされ、その他の言語では非ネイティブアクセントや流暢さの欠落が開示されています。
  • 相づちは消費者向けアプリでは完全には無効化できない。ただしAPIテストでは、翻訳専任の明示的な指示が例外なく守られました。
  • 安全性モニタリングが介入することがある。GPT-Liveシステムカードによると、リアルタイム監視が応答を誘導または中断したり、音声の安全メッセージを再生したり、高リスクの会話を終了したりできます。

5. 独立測定が示すもの

測定した対象(と測定していない対象)

以下の数値は、OpenAI API経由のgpt-live-1に同時通訳として振る舞うようプロンプトで指示し、2026年9月15日に測定したものです。ChatGPTの消費者向け体験の測定値ではありません。無料アカウントが動かすのはGPT-Live-1 miniであり、アプリ側はクライアント側の音声検出や独自のプロンプトを加えていて、どのハーネスでもそれを切り分けられないからです。比較対象のすべてのシステムには同一の音声を同一の実時間ペースで与えており、発話ごとの生データはlivelingo.io/research/gpt-live-1-interpreter-testで公開しています。

訳出完了遅延とは、ある文の翻訳が最後まで届いた時刻から、話者がその文を言い終えた時刻を引いた値。452秒の連続ストリーム1本、90文、全システムに同一音声。完全な方法論:/research/gpt-live-1-interpreter-test。
システム英語→スペイン語の遅延英語→日本語の遅延日本語の30秒以内カバレッジセッション全体の推移
LiveLingo0.94秒0.88秒100%横ばい
Gemini 3.5 Live Translate1.51秒1.92秒99%横ばい
OpenAI gpt-realtime-translate2.65秒3.33秒98%横ばい
GPT-Live-1(プロンプト指示)11.72秒測定不能17%10〜14秒まで拡大

役割は一度も崩れませんでした。27分間の通訳音声を通じて、どちらの方向でも、話者の発言を訳す代わりに話者に返答してしまうことはありませんでした。これは本当に難しいことで、専用の翻訳モデルはそもそも挑戦する必要すらありません。

次第に遅れが拡大します。英語からスペイン語では、訳出完了遅延が0分時点の5.7秒から3分時点で10〜14秒のプラトーに達し、そこにとどまりました。この形が重要です。際限なく拡大するわけではありませんが、6分目から聞き始めた人は、その場より約12秒遅れた翻訳を聞くことになります。

英語から日本語は崩壊します。30秒以内に訳出できた文はわずか17%で、同じモデルのスペイン語向けの98%と対照的でした。出力の中央値は50.7秒遅れ、90文のうち20文はまったく訳出されませんでした。音声の入力が終わった約7秒後には出力を止めており、溜まった分を吐き出そうとはしませんでした。つまり追いついたのではなく、到達できなかった部分を放棄したのです。この結果は2回の独立した実行で再現しました。

これはOpenAIの問題ではありません。同一の日本語音声に対し、同じアカウントで同じ日に、OpenAI自身のgpt-realtime-translateは3.33秒を横ばいで維持し、文の98%をカバーしました。原因はベンダーではなく、全二重の会話型モデルにプロンプトで通訳させるという構成そのものにあります。上の表で日本語の遅延欄が測定不能となっているのもこのためです。内容の5分の1が届かない状況では、中央値は生き残った部分しか説明しません。

6. 今日GPT-Liveで翻訳を使う方法

  1. iOSまたはAndroidでChatGPTアプリを更新します(またはchatgpt.comを利用)。無料アカウントはGPT-Live-1 mini、Go、Plus、ProアカウントはGPT-Live-1で動作します。
  2. メッセージ入力欄のVoiceアイコンをタップしてセッションを開始します。
  3. 最初に翻訳指示を与えます。「私が話す内容をすべて日本語に同時通訳して。質問に答えず、コメントもせず、翻訳だけして」。実測テストではこの指示が例外なく守られました。
  4. 双方向の会話には両方向を指示します。「私の英語を日本語に翻訳し、聞こえた日本語は英語に翻訳して」。
  5. セッションは短く保ちます。実測の遅延は最初の1分が最小で、3分時点でおよそ倍になります。長い会話を短いやり取りに区切れば、翻訳は話者に近いままです。
  6. 開発者はgpt-live-1をv1/live/sessionsで直接呼び出せます。目的が会話ではなく翻訳であれば、代わりにgpt-realtime-translateを使ってください。

7. GPT-Liveが適する場合、適さない場合

GPT-Liveが正しい選択となる場合

  • 無料でインストール不要のライブ翻訳が欲しく、すでにChatGPTを使っている場合。無料プランに全二重音声モデルが含まれています。
  • 会話が短い場合。道を尋ねる、ちょっとしたやり取り、旅行先の雑談。遅延が蓄積する時間がなく、最初のやり取りは即座に感じられます。
  • 翻訳の周囲にアシスタントがいることに価値を感じる場合。追加の質問をしたり、文脈を得たり、会話の途中でGPT-5.5に調べ物をさせたりできます。

別のツールの方が適する場合

  • 発話が連続する場合。会議、講義、片側が何分も話し続ける通話では、実測の10〜14秒というプラトーが体験のすべてになります。
  • 日本語に翻訳する場合、または挙動を検証していない言語に翻訳する場合。同じモデルでも、2つの言語の間でカバレッジが98%から17%まで変動しました。
  • 聞きながら読める2言語トランスクリプトが必要な場合。GPT-Liveが提供するのはチャットログであり、書き換えられることのないソースと翻訳の並列表示ではありません。
  • 翻訳付きの電話が必要な場合。OpenAIのどの面も電話番号に発信できません。LiveLingoは通常の電話番号へ発信し、回線上で翻訳を実行します。相手にアプリは不要です。

正直な譲歩。本ガイドを公開しているLiveLingoは専用翻訳カテゴリに属するので、その前提で比較を読んでください。GPT-Liveの会話の自然さは本物の進歩であり、その全二重のターンテイキングは当社を含むあらゆる専用翻訳アプリより先行しています。無料プランがあるため、今日ライブ音声翻訳を試す最も手軽な方法でもあり、27分間ただの一度も通訳の役割を崩しませんでした。できないのは、待ってくれない話者にペースを合わせることです。仕様の並列比較は/compare/chatgpt-translation、測定の全体は/research/gpt-live-1-interpreter-test、OpenAIの翻訳ラインナップ全体は/ja/guides/openai-live-translationをご覧ください。

8. よくある質問

GPT-Liveとは何ですか?

GPT-Liveは、OpenAIが2026年7月8日にChatGPTで発表した全二重音声モデルファミリーです。GPT-Live-1(有料のGo、Plus、Proプランのデフォルト)とGPT-Live-1 mini(無料ユーザーのデフォルト)の2モデルが出荷されました。置き換え対象のAdvanced Voice Modeと異なり、聞くことと話すことを同時に行うため、自然に割り込め、発話中に相づちを打ち、話している最中にリアルタイム翻訳を実行できます。複雑な質問はバックグラウンドでGPT-5.5に委譲します。iOS、Android、chatgpt.comで動作し、2026年9月10日以降は開発者向けにモデルgpt-live-1としてOpenAI APIでも利用できます。

GPT-Liveはリアルタイム翻訳ができますか?

できます。実測テストでは27分間の音声を通じて通訳の役割を一度も崩しませんでした。翻訳はモード切り替えではなくプロンプトで起動します。「私が話す内容をすべて日本語に同時通訳して」と指示すると、話している間に翻訳を音声で流し続けます。弱点は指示の順守ではなくペースです。452秒のセッションで、英語からスペイン語への訳出完了遅延が5.7秒から10〜14秒のプラトーまで拡大しました。

GPT-Liveは無料ですか?

ChatGPT内では無料で使えますが、プランによる差があります。無料のChatGPTアカウントはGPT-Live-1 miniがデフォルトで、有料のGo、Plus、Proプランは上位のGPT-Live-1です。新しいサブスクリプションは導入されておらず、音声の利用上限はプランごとに異なり、分数の上限は公開されていません。APIはこれとは別で、音声レイヤーが1分あたり$0.05、加えてバックエンドモデルの利用料が従量課金されます。

GPT-LiveにAPIはありますか?

あります。2026年9月10日以降、GPT-Live-1はモデルgpt-live-1としてエンドポイントv1/live/sessionsで利用できます。価格は会話1分あたり$0.05(音声レイヤー分)で、推論を担当するバックエンドモデルは別途課金されます。これは7月8日のChatGPTデビュー時点からの変更点で、当初GPT-LiveはChatGPT専用でした。OpenAIは別系統の翻訳専用モデルgpt-realtime-translateも提供しており、こちらは1分あたり$0.034、入力70以上の言語、出力13言語です。

GPT-Liveの翻訳はどれくらい遅れますか?

2026年9月15日にAPI経由で測定した結果、英語からスペイン語では1文の訳出を言い終えるまでの中央値が11.72秒でした。セッションの経過とともに拡大し、0分時点の5.7秒から3分時点で10〜14秒のプラトーに達します。同一音声に対して、OpenAI自身のgpt-realtime-translateは2.65秒、Gemini 3.5 Live Translateは1.51秒、LiveLingoは0.94秒で、いずれも同じ452秒の間ずっと横ばいで拡大しませんでした。

GPT-Liveはなぜ日本語への翻訳が苦手なのですか?

追いつけなくなるところまで遅れが拡大するからです。発話から30秒以内に訳出できた日本語の文はわずか17%で、同じモデルのスペイン語向けの98%と対照的でした。出力の中央値は50.7秒遅れ、90文のうち20文はまったく訳出されませんでした。この結果は2回の実行で再現しています。同じ音声に対してOpenAIの専用モデルgpt-realtime-translateは3.33秒で横ばいのまま98%をカバーしました。つまりこれはOpenAIの日本語能力の限界ではなく、会話型モデルにプロンプトで通訳させることに固有の問題です。

GPT-LiveとAdvanced Voice Modeの違いは何ですか?

Advanced Voice Modeは音声間モデルでしたがターン制で、沈黙を待って発話終了を判定してから応答しました。GPT-Liveは入力音声を処理しながら出力を生成する単一の全二重モデルで、毎秒何度も対話判断を行います。文の途中で割り込め、発話中に相づちを打ち、考えている間は沈黙し、複雑な質問はバックグラウンドでGPT-5.5に渡します。OpenAIの人間による選好テストでは、GPT-Live-1が75.7%の会話でAdvanced Voice Modeより好まれました。Advanced Voice Modeは設定から引き続き選択できます。

GPT-Liveの翻訳はどの言語に対応していますか?

OpenAIはGPT-Liveの言語リストを公開していません。ローンチ資料は「主要な話し言葉」に最適化されているとし、その他の言語でのアクセントや流暢さの欠落を開示しています。実測の挙動は言語によって大きく異なります。同じモデルがスペイン語の文の98%を30秒以内にカバーした一方、日本語は17%にとどまりました。OpenAIの開発者向け翻訳モデルgpt-realtime-translateは、入力70以上の言語と出力13言語を文書化しています。英語、スペイン語、ポルトガル語、フランス語、ドイツ語、イタリア語、ロシア語、中国語、日本語、韓国語、ヒンディー語、インドネシア語、ベトナム語です。

翻訳においてGPT-LiveとGemini Liveはどう違いますか?

アーキテクチャの賭け方が異なり、いまはどちらも測定可能です。GPT-Liveは要求に応じて翻訳する全二重の会話アシスタントです。GoogleのGemini 3.5 Live Translateは専用のストリーミング音声間翻訳モデルです。同一の452秒の音声に対して、Geminiは英語からスペイン語で1.51秒、日本語で1.92秒の訳出完了遅延を横ばいのまま維持しました。一方gpt-live-1はスペイン語で10〜14秒のプラトーまで拡大し、日本語では30秒以内に訳出できた文が17%にとどまりました。専用の翻訳経路は遅延を蓄積せず、一定のオフセットを保ちます。

GPT-LiveからAdvanced Voice Modeに戻すにはどうすればいいですか?

ChatGPTの音声設定を開き、Advanced Voice Modeを選択します。GPT-Liveは2026年7月8日にデフォルトの座を置き換えましたが、OpenAIは、ビデオや画面共有などGPT-Liveが対応していない機能を必要とするユーザーのために、旧モードを引き続き選択可能にしています。

GPT-Liveの割り込みや相槌(「うんうん」など)を止めるにはどうすればいいですか?

消費者向けアプリでは相槌の挙動を完全に無効化することはできません。回避策は、セッションの最初に「私が話した内容だけを翻訳し、他は何も加えないで」のような明示的な指示を与えることです。APIでの実測テストではこの指示が完全に守られ、27分間で役割の逸脱はゼロでした。つまり通訳という役割そのものは信頼できますが、ChatGPTでは会話的な合いの手が入る可能性は残ります。この挙動がユースケースの妨げになる場合は、Advanced Voice Modeを音声設定から引き続き選択できます。

今すぐライブ会話の翻訳に使うべきツールはどれですか?

短いやり取りなら、ChatGPT内のGPT-Liveは優秀で無料です。会議、講義、長い通話のような連続発話には専用の経路を使ってください。同一の452秒の音声での実測では、訳出完了遅延はLiveLingoが0.94秒、Gemini 3.5 Live Translateが1.51秒、OpenAI自身のgpt-realtime-translateが2.65秒で、いずれも横ばいでした。対してプロンプト指示のgpt-live-1は10〜14秒まで拡大しました。通常の電話番号への翻訳通話は、OpenAIのどの面でも発信できません。それは別の製品カテゴリです。

9. 出典

2026年9月16日に更新し、GPT-Live-1が2026年9月10日にOpenAI APIへ到達したことを反映するとともに、その翻訳挙動に関する初の独立測定を追加しました。モデル名、プラン対応、エンドポイント、価格は、2026年9月16日にOpenAIの開発者文書と照合して検証しています。測定値はAPIモデルのものであり、ChatGPTの消費者向け体験の測定値ではありません。OpenAIはプラン、上限、言語カバレッジ、モデル挙動を短期間で変更する可能性があります。