Краткий ответ: умеет ли GPT-Live переводить в реальном времени?
Да, и роль переводчика она удерживает надёжно, но на непрерывной речи постепенно отстаёт. В ChatGPT запустите голосовую сессию и скажите что-то вроде «синхронно переводи всё, что я говорю, на испанский». Поскольку модели полнодуплексные, перевод звучит, пока вы ещё говорите. Бесплатные аккаунты получают GPT-Live-1 mini; платные тарифы Go, Plus и Pro получают GPT-Live-1. С 10 сентября 2026 года разработчики могут вызывать её напрямую как gpt-live-1 на эндпоинте v1/live/sessions за $0.05 за минуту плюс оплата backend-модели. На сессии длиной 452 секунды задержка завершения выросла с 5,7 секунды до плато в 10-14 секунд при переводе с английского на испанский, а с английского на японский модель перевела лишь 17% фраз в пределах 30 секунд.
1. Что выпустила OpenAI и что изменилось в сентябре
OpenAI анонсировала GPT-Live в среду, 8 июля 2026 года, в блог-посте и прямой трансляции (Introducing GPT-Live). Вышли две модели: GPT-Live-1, новая голосовая модель по умолчанию для платных тарифов Go, Plus и Pro, и GPT-Live-1 mini, новая модель по умолчанию для бесплатных аккаунтов (по данным MacRumors и The Decoder). Обе заменяют Advanced Voice Mode в качестве голосового режима ChatGPT по умолчанию; старый режим остаётся доступным в настройках голоса.
10 сентября 2026 года модели появились в API OpenAI, и это самое важное изменение со времени запуска. GPT-Live-1 теперь вызывается как gpt-live-1 на эндпоинте v1/live/sessions по цене $0.05 за минуту разговора за голосовой слой, а backend-модель, которая отвечает за рассуждения, тарифицируется отдельно (справка по модели). До этого заявление о переводе опиралось только на демонстрацию OpenAI и публикации в прессе. Теперь его можно измерить напрямую, и раздел 5 делает именно это.
Определяющая функция, полнодуплексное аудио: модель обрабатывает то, что слышит, прямо во время собственной речи, принимая решения о взаимодействии много раз в секунду. Поэтому её можно естественно перебить, она отвечает короткими репликами («мгм», «понял»), пока вы говорите, или молчит, пока вы думаете (MarkTechPost). Всё, что требует веб-поиска, глубоких рассуждений или агентной работы, GPT-Live делегирует GPT-5.5 в фоне и продолжает разговор, пока приходит результат. Пользователи могут выбрать три уровня рассуждений (Instant, Medium, High); высокие уровни направляются в GPT-5.5 Thinking.
Опубликованные оценки OpenAI сосредоточены на способностях, а не на скорости: на уровне High GPT-Live-1 набирает 84.2% на GPQA против 45.3% у Advanced Voice Mode и 75.2% на BrowseComp против 0.7%. В тестах человеческих предпочтений GPT-Live-1 выбирали вместо Advanced Voice Mode в 75.7% разговоров, а mini в 69.2% (The Decoder со ссылкой на анонс OpenAI). Независимо от этого Artificial Analysis ставит GPT-Live-1 на второе место в своём индексе «речь в речь» с оценкой 81.5 и 1,34 секунды до первого аудио. Цифр задержки именно для перевода OpenAI по-прежнему не публикует.
2. Как работает перевод в реальном времени в GPT-Live
Синхронный перевод, одна из возможностей, которые OpenAI прямо называет в материалах запуска: полнодуплексная архитектура позволяет модели «вести более естественный диалог, лучше чувствовать время и даже выполнять перевод в реальном времени» (анонс OpenAI). На пресс-брифингах OpenAI демонстрировала, как модель произносит непрерывный перевод, пока ведущий говорит.
Это команда, а не режим
Здесь нет переключателя переводчика, выбора языковой пары или отдельного интерфейса перевода. Вы запускаете голосовую сессию и даёте ассистенту инструкцию: «Синхронно переводи всё, что я говорю, на хинди». Дальше модель произносит перевод по мере вашей речи и продолжает, пока вы не скажете остановиться или переключиться. Это тот же паттерн вызова через команду, который был у ChatGPT Voice со времён майского релиза Realtime 2026 года; изменилась полнодуплексная подача: перевод теперь накладывается на вашу речь, а не ждёт конца вашей реплики.
Роль удерживается, и это не самоочевидно
Очевидный сценарий отказа для разговорной модели, которой велели переводить, состоит в том, что она отвечает говорящему вместо перевода. Этого не произошло. За 27 минут переведённого аудио в измерениях, охвативших пары английский-испанский, английский-японский и китайский-английский, она ни разу не ответила говорящему вместо перевода: ни уточняющих вопросов, ни комментариев, ни сползания обратно в поведение ассистента. Ломается здесь не следование инструкции.
Компромисс «ассистент прежде всего»
GPT-Live, универсальный разговорный ассистент, который переводит по запросу, а не специализированный переводчик, и последствия у такой формы касаются темпа, а не послушания. Разговорная модель говорит в естественном темпе и, отставая, не сжимает и не отбрасывает содержание. У синхронного перевода требование обратное: говорящий продолжает независимо ни от чего, поэтому система, которая не успевает, вынуждена резюмировать, пропускать или мириться с неограниченным отставанием. В потребительском приложении короткие реплики, которые делают разговор естественным («мгм», «ага»), к тому же добавляют в сессию перевода постороннее аудио, и пользователи первого дня массово называли их навязчивыми (BigGo).
3. GPT-Live против специализированного переводчика OpenAI
У OpenAI две разные поверхности перевода в реальном времени, и это разные стеки. 7 мая 2026 года OpenAI выпустила gpt-realtime-translate в Realtime API: специализированную потоковую модель перевода речи в речь, обученную на тысячах часов аудио профессиональных переводчиков-синхронистов и настроенную оставаться только переводчиком и ждать достаточного контекста перед генерацией речи (анонс OpenAI). GPT-Live, универсальный полнодуплексный ассистент, который переводит по запросу. Обе теперь доступны разработчикам, и это впервые делает возможным прямое сравнение.
GPT-Live (gpt-live-1) | gpt-realtime-translate | |
|---|---|---|
| Что это | Полнодуплексный голосовой ассистент; перевод по команде | Специализированная потоковая модель перевода речи в речь |
| Дата выпуска | ChatGPT 8 июля 2026; API 10 сентября 2026 | 7 мая 2026 |
| Доступ | Приложение ChatGPT плюс эндпоинт API /v1/live/sessions | Realtime API, эндпоинт /v1/realtime/translations |
| Цена | Включена в тарифы ChatGPT; $0.05/мин через API плюс backend-модель | $0.034 за минуту аудио |
| Языки | Не опубликованы; «большинство распространённых языков», признаны пробелы с акцентами | 70+ входных языков; 13 выходных (документированы) |
| Удерживает роль переводчика | Да, если дать инструкцию; ноль выходов из роли за 27 минут тестов | Да; только перевод по построению, без системных промптов |
| Задержка завершения, англ.→исп. | Медиана 11,72 с, рост до плато 10–14 с | Медиана 2,65 с, стабильно |
| Покрытие японского за 30 с | 17% | 98% |
| Расшифровки | Дельты исходного текста и перевода | Текстовые дельты исходной и переведённой речи |
13 документированных выходных языков gpt-realtime-translate: английский, испанский, португальский, французский, немецкий, итальянский, русский, китайский, японский, корейский, хинди, индонезийский и вьетнамский (OpenAI Cookbook). Список языков GPT-Live OpenAI так и не опубликовала, поэтому единственный ориентир, это измеренное поведение, а оно колоссально различается от языка к языку.
Два уточнения недели запуска, которые пора закрыть. Первое устарело: в июле 2026 года у GPT-Live действительно не было API, и на этом строились многие обзоры, но 10 сентября 2026 года модель вышла в API, так что любые тексты, где GPT-Live названа «доступной только в ChatGPT», нужно читать с этой поправкой. Второе остаётся в силе: цифры «$32 за миллион входных аудиотокенов и $64 за выходные», которые разошлись по постам первой недели, относятся к gpt-realtime-2, другой модели. Актуальная цена GPT-Live-1 в API, это $0.05 за минуту разговора за голосовой слой плюс отдельная оплата backend-модели.
4. Ограничения, которые признают OpenAI и независимые тесты
- На непрерывной речи отставание накапливается. Измеренная задержка завершения выросла с 5,7 секунды до плато в 10-14 секунд за первые три минуты при переводе с английского на испанский и держалась там до конца сессии.
- Японский деградирует резко. 17% фраз переведены в пределах 30 секунд против 98% у той же модели на испанском, а 20 фраз из 90 не переведены вообще.
- Лимиты использования реальны, но не опубликованы. Справочный центр OpenAI сообщает, что лимиты голосового использования зависят от тарифа и варианта Voice и могут меняться. Сторонние сообщения о конкретных цифрах противоречат друг другу; любую конкретную цифру считайте непроверенной.
- Официальных цифр задержки нет. OpenAI выпустила бенчмарки способностей (GPQA, BrowseComp, доли предпочтений), но не измерения задержки первого аудио или отставания при переводе.
- Покрытие языков не задокументировано. «Большинство распространённых языков», для остальных признаны неродные акценты и пробелы в беглости.
- Короткие реплики нельзя полностью отключить в потребительском приложении, хотя явная инструкция «только перевод» в тестах через API держалась без единого исключения.
- Мониторинг безопасности может вмешиваться. Согласно системной карте GPT-Live, мониторинг в реальном времени может скорректировать или прервать ответ, проиграть голосовое сообщение о безопасности или завершить разговор с высоким риском.
5. Что показывают независимые измерения
Что мы измерили (и что не измеряли)
Эти цифры получены на модели gpt-live-1 через API OpenAI, которой дана инструкция работать синхронным переводчиком; измерения от 15 сентября 2026 года. Это не измерения потребительского ChatGPT: бесплатные аккаунты работают на GPT-Live-1 mini, а приложение добавляет клиентское определение речи и собственные промпты, которые ни один стенд не может изолировать. Все системы в сравнении получили одинаковое аудио в одинаковом реальном темпе, а данные по каждому фрагменту опубликованы на livelingo.io/research/gpt-live-1-interpreter-test.
| Система | Задержка англ.→исп. | Задержка англ.→яп. | Покрытие японского за 30 с | На протяжении сессии |
|---|---|---|---|---|
| LiveLingo | 0,94 с | 0,88 с | 100% | Стабильно |
| Gemini 3.5 Live Translate | 1,51 с | 1,92 с | 99% | Стабильно |
OpenAI gpt-realtime-translate | 2,65 с | 3,33 с | 98% | Стабильно |
| GPT-Live-1 (по команде) | 11,72 с | n/a | 17% | Рост до 10–14 с |
Она не выходит из роли. За 27 минут переведённого аудио она ни разу не ответила говорящему вместо перевода, ни в одном из направлений. Это по-настоящему трудно, и специализированным моделям перевода даже не приходится за это браться.
Она постепенно отстаёт. При переводе с английского на испанский задержка завершения выросла с 5,7 секунды на нулевой минуте до плато между 10 и 14 секундами к третьей минуте и там осталась. Важна форма кривой: отставание не бесконечное, но слушатель, подключившийся на шестой минуте, слышит перевод примерно на двенадцать секунд позади комнаты.
Английский на японский рушится. В пределах 30 секунд переведено лишь 17% фраз против 98% у той же модели на испанском. Медианный вывод опаздывал на 50,7 секунды, а 20 фраз из 90 не были переведены вообще. Примерно через семь секунд после конца аудио модель просто перестала выдавать перевод вместо того, чтобы разбирать накопившуюся очередь, то есть она не догнала отставание, а бросила то, до чего не дошла. Результат воспроизвёлся в двух независимых запусках.
Это не проблема OpenAI. На том же японском аудио, с того же аккаунта и в тот же день, собственная gpt-realtime-translate от OpenAI держала стабильные 3,33 секунды и покрыла 98% фраз. Отказ принадлежит самой идее просить полнодуплексную разговорную модель работать синхронистом, а не вендору. Из-за этого в столбце задержки выше для японского стоит n/a: когда пятая часть содержания не доходит вовсе, медиана описывает только то, что уцелело.
6. Как использовать GPT-Live для перевода уже сегодня
- Обновите приложение ChatGPT на iOS или Android (или откройте chatgpt.com). Бесплатные аккаунты работают на GPT-Live-1 mini; аккаунты Go, Plus и Pro на GPT-Live-1.
- Нажмите значок Voice в поле ввода сообщения, чтобы начать сессию.
- Дайте инструкцию по переводу сразу: «Синхронно переводи всё, что я говорю, на японский. Не отвечай на вопросы, не комментируй, только переводи». В измерениях эта инструкция держалась без исключений.
- Для двустороннего разговора попросите оба направления: «Переводи мой английский на японский, а любой японский, который слышишь, на английский».
- Держите сессии короткими. Измеренное отставание минимально на первой минуте и примерно удваивается к третьей, поэтому разбивка долгого разговора на короткие обмены держит перевод ближе к говорящему.
- Разработчики могут вызывать
gpt-live-1напрямую наv1/live/sessionsили взятьgpt-realtime-translate, если задача, это перевод, а не разговор.
7. Когда GPT-Live подходит, а когда нет
GPT-Live правильный выбор, когда
- Вам нужен бесплатный перевод в реальном времени без установки, и вы уже пользуетесь ChatGPT. Бесплатный тариф включает полнодуплексную голосовую модель.
- Разговор короткий: спросить дорогу, быстрый обмен репликами, дорожная светская беседа. Отставание не успевает накопиться, а первый обмен ощущается мгновенным.
- Вам ценен ассистент вокруг перевода: можно задать уточняющий вопрос, получить контекст или попросить GPT-5.5 что-то найти прямо посреди разговора.
Другой инструмент подходит лучше, когда
- Речь непрерывная. Совещание, лекция или звонок, где одна сторона говорит минутами, это именно тот случай, где измеренное плато в 10-14 секунд становится всем опытом целиком.
- Вы переводите на японский или на любой язык, поведение на котором вы не проверяли. Покрытие у одной и той же модели различалось от 98% до 17% между двумя языками.
- Вам нужна читаемая двуязычная расшифровка во время прослушивания. GPT-Live даёт чат-лог, а не параллельный вид «оригинал и перевод», который никогда не переписывает сам себя.
- Вам нужны переведённые телефонные звонки. Ни одна из поверхностей OpenAI не набирает телефонный номер. LiveLingo совершает исходящие звонки на обычные номера с переводом прямо на линии, и получателю не нужно приложение.
Честное признание. LiveLingo (издатель этого руководства) относится к категории специализированных переводчиков, так что читайте сравнение с этой поправкой. Разговорная естественность GPT-Live, реальный шаг вперёд: её полнодуплексная смена реплик опережает все специализированные приложения-переводчики, включая наше, бесплатный тариф делает её самым простым способом попробовать голосовой перевод в реальном времени уже сегодня, и роль переводчика она удержала 27 минут без единого срыва. Чего она не умеет, так это поспевать за говорящим, который не ждёт. Сравнение характеристик: /compare/chatgpt-translation. Полные измерения: /research/gpt-live-1-interpreter-test. Полная линейка перевода OpenAI: /ru/guides/openai-live-translation.
8. Часто задаваемые вопросы
Что такое GPT-Live?
GPT-Live, представленная в ChatGPT 8 июля 2026 года, это семейство полнодуплексных голосовых моделей OpenAI. Вышли две модели: GPT-Live-1 (по умолчанию для платных тарифов Go, Plus и Pro) и GPT-Live-1 mini (по умолчанию для бесплатных пользователей). В отличие от Advanced Voice Mode, который она заменяет, GPT-Live слушает и говорит одновременно: её можно естественно перебить, она подаёт короткие реплики, пока вы говорите, и выполняет перевод в реальном времени, не дожидаясь конца вашей фразы. Сложные запросы она делегирует GPT-5.5 в фоне. Работает на iOS, Android и chatgpt.com, а с 10 сентября 2026 года доступна разработчикам как модель gpt-live-1 в API OpenAI.
Умеет ли GPT-Live переводить в реальном времени?
Да, и в измерениях она ни разу не вышла из роли переводчика за 27 минут аудио. Перевод вызывается голосовой командой, а не переключателем режима: скажите ассистенту «синхронно переводи всё, что я говорю, на японский», и он будет произносить перевод, пока вы говорите. Ограничение не в послушании, а в темпе: задержка завершения выросла с 5,7 секунды до плато в 10-14 секунд при переводе с английского на испанский на сессии длиной 452 секунды.
Есть ли у GPT-Live API?
Да, с 10 сентября 2026 года. GPT-Live-1 доступна как модель gpt-live-1 на эндпоинте v1/live/sessions по цене $0.05 за минуту разговора за голосовой слой, а backend-модель, которая отвечает за рассуждения, оплачивается отдельно. Это изменилось по сравнению с дебютом 8 июля, когда GPT-Live работала только внутри ChatGPT. Отдельно OpenAI предлагает специализированную модель перевода gpt-realtime-translate: $0.034 за минуту, 70+ входных языков и 13 выходных.
Какую задержку добавляет GPT-Live при переводе?
Измерено через API 15 сентября 2026 года: медиана 11,72 секунды до полной выдачи перевода фразы с английского на испанский, с ростом по ходу сессии с 5,7 секунды на нулевой минуте до плато в 10-14 секунд к третьей минуте. На том же аудио собственная gpt-realtime-translate от OpenAI показала 2,65 секунды, Gemini 3.5 Live Translate 1,51 секунды, а LiveLingo 0,94 секунды, и все три держались стабильно на протяжении тех же 452 секунд, без нарастания.
Почему у GPT-Live проблемы с переводом на японский?
Она отстаёт настолько, что перестаёт догонять. В пределах 30 секунд после произнесения было переведено лишь 17% японских фраз против 98% у той же модели на испанском, медианный вывод опаздывал на 50,7 секунды, а 20 фраз из 90 не были переведены вообще. Результат воспроизвёлся в двух запусках. Специализированная gpt-realtime-translate от OpenAI на том же аудио покрыла 98% фраз со стабильными 3,33 секунды, так что дело именно в том, что разговорную модель просят переводить, а не в японском у OpenAI.
GPT-Live бесплатна?
В ChatGPT да, с разделением по тарифам. GPT-Live-1 mini стала голосовой моделью по умолчанию для бесплатных аккаунтов; платные тарифы Go, Plus и Pro получают более крупную GPT-Live-1. Новая подписка не вводилась, а лимиты голосового использования зависят от тарифа и в минутах не публикуются. API оплачивается отдельно по счётчику: $0.05 за минуту за голосовой слой плюс оплата backend-модели.
Какие языки поддерживает GPT-Live для перевода?
OpenAI не опубликовала список языков. В материалах запуска сказано, что голос оптимизирован для «большинства распространённых языков», а для остальных признаны пробелы с акцентом и беглостью. Измеренное поведение резко различается по языкам: одна и та же модель покрыла 98% испанских фраз в пределах 30 секунд и лишь 17% японских. Модель перевода OpenAI для разработчиков, gpt-realtime-translate, документирует 70+ входных языков и 13 выходных: английский, испанский, португальский, французский, немецкий, итальянский, русский, китайский, японский, корейский, хинди, индонезийский и вьетнамский.
Как GPT-Live сравнивается с Gemini Live в переводе?
Разные архитектурные ставки, и теперь обе измеримы. GPT-Live, полнодуплексный разговорный ассистент, который переводит по запросу. Gemini 3.5 Live Translate от Google, специализированная потоковая модель перевода речи в речь. На одинаковом аудио длиной 452 секунды Gemini держала стабильные 1,51 секунды задержки завершения с английского на испанский и 1,92 секунды на японский, тогда как gpt-live-1 вышла на плато в 10-14 секунд на испанском и покрыла лишь 17% японских фраз в пределах 30 секунд. Специализированный переводческий тракт удерживает постоянное смещение, а не накапливает отставание.
Как вернуться с GPT-Live на Advanced Voice Mode?
Откройте настройки голоса ChatGPT и выберите Advanced Voice Mode. 8 июля 2026 года GPT-Live заменила его в качестве режима по умолчанию, но OpenAI оставила старый режим доступным для пользователей, которым нужны функции, не поддерживаемые GPT-Live, например видео и демонстрация экрана.
Как отучить GPT-Live перебивать и говорить «мгм»?
Полностью отключить короткие реплики в потребительском приложении нельзя. Обходной путь: дать явную инструкцию в начале сессии, например «только переводи то, что я говорю, ничего не добавляй». В измерениях через API эта инструкция держалась безоговорочно: ноль выходов из роли за 27 минут, так что сама роль переводчика надёжна, хотя разговорные вставки в ChatGPT по-прежнему возможны. Если такое поведение мешает вашей задаче, Advanced Voice Mode остаётся доступным в настройках голоса.
Какой инструмент выбрать для перевода живого разговора прямо сейчас?
Для коротких обменов репликами GPT-Live хороша и бесплатна внутри ChatGPT. Для непрерывной речи (совещание, лекция, долгий звонок) берите специализированный тракт. На одинаковом аудио длиной 452 секунды задержка завершения составила 0,94 секунды у LiveLingo, 1,51 у Gemini 3.5 Live Translate и 2,65 у собственной gpt-realtime-translate от OpenAI, и все три держались стабильно, против растущих 10-14 секунд у gpt-live-1 по команде. Переведённые звонки на обычные телефонные номера не выполняет ни одна из поверхностей OpenAI; это другая категория продуктов.
9. Источники
- OpenAI. Introducing GPT-Live. Блог OpenAI, 8 июля 2026. openai.com
- OpenAI Developers. Справка по модели GPT-Live-1 (доступность в API, эндпоинт, цены). developers.openai.com
- OpenAI. Системная карта GPT-Live. OpenAI Deployment Safety, июль 2026. deploymentsafety.openai.com
- OpenAI. ChatGPT Voice (справочный центр). help.openai.com
- TechCrunch. OpenAI releases new voice models for more natural live conversations, 8 июля 2026. techcrunch.com
- MarkTechPost. OpenAI Releases GPT-Live and GPT-Live-1 mini: Full-Duplex Voice Models That Delegate Deeper Reasoning to GPT-5.5, 8 июля 2026. marktechpost.com
- MacRumors. OpenAI Introduces GPT-Live to Make ChatGPT Voice Feel Like a Real Conversation, 8 июля 2026. macrumors.com
- The Decoder. ChatGPT can now listen and talk at the same time, июль 2026. the-decoder.com
- Simon Willison. Introducing GPT-Live (заметки после раннего доступа), 8 июля 2026. simonwillison.net
- OpenAI Developers. Справка по модели gpt-realtime-translate и руководство по переводу в реальном времени. developers.openai.com
- Artificial Analysis. Speech to Speech Quality Index (позиция GPT-Live-1 и время до первого аудио). artificialanalysis.ai
- LiveLingo Research. Тест GPT-Live-1 в роли синхронного переводчика, 15 сентября 2026. Данные по каждому фрагменту под лицензией CC-BY 4.0. livelingo.io/research/gpt-live-1-interpreter-test
- LiveLingo Research. Бенчмарк голосового перевода в реальном времени 2026. livelingo.io/research/benchmark-2026. DOI датасета: 10.5281/zenodo.21250032
- LiveLingo. Перевод в ChatGPT в 2026 году: голосовой режим, API gpt-realtime-translate и Whisper в сравнении. livelingo.io/ru/guides/openai-live-translation
Обновлено 16 сентября 2026 года: учтён выход GPT-Live-1 в API OpenAI 10 сентября 2026 года и добавлены первые независимые измерения её переводческого поведения. Названия моделей, распределение по тарифам, эндпоинт и цены сверены с документацией OpenAI для разработчиков 16 сентября 2026 года. Измерения относятся к модели в API, а не к потребительскому опыту ChatGPT; OpenAI может быстро менять тарифы, лимиты, покрытие языков и поведение модели.