LiveLingoLiveLingoTry free

Traduction GPT-Live : fonctionnalités, limites et latence mesurée (2026)

GPT-Live-1 et GPT-Live-1 mini sont les modèles vocaux full-duplex d'OpenAI : ils écoutent et parlent en même temps, et la traduction en direct est l'une de leurs capacités phares. Ils sont arrivés dans ChatGPT le 8 juillet 2026 et dans l'API OpenAI le 10 septembre 2026, ce qui permet enfin de mesurer la promesse de traduction au lieu de la supposer. Ce guide couvre ce qui est sorti, comment la traduction fonctionne réellement, et ce que la mesure indépendante montre aujourd'hui de ses limites.

Conflit d'intérêts

Ce guide est publié par LiveLingo (Lunana Global Inc.), un produit de traduction vocale concurrent de la traduction vocale de ChatGPT. Nous avons un intérêt financier dans l'adoption de LiveLingo. Les affirmations factuelles sur GPT-Live sont sourcées auprès de l'annonce d'OpenAI, de sa fiche système et de sa documentation développeur, ainsi que de la couverture indépendante du lancement, toutes liées dans le texte et dans la section Sources. Les mesures de la Section 5 sont les nôtres, réalisées via l'API OpenAI sur exactement le même audio que celui fourni à tous les autres systèmes, avec les données par extrait publiées sur livelingo.io/research/gpt-live-1-interpreter-test pour vérification indépendante.

Réponse rapide : GPT-Live peut-il faire de la traduction en direct ?

Oui, et il tient le rôle d'interprète de façon fiable, mais il prend progressivement du retard sur un discours continu. Dans ChatGPT, démarrez une session vocale et dites quelque chose comme « traduis simultanément tout ce que je dis en espagnol ». Comme les modèles sont full-duplex, la traduction est diffusée pendant que vous parlez encore. Les comptes gratuits reçoivent GPT-Live-1 mini ; les offres payantes Go, Plus et Pro reçoivent GPT-Live-1. Depuis le 10 septembre 2026, les développeurs peuvent aussi l'appeler directement sous le nom gpt-live-1 à l'endpoint v1/live/sessions, pour $0.05 par minute plus l'usage du modèle en arrière-plan. Mesuré sur une session de 452 secondes, son délai de livraison est passé de 5.7 secondes à un palier de 10 à 14 secondes en anglais vers espagnol, et en anglais vers japonais il n'a traduit que 17% des phrases en moins de 30 secondes.

1. Ce qu'OpenAI a lancé, et ce qui a changé en septembre

OpenAI a annoncé GPT-Live le mercredi 8 juillet 2026 dans un billet de blog et un direct vidéo (Introducing GPT-Live). Deux modèles sont sortis : GPT-Live-1, le nouveau modèle vocal par défaut des offres payantes Go, Plus et Pro, et GPT-Live-1 mini, le nouveau modèle par défaut des comptes gratuits (selon MacRumors et The Decoder). Les deux remplacent Advanced Voice Mode comme voix par défaut de ChatGPT, l'ancien mode restant sélectionnable dans les réglages vocaux.

Le 10 septembre 2026, les modèles sont arrivés dans l'API OpenAI, et c'est le changement le plus important depuis le lancement. GPT-Live-1 s'appelle désormais gpt-live-1 et s'invoque à l'endpoint v1/live/sessions, au tarif de $0.05 par minute de conversation pour la couche vocale, le modèle de raisonnement en arrière-plan étant facturé séparément (référence du modèle). Jusque-là, la promesse de traduction reposait sur la démo d'OpenAI et sur la presse. Elle peut maintenant être mesurée directement, et c'est exactement ce que fait la Section 5.

Le déploiement grand public a couvert iOS, Android et chatgpt.com dans les jours qui ont suivi l'annonce de juillet. Le mode vocal de l'application de bureau n'était pas inclus, et les espaces ChatGPT Business, Enterprise et Edu étaient exclus (selon 9to5Mac et WinBuzzer). Aucun nouveau tarif ChatGPT n'a été introduit : GPT-Live est inclus dans les offres existantes. OpenAI cite plus de 150 millions de personnes qui parlent à ChatGPT via des fonctions comme Voice et Dictation (TechCrunch).

La caractéristique clé est l'audio full-duplex : le modèle traite ce qu'il entend pendant qu'il parle, en prenant des décisions d'interaction plusieurs fois par seconde. On peut donc l'interrompre naturellement, il répond par de petits signaux d'écoute (« mhmm », « compris ») pendant que vous parlez, ou reste silencieux pendant que vous réfléchissez (MarkTechPost). Pour tout ce qui exige une recherche web, un raisonnement plus profond ou un travail agentique, GPT-Live délègue à GPT-5.5 en arrière-plan et poursuit la conversation en attendant le résultat. Les utilisateurs peuvent choisir trois niveaux de raisonnement (Instant, Medium, High) ; les niveaux supérieurs passent par GPT-5.5 Thinking.

Les évaluations publiées par OpenAI portent sur la capacité plutôt que sur la vitesse : au niveau de raisonnement High, GPT-Live-1 obtient 84.2% sur GPQA contre 45.3% pour Advanced Voice Mode, et 75.2% sur BrowseComp contre 0.7%. Dans les tests de préférence humaine, GPT-Live-1 a été préféré à Advanced Voice Mode dans 75.7% des conversations, et mini dans 69.2% (The Decoder, citant l'annonce d'OpenAI). De son côté, Artificial Analysis place GPT-Live-1 au deuxième rang de son index Speech-to-Speech, à 81.5, avec 1.34 seconde jusqu'au premier audio. OpenAI ne publie toujours aucun chiffre de latence spécifique à la traduction.

2. Comment la traduction en direct fonctionne sur GPT-Live

La traduction en direct est l'une des capacités qu'OpenAI nomme explicitement dans les documents de lancement : l'architecture full-duplex permet au modèle de « mener des échanges plus naturels, mieux percevoir le temps, et même assurer une traduction en direct » (annonce OpenAI). Lors des briefings de presse, OpenAI a fait la démonstration du modèle prononçant une traduction en continu pendant que le présentateur parlait.

C'est une consigne, pas un mode

Il n'y a pas de bouton traducteur, de sélecteur de paire de langues ni d'interface de traduction dédiée. Vous démarrez une session vocale et donnez l'instruction à l'assistant : « J'aimerais que tu traduises simultanément tout ce que je dis en hindi. » Le modèle produit alors une traduction parlée au fil de votre discours, et continue jusqu'à ce que vous lui disiez d'arrêter ou de changer. C'est le même schéma déclenché par consigne que ChatGPT Voice connaît depuis la sortie Realtime de mai 2026 ; ce qui change, c'est la restitution full-duplex, qui permet à la traduction de chevaucher votre parole au lieu d'attendre la fin de votre tour.

Le rôle tient, ce qui n'avait rien d'évident

Le mode de défaillance attendu, pour un modèle conversationnel à qui l'on demande d'interpréter, est qu'il réponde au locuteur au lieu de le traduire. Cela ne s'est pas produit. Sur 27 minutes d'audio interprété lors des mesures, couvrant l'anglais vers l'espagnol, l'anglais vers le japonais et le chinois vers l'anglais, il n'a pas une seule fois répondu au locuteur au lieu de le traduire : aucune question de clarification, aucun commentaire, aucun retour au comportement d'assistant. Ce n'est pas le suivi de consigne qui pose problème.

Le compromis d'un assistant avant tout

GPT-Live est un assistant conversationnel généraliste qui traduit sur demande, pas un interprète dédié, et cette nature pèse sur le rythme plutôt que sur l'obéissance. Un modèle conversationnel parle à une cadence naturelle et ne comprime ni n'abandonne rien quand il prend du retard. L'interprétation impose l'inverse : le locuteur continue quoi qu'il arrive, donc un système qui ne suit pas doit résumer, sauter, ou accepter un retard sans limite. Dans l'application grand public, les signaux d'écoute qui rendent la conversation naturelle (« mhmm », « ouais ») injectent aussi de l'audio non traductif dans une session de traduction, et les utilisateurs du premier jour ont largement signalé ces interjections comme envahissantes (BigGo).

3. GPT-Live face au traducteur dédié d'OpenAI

OpenAI propose deux surfaces de traduction en direct, et ce sont deux piles différentes. Le 7 mai 2026, OpenAI a sorti gpt-realtime-translate dans la Realtime API : un modèle dédié de traduction parole-vers-parole en streaming, entraîné sur des milliers d'heures d'audio d'interprètes professionnels, configuré pour rester en traduction pure et attendre suffisamment de contexte avant de produire de la parole (annonce OpenAI). GPT-Live, lui, est l'assistant full-duplex généraliste qui traduit quand on le lui demande. Les deux sont désormais accessibles aux développeurs, ce qui rend la comparaison directe possible pour la première fois.

Les deux surfaces de traduction en direct d'OpenAI au 16 septembre 2026. Les faits proviennent des annonces et de la documentation développeur d'OpenAI ; les mesures proviennent de LiveLingo Research.
GPT-Live (gpt-live-1)gpt-realtime-translate
Ce que c'estAssistant vocal full-duplex ; traduction sur consigneModèle dédié de traduction parole-vers-parole en streaming
Sortie leChatGPT le 8 juillet 2026 ; API le 10 septembre 20267 mai 2026
AccèsApplication ChatGPT, plus l'endpoint API /v1/live/sessionsRealtime API, endpoint /v1/realtime/translations
PrixInclus dans les offres ChatGPT ; $0.05/min via l'API, plus le modèle en arrière-plan$0.034 par minute d'audio
LanguesNon publiées ; « la plupart des langues parlées », lacunes d'accent reconnues70+ langues d'entrée ; 13 langues de sortie (documentées)
Reste dans le rôle de traducteurOui quand la consigne est donnée ; zéro rupture de rôle sur 27 minutes de testOui ; traduction pure par conception, pas d'invites système
Délai de livraison, en→es11.72 s de médiane, jusqu'à un palier de 10 à 14 s2.65 s de médiane, stable
Couverture japonaise en moins de 30 s17%98%
TranscriptionsDeltas de texte de la source et de la sortieDeltas de texte de la parole source et traduite

Les 13 langues de sortie documentées de gpt-realtime-translate : anglais, espagnol, portugais, français, allemand, italien, russe, chinois, japonais, coréen, hindi, indonésien et vietnamien (OpenAI Cookbook). OpenAI ne publie toujours pas de liste de langues pour GPT-Live : le comportement mesuré reste donc le seul guide, et il varie énormément d'une langue à l'autre.

Deux corrections de la semaine de lancement méritent d'être explicites, car la couverture initiale a brouillé les deux surfaces et beaucoup d'articles de juillet restent en ligne sans mise à jour. Premièrement, GPT-Live n'est plus réservé à ChatGPT : l'affirmation « pas d'API », exacte en juillet, est fausse depuis le 10 septembre 2026, date à laquelle le modèle gpt-live-1 est devenu appelable à l'endpoint v1/live/sessions pour $0.05 par minute de couche vocale, plus la facturation du modèle de raisonnement en arrière-plan. Deuxièmement, les tarifs au token attribués à GPT-Live dans certains billets sont ceux d'un autre modèle : les chiffres « $32 par million de tokens audio en entrée, $64 en sortie » appartiennent à gpt-realtime-2. La facturation de GPT-Live est à la minute, pas au token audio.

4. Les limites reconnues par OpenAI et révélées par la mesure

  • Le retard s'accumule sur un discours continu. Le délai de livraison mesuré est passé de 5.7 secondes à un palier de 10 à 14 secondes en moins de trois minutes en anglais vers espagnol, et y est resté jusqu'à la fin de la session.
  • Le japonais se dégrade fortement. 17% des phrases traduites en moins de 30 secondes, contre 98% pour le même modèle vers l'espagnol, et 20 phrases sur 90 jamais traduites.
  • Les plafonds d'utilisation sont réels mais non publiés. Le centre d'aide d'OpenAI indique que les limites d'utilisation de la voix varient selon l'offre et l'option vocale et peuvent changer. Les chiffres précis rapportés par des tiers se contredisent ; considérez tout chiffre précis comme non vérifié.
  • Aucun chiffre de latence officiel. OpenAI a publié des benchmarks de capacité (GPQA, BrowseComp, taux de préférence) mais aucune mesure de premier audio ni de retard pour la traduction.
  • La couverture linguistique n'est pas documentée. « La plupart des langues parlées », avec accents non natifs et lacunes de fluidité reconnus pour les autres.
  • Les signaux d'écoute ne peuvent pas être totalement désactivés dans l'application grand public, même si une consigne explicite de traduction pure a tenu sans exception lors des tests via l'API.
  • La supervision de sécurité peut intervenir. Selon la fiche système GPT-Live, une supervision en temps réel peut réorienter ou interrompre une réponse, diffuser un message de sécurité parlé ou mettre fin aux conversations à haut risque.

5. Ce que montre la mesure indépendante

Ce que nous avons mesuré (et ce que nous n'avons pas mesuré)

Ces chiffres proviennent de gpt-live-1 appelé via l'API OpenAI, avec une consigne lui demandant d'agir en interprète simultané, mesuré le 15 septembre 2026. Ce ne sont pas des mesures de l'expérience ChatGPT grand public : les comptes gratuits utilisent GPT-Live-1 mini, et l'application ajoute une détection vocale côté client ainsi que ses propres consignes, qu'aucun harnais ne peut isoler. Tous les systèmes comparés ont reçu exactement le même audio, au même rythme temps réel, et les données par extrait sont publiées sur livelingo.io/research/gpt-live-1-interpreter-test.

Reproductibilité

Chaque chiffre se reproduit à partir du même flux audio continu de 452 secondes, des mêmes endpoints de modèles et du même harnais Python. Les données par extrait de délai de livraison et de couverture (per-clip.json, CC-BY 4.0) et la méthodologie complète sont publiées sur livelingo.io/research/gpt-live-1-interpreter-test.

Le délai de livraison est le moment où la traduction d'une phrase est intégralement restituée, moins le moment où le locuteur a fini de la prononcer. Un flux continu de 452 secondes, 90 phrases, audio identique pour chaque système. Méthodologie complète : /research/gpt-live-1-interpreter-test.
SystèmeDélai en→esDélai en→jaCouverture japonaise en moins de 30 sSur la durée de la session
LiveLingo0.94 s0.88 s100%Stable
Gemini 3.5 Live Translate1.51 s1.92 s99%Stable
OpenAI gpt-realtime-translate2.65 s3.33 s98%Stable
GPT-Live-1 (sur consigne)11.72 sn/a17%Monte à 10 à 14 s

Il ne sort jamais de son rôle. Sur 27 minutes d'audio interprété, il n'a jamais répondu au locuteur au lieu de le traduire, dans aucun des deux sens. C'est réellement difficile, et les modèles de traduction dédiés n'ont même pas à s'y essayer.

Il prend progressivement du retard. En anglais vers espagnol, le délai de livraison est monté de 5.7 secondes à la minute zéro jusqu'à un palier situé entre 10 et 14 secondes à la troisième minute, puis y est resté. La forme de la courbe compte : le retard n'est pas illimité, mais un auditeur qui arrive à la sixième minute entend une traduction avec environ douze secondes de décalage sur la salle.

L'anglais vers japonais s'effondre. Seules 17% des phrases ont été traduites en moins de 30 secondes, contre 98% pour le même modèle vers l'espagnol. La sortie médiane arrive avec 50.7 secondes de retard, et 20 phrases sur 90 n'ont jamais été traduites. Le modèle a cessé d'émettre environ sept secondes après la fin de l'audio au lieu d'écouler son arriéré : il n'a donc pas rattrapé son retard, il a abandonné ce qu'il n'avait pas atteint. Le résultat s'est reproduit sur deux exécutions indépendantes.

Ce n'est pas un problème OpenAI. Sur exactement le même audio japonais, depuis le même compte et le même jour, le gpt-realtime-translate d'OpenAI a tenu 3.33 secondes de façon stable et couvert 98% des phrases. L'échec tient au fait de demander à un modèle conversationnel full-duplex d'interpréter, pas au fournisseur. C'est aussi pourquoi la colonne de délai ci-dessus indique n/a pour le japonais : quand un cinquième du contenu n'arrive jamais, une médiane ne décrit que la partie qui a survécu.

6. Comment utiliser GPT-Live pour traduire aujourd'hui

  1. Mettez à jour l'application ChatGPT sur iOS ou Android (ou utilisez chatgpt.com). Les comptes gratuits utilisent GPT-Live-1 mini ; les comptes Go, Plus et Pro utilisent GPT-Live-1.
  2. Touchez l'icône vocale dans le champ de saisie pour démarrer une session.
  3. Donnez la consigne de traduction dès le départ : « Traduis simultanément tout ce que je dis en japonais. Ne réponds pas aux questions, ne commente pas, traduis uniquement. » Lors des mesures, cette consigne a tenu sans exception.
  4. Pour une conversation bidirectionnelle, demandez les deux sens : « Traduis mon français en japonais, et traduis en français tout le japonais que tu entends. »
  5. Gardez des sessions courtes. Le retard mesuré est le plus faible dans la première minute et double environ à la troisième : découper une longue conversation en échanges plus courts garde la traduction près du locuteur.
  6. Les développeurs peuvent appeler gpt-live-1 directement à l'endpoint v1/live/sessions, ou préférer gpt-realtime-translate si la tâche relève de la traduction plutôt que de la conversation.

7. Quand GPT-Live convient, et quand il ne convient pas

GPT-Live est le bon choix quand

  • Vous voulez une traduction en direct gratuite, sans installation, et vous utilisez déjà ChatGPT. L'offre gratuite inclut un modèle vocal full-duplex.
  • La conversation est courte : demander son chemin, un échange rapide, une petite discussion de voyage. La dérive n'a pas le temps de s'accumuler, et le premier échange paraît immédiat.
  • Vous appréciez l'assistant autour de la traduction : vous pouvez poser des questions de suivi, obtenir du contexte, ou faire chercher quelque chose par GPT-5.5 en pleine conversation.

Un autre outil convient mieux quand

  • Le discours est continu. Une réunion, une conférence ou un appel où l'un des deux côtés parle plusieurs minutes d'affilée : c'est là que le palier mesuré de 10 à 14 secondes devient toute l'expérience.
  • Vous traduisez vers le japonais, ou vers toute langue dont vous n'avez pas vérifié le comportement. La couverture est passée de 98% à 17% entre deux langues sur le même modèle.
  • Vous avez besoin d'une transcription lisible en deux langues pendant l'écoute. GPT-Live vous donne un journal de conversation, pas une vue côte à côte source-traduction qui ne se réécrit jamais.
  • Vous avez besoin d'appels téléphoniques traduits. Aucune des surfaces OpenAI ne compose de numéro de téléphone. LiveLingo passe des appels sortants vers des numéros ordinaires avec la traduction active sur la ligne, sans que le destinataire ait besoin d'une application.

Une concession honnête. LiveLingo (qui publie ce guide) appartient à la catégorie des traducteurs dédiés : lisez donc la comparaison en gardant cela en tête. Le naturel conversationnel de GPT-Live est une vraie avancée, sa gestion full-duplex des tours de parole devance toutes les applications de traduction dédiées, y compris la nôtre, son offre gratuite en fait le moyen le plus simple pour quiconque d'essayer la traduction vocale en direct aujourd'hui, et il a tenu le rôle d'interprète pendant 27 minutes sans une seule défaillance. Ce qu'il ne fait pas, c'est suivre le rythme d'un locuteur qui n'attend pas. Spécifications côte à côte : /compare/chatgpt-translation. Mesures complètes : /research/gpt-live-1-interpreter-test. La gamme de traduction complète d'OpenAI : /fr/guides/openai-live-translation.

8. Questions fréquentes

Qu'est-ce que GPT-Live ?

GPT-Live est la famille de modèles vocaux full-duplex d'OpenAI, lancée dans ChatGPT le 8 juillet 2026. Deux modèles sont sortis : GPT-Live-1 (par défaut pour les offres payantes Go, Plus et Pro) et GPT-Live-1 mini (par défaut pour les comptes gratuits). Contrairement à Advanced Voice Mode qu'il remplace, GPT-Live écoute et parle en même temps : on peut l'interrompre naturellement, il réagit pendant que vous parlez, et il traduit en direct pendant que vous êtes encore en train de parler. Il délègue les requêtes complexes à GPT-5.5 en arrière-plan. Il fonctionne sur iOS, Android et chatgpt.com, et depuis le 10 septembre 2026 il est aussi accessible aux développeurs sous le nom gpt-live-1 dans l'API OpenAI.

GPT-Live peut-il traduire en temps réel ?

Oui, et lors des mesures il n'a jamais rompu le rôle d'interprète sur 27 minutes d'audio. La traduction se déclenche par consigne plutôt que par un bouton de mode : dites à l'assistant de « traduire simultanément tout ce que je dis en japonais » et il prononce une traduction en continu pendant que vous parlez. La limite porte sur le rythme, pas sur l'obéissance : le délai de livraison est passé de 5.7 secondes à un palier de 10 à 14 secondes en anglais vers espagnol sur une session de 452 secondes.

GPT-Live a-t-il une API ?

Oui, depuis le 10 septembre 2026. GPT-Live-1 est disponible sous le nom de modèle gpt-live-1 à l'endpoint v1/live/sessions, au tarif de $0.05 par minute de conversation pour la couche vocale, le modèle de raisonnement en arrière-plan étant facturé séparément. C'est un changement par rapport au lancement ChatGPT du 8 juillet, où GPT-Live était réservé à ChatGPT. OpenAI propose par ailleurs un modèle de traduction dédié, gpt-realtime-translate, à $0.034 par minute, avec 70+ langues d'entrée et 13 langues de sortie.

Quel retard GPT-Live ajoute-t-il lors de la traduction ?

Mesuré via l'API le 15 septembre 2026 : une médiane de 11.72 secondes pour achever la livraison d'une phrase en anglais vers espagnol, en progression tout au long de la session, de 5.7 secondes à la minute zéro jusqu'à un palier de 10 à 14 secondes à la troisième minute. Sur un audio identique, le gpt-realtime-translate d'OpenAI mesure 2.65 secondes, Gemini 3.5 Live Translate 1.51 seconde et LiveLingo 0.94 seconde, tous stables sur les mêmes 452 secondes au lieu de dériver.

Pourquoi GPT-Live a-t-il du mal avec la traduction en japonais ?

Il prend assez de retard pour ne plus le rattraper. Seules 17% des phrases japonaises ont été traduites dans les 30 secondes suivant leur énonciation, contre 98% pour le même modèle vers l'espagnol ; la sortie médiane arrive avec 50.7 secondes de retard, et 20 phrases sur 90 n'ont jamais été traduites. Le résultat s'est reproduit sur deux exécutions. Le modèle dédié d'OpenAI, gpt-realtime-translate, a couvert 98% des phrases à 3.33 secondes de façon stable sur le même audio : le problème vient donc du fait de demander à un modèle conversationnel d'interpréter, et non d'une faiblesse d'OpenAI en japonais.

GPT-Live est-il gratuit ?

Dans ChatGPT, oui, avec une répartition par offre. GPT-Live-1 mini est le modèle vocal par défaut des comptes gratuits ; les offres payantes Go, Plus et Pro reçoivent le plus grand GPT-Live-1. Aucun nouvel abonnement n'a été introduit, et les limites d'utilisation de la voix varient selon l'offre sans plafond de minutes publié. L'API est distincte et facturée à l'usage : $0.05 par minute pour la couche vocale, plus le modèle de raisonnement en arrière-plan.

Quelles langues GPT-Live prend-il en charge pour la traduction ?

OpenAI n'a pas publié de liste de langues. Les documents de lancement disent que la voix est optimisée pour « la plupart des langues parlées » et reconnaissent des lacunes d'accent et de fluidité pour les autres. Le comportement mesuré varie fortement selon la langue : le même modèle a couvert 98% des phrases espagnoles en moins de 30 secondes, mais seulement 17% des phrases japonaises. Le modèle de traduction pour développeurs d'OpenAI, gpt-realtime-translate, documente 70+ langues d'entrée et 13 langues de sortie : anglais, espagnol, portugais, français, allemand, italien, russe, chinois, japonais, coréen, hindi, indonésien et vietnamien.

Comment GPT-Live se compare-t-il à Gemini Live pour la traduction ?

Deux paris architecturaux différents, et les deux sont désormais mesurables. GPT-Live est un assistant conversationnel full-duplex qui traduit sur demande. Gemini 3.5 Live Translate de Google est un modèle dédié de traduction parole-vers-parole en streaming. Sur un audio identique de 452 secondes, Gemini a tenu un délai stable de 1.51 seconde en anglais vers espagnol et de 1.92 seconde vers le japonais, tandis que gpt-live-1 est monté jusqu'à un palier de 10 à 14 secondes en espagnol et n'a couvert que 17% des phrases japonaises en moins de 30 secondes. Une chaîne de traduction dédiée conserve un décalage constant au lieu d'accumuler du retard.

Comment revenir à Advanced Voice Mode depuis GPT-Live ?

Ouvrez les réglages vocaux de ChatGPT et sélectionnez Advanced Voice Mode. GPT-Live l'a remplacé comme mode par défaut le 8 juillet 2026, mais OpenAI a gardé l'ancien mode sélectionnable pour les utilisateurs qui ont besoin de fonctions que GPT-Live ne prend pas en charge, comme la vidéo et le partage d'écran.

Comment empêcher GPT-Live d'interrompre ou de dire « mhmm » ?

Il est impossible de désactiver totalement les signaux d'écoute dans l'application grand public. La solution de contournement est une consigne explicite en début de session, comme « traduis uniquement ce que je dis, n'ajoute rien d'autre ». Lors des tests via l'API, cette consigne a tenu intégralement, avec zéro rupture de rôle sur 27 minutes : le rôle d'interprète est donc fiable, même si les interjections conversationnelles restent possibles dans ChatGPT. Si ce comportement bloque votre usage, Advanced Voice Mode reste sélectionnable dans les réglages vocaux.

Quel outil utiliser pour la traduction de conversation en direct aujourd'hui ?

Pour des échanges courts, GPT-Live fait très bien le travail et reste gratuit dans ChatGPT. Pour du discours continu (une réunion, une conférence, un appel long), passez par une chaîne conçue pour cela. Sur un audio identique de 452 secondes, le délai de livraison était de 0.94 seconde pour LiveLingo, 1.51 pour Gemini 3.5 Live Translate et 2.65 pour le gpt-realtime-translate d'OpenAI, tous stables, contre un retard croissant de 10 à 14 secondes pour gpt-live-1 piloté par consigne. Pour les appels traduits vers des numéros ordinaires, aucune des surfaces OpenAI ne compose de numéro ; c'est une autre catégorie de produit.

9. Sources

Mis à jour le 16 septembre 2026 pour tenir compte de l'arrivée de GPT-Live-1 dans l'API OpenAI le 10 septembre 2026, et pour ajouter les premières mesures indépendantes de son comportement en traduction. Noms des modèles, répartition par offre, endpoint et tarifs vérifiés le 16 septembre 2026 par rapport à la documentation développeur d'OpenAI. Les mesures portent sur le modèle accessible par API, et non sur l'expérience ChatGPT grand public ; OpenAI peut changer rapidement les offres, les limites, la couverture linguistique et le comportement des modèles.