Kurzantwort: Kann GPT-Live live übersetzen?
Ja, und es hält die Dolmetscherrolle zuverlässig durch, fällt bei kontinuierlicher Sprache aber zunehmend zurück. Starten Sie in ChatGPT eine Voice-Sitzung und sagen Sie etwas wie "übersetze simultan alles, was ich sage, ins Spanische." Weil die Modelle Full-Duplex sind, streamt die Übersetzung, während Sie noch reden. Gratis-Konten erhalten GPT-Live-1 mini; die Bezahlpläne Go, Plus und Pro erhalten GPT-Live-1. Seit dem 10. September 2026 können Entwickler das Modell auch direkt als gpt-live-1 am Endpunkt v1/live/sessions aufrufen, zu $0.05 pro Minute plus Nutzung des Backend-Modells. Über eine Sitzung von 452 Sekunden stieg die gemessene Fertigstellungsverzögerung bei Englisch nach Spanisch von 5,7 Sekunden auf ein Plateau von 10 bis 14 Sekunden, und bei Englisch nach Japanisch wurden nur 17% der Sätze innerhalb von 30 Sekunden übersetzt.
1. Was OpenAI ausgeliefert hat und was sich im September geändert hat
OpenAI kündigte GPT-Live am Mittwoch, dem 8. Juli 2026, per Blogpost und Livestream an (Introducing GPT-Live). Zwei Modelle erschienen: GPT-Live-1, das neue Standard-Sprachmodell für die Bezahlpläne Go, Plus und Pro, und GPT-Live-1 mini, der neue Standard für Gratis-Konten (laut MacRumors und The Decoder). Beide ersetzen den Advanced Voice Mode als Standard von ChatGPT Voice; der alte Modus bleibt in den Voice-Einstellungen wählbar.
Am 10. September 2026 erreichten die Modelle die OpenAI-API, die wichtigste Änderung seit dem Launch. GPT-Live-1 lässt sich jetzt als gpt-live-1 am Endpunkt v1/live/sessions aufrufen, zu $0.05 pro Gesprächsminute für die Sprachschicht; das Backend-Modell, das das Reasoning übernimmt, wird separat abgerechnet (Modellreferenz). Bis dahin stützte sich die Übersetzungsbehauptung auf OpenAIs Demo und auf Presseberichte. Sie lässt sich nun direkt messen, und genau das tut Abschnitt 5.
Das prägende Feature ist Full-Duplex-Audio: Das Modell verarbeitet, was es hört, während es spricht, und trifft viele Male pro Sekunde Interaktionsentscheidungen. So lässt es sich natürlich unterbrechen, antwortet mit Rückmeldelauten ("mhmm", "verstanden"), während man redet, oder bleibt still, während man nachdenkt (MarkTechPost). Für alles, was Websuche, tieferes Reasoning oder agentische Arbeit erfordert, delegiert GPT-Live im Hintergrund an GPT-5.5 und führt das Gespräch weiter, bis das Ergebnis zurückkommt. Nutzer können drei Reasoning-Stufen wählen (Instant, Medium, High); die höheren Stufen laufen über GPT-5.5 Thinking.
OpenAIs veröffentlichte Evaluierungen betreffen Fähigkeiten, nicht Geschwindigkeit: Auf der Stufe High erzielt GPT-Live-1 84,2% auf GPQA gegenüber 45,3% für den Advanced Voice Mode und 75,2% auf BrowseComp gegenüber 0,7%. In Präferenztests mit Menschen wurde GPT-Live-1 in 75,7% der Gespräche dem Advanced Voice Mode vorgezogen, mini in 69,2% (The Decoder, unter Berufung auf OpenAIs Ankündigung). Unabhängig davon führt Artificial Analysis GPT-Live-1 auf Platz zwei seines Speech-to-Speech-Index mit 81,5 Punkten und 1,34 Sekunden bis zum ersten Audio. Latenzzahlen speziell für die Übersetzung veröffentlicht OpenAI weiterhin nicht.
2. Wie die Live-Übersetzung auf GPT-Live funktioniert
Live-Übersetzung ist eine der Fähigkeiten, die OpenAI in den Launch-Materialien ausdrücklich nennt: Die Full-Duplex-Architektur erlaubt dem Modell "einen natürlicheren Austausch, ein besseres Zeitgefühl und sogar Live-Übersetzung" (OpenAI-Ankündigung). In Pressebriefings demonstrierte OpenAI, wie das Modell eine laufende Übersetzung spricht, während der Vorführende redet.
Es ist ein Prompt, kein Modus
Es gibt keinen Übersetzer-Schalter, keine Sprachpaar-Auswahl und keine dedizierte Übersetzungs-UI. Man startet eine Voice-Sitzung und instruiert den Assistenten: "Übersetze bitte simultan alles, was ich sage, ins Hindi." Das Modell gibt dann eine gesprochene Übersetzung aus, während man spricht, und macht weiter, bis man es stoppt oder umstellt. Das ist dasselbe Prompt-Muster, das ChatGPT Voice seit dem Realtime-Release vom Mai 2026 hat; neu ist die Full-Duplex-Auslieferung, durch die die Übersetzung die eigene Rede überlappt, statt auf das Ende des Redebeitrags zu warten.
Die Rolle hält, und das ist nicht selbstverständlich
Der naheliegende Fehlermodus eines Konversationsmodells, das dolmetschen soll, ist, dass es dem Sprecher antwortet, statt ihn zu übersetzen. Das passierte nicht. Über 27 Minuten gedolmetschtes Audio hinweg, verteilt auf Englisch nach Spanisch, Englisch nach Japanisch und Chinesisch nach Englisch, reagierte es kein einziges Mal auf den Sprecher, statt ihn zu übersetzen: keine Rückfragen, keine Kommentare, kein Abdriften zurück ins Assistentenverhalten. Am Befolgen der Anweisung scheitert es nicht.
Der Assistent-zuerst-Kompromiss
GPT-Live ist ein allgemeiner Konversationsassistent, der auf Anfrage übersetzt, kein dedizierter Dolmetscher, und diese Bauart wirkt sich auf das Tempo aus, nicht auf den Gehorsam. Ein Konversationsmodell spricht in natürlichem Tempo und kürzt oder streicht nichts, wenn es zurückfällt. Beim Dolmetschen gilt die umgekehrte Anforderung: Der Sprecher redet ohnehin weiter, also muss ein System, das nicht mithält, zusammenfassen, auslassen oder unbegrenzte Verzögerung in Kauf nehmen. In der Konsumenten-App bringen außerdem dieselben Rückmeldelaute, die Gespräche natürlich wirken lassen ("mhmm", "ja"), Nicht-Übersetzungs-Audio in eine Übersetzungssitzung, und Nutzer am ersten Tag meldeten sie vielfach als störend (BigGo).
3. GPT-Live vs. OpenAIs spezialisierter Übersetzer
OpenAI liefert zwei verschiedene Live-Übersetzungsoberflächen aus, und es sind unterschiedliche Stacks. Am 7. Mai 2026 veröffentlichte OpenAI gpt-realtime-translate in der Realtime API: ein speziell gebautes Streaming-Sprache-zu-Sprache-Übersetzungsmodell, trainiert auf Tausenden Stunden professionellen Dolmetscher-Audios und so konfiguriert, dass es strikt bei der Übersetzung bleibt und auf ausreichend Kontext wartet, bevor es Sprache produziert (OpenAI-Ankündigung). GPT-Live ist der allgemeine Full-Duplex-Assistent, der übersetzt, wenn man ihn darum bittet. Beide stehen jetzt Entwicklern offen, was den direkten Vergleich erstmals möglich macht.
GPT-Live (gpt-live-1) | gpt-realtime-translate | |
|---|---|---|
| Was es ist | Full-Duplex-Sprachassistent; Übersetzung per Prompt | Dediziertes Streaming-Sprache-zu-Sprache-Übersetzungsmodell |
| Veröffentlicht | ChatGPT 8. Juli 2026; API 10. September 2026 | 7. Mai 2026 |
| Zugang | ChatGPT-App plus API-Endpunkt /v1/live/sessions | Realtime API, Endpunkt /v1/realtime/translations |
| Preis | In den ChatGPT-Plänen enthalten; $0.05/min über die API plus Backend-Modell | $0.034 pro Audiominute |
| Sprachen | Unveröffentlicht; "die meisten gesprochenen Sprachen", Akzentlücken offengelegt | 70+ Eingabesprachen; 13 Ausgabesprachen (dokumentiert) |
| Bleibt in der Übersetzerrolle | Ja, wenn angewiesen; null Rollenbrüche in 27 Minuten Test | Ja; per Design nur Übersetzung, keine System-Prompts |
| Fertigstellungsverzögerung, en→es | 11,72 s Median, steigend auf ein Plateau von 10–14 s | 2,65 s Median, konstant |
| Japanisch-Abdeckung innerhalb von 30 s | 17% | 98% |
| Transkripte | Transkript-Deltas von Quelle und Ausgabe | Text-Deltas von Quell- und übersetzter Sprache |
Die 13 dokumentierten Ausgabesprachen von gpt-realtime-translate: Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Russisch, Chinesisch, Japanisch, Koreanisch, Hindi, Indonesisch und Vietnamesisch (OpenAI Cookbook). Für GPT-Live veröffentlicht OpenAI weiterhin keine Sprachliste, also ist das gemessene Verhalten der einzige Anhaltspunkt, und es schwankt enorm von Sprache zu Sprache.
Zwei Korrekturen zur Launch-Woche gehören ausdrücklich festgehalten, weil frühe Berichterstattung beides durcheinanderbrachte und eine der beiden Angaben inzwischen überholt ist. Erstens: Die kursierenden Zahlen "$32 pro Million Audio-Input-Token, $64 Output" gehören zu gpt-realtime-2, einem anderen Modell, und nicht zu GPT-Live. Zweitens: Die Aussage, GPT-Live sei überhaupt nicht über die API verfügbar, stimmte nur bis zum 10. September 2026. Seitdem ist das Modell als gpt-live-1 am Endpunkt v1/live/sessions erreichbar, zu $0.05 pro Minute für die Sprachschicht plus separat abgerechnetem Backend-Modell (Modellreferenz).
4. Grenzen, die OpenAI und unabhängige Tests offenlegen
- Bei kontinuierlicher Sprache sammelt sich Verzögerung an. Die gemessene Fertigstellungsverzögerung stieg bei Englisch nach Spanisch innerhalb von drei Minuten von 5,7 Sekunden auf ein Plateau von 10 bis 14 Sekunden und blieb dort für den Rest der Sitzung.
- Japanisch bricht deutlich ein. 17% der Sätze wurden innerhalb von 30 Sekunden übersetzt, gegenüber 98% beim selben Modell ins Spanische, und 20 von 90 Sätzen wurden überhaupt nie übersetzt.
- Nutzungslimits existieren, sind aber unveröffentlicht. OpenAIs Hilfezentrum erklärt, die Voice-Nutzungslimits variierten je nach Plan und Voice-Option und könnten sich ändern. Drittberichte über konkrete Zahlen widersprechen einander; jede konkrete Zahl sollte als unbestätigt gelten.
- Keine offiziellen Latenzzahlen. OpenAI veröffentlichte Fähigkeits-Benchmarks (GPQA, BrowseComp, Präferenzraten), aber keine Messungen zu Erst-Audio-Latenz oder Verzögerung beim Übersetzen.
- Die Sprachabdeckung ist undokumentiert. "Die meisten gesprochenen Sprachen", für andere sind nicht-muttersprachliche Akzente und Lücken in der Sprachbeherrschung offengelegt.
- Rückmeldelaute lassen sich in der Konsumenten-App nicht vollständig abschalten, auch wenn eine explizite Nur-Übersetzen-Anweisung in den API-Tests ausnahmslos hielt.
- Das Sicherheits-Monitoring kann eingreifen. Laut der GPT-Live System Card kann die Echtzeit-Überwachung eine Antwort lenken oder unterbrechen, eine gesprochene Sicherheitsmeldung abspielen oder risikoreiche Gespräche beenden.
5. Was unabhängige Messungen zeigen
Was wir gemessen haben (und was nicht)
Diese Zahlen stammen von gpt-live-1 über die OpenAI-API, geprompt, als Simultandolmetscher zu arbeiten, gemessen am 15. September 2026. Es sind keine Messungen der ChatGPT-Konsumentenerfahrung: Gratis-Konten laufen mit GPT-Live-1 mini, und die App fügt clientseitige Spracherkennung und eigenes Prompting hinzu, die kein Test-Harness isolieren kann. Jedes System im Vergleich bekam identisches Audio in identischem Echtzeit-Tempo, und die Daten pro Clip sind unter livelingo.io/research/gpt-live-1-interpreter-test veröffentlicht.
| System | Verzögerung en→es | Verzögerung en→ja | Japanisch-Abdeckung innerhalb von 30 s | Über die Sitzung |
|---|---|---|---|---|
| LiveLingo | 0,94 s | 0,88 s | 100% | Konstant |
| Gemini 3.5 Live Translate | 1,51 s | 1,92 s | 99% | Konstant |
OpenAI gpt-realtime-translate | 2,65 s | 3,33 s | 98% | Konstant |
| GPT-Live-1 (geprompt) | 11,72 s | k. A. | 17% | Steigt auf 10–14 s |
Es fällt nie aus der Rolle. Über 27 Minuten gedolmetschtes Audio antwortete es in keiner Richtung dem Sprecher, statt ihn zu übersetzen. Das ist wirklich schwierig, und die dedizierten Übersetzungsmodelle müssen es gar nicht erst versuchen.
Es fällt fortschreitend zurück. Bei Englisch nach Spanisch stieg die Fertigstellungsverzögerung von 5,7 Sekunden in der ersten Minute auf ein Plateau zwischen 10 und 14 Sekunden ab der dritten Minute und blieb dort. Die Form ist aufschlussreich: Die Verzögerung wächst nicht unbegrenzt, aber wer in Minute sechs dazukommt, hört eine Übersetzung, die dem Raum rund zwölf Sekunden hinterherhinkt.
Englisch nach Japanisch bricht zusammen. Nur 17% der Sätze wurden innerhalb von 30 Sekunden übersetzt, gegenüber 98% beim selben Modell ins Spanische. Die Ausgabe kam im Median 50,7 Sekunden zu spät, und 20 von 90 Sätzen wurden überhaupt nie übersetzt. Rund sieben Sekunden nach dem Ende des Audios hörte das Modell auf zu senden, statt einen Rückstand abzuarbeiten: Es holte also nicht auf, sondern ließ fallen, was es nicht erreicht hatte. Das Ergebnis ließ sich in zwei unabhängigen Durchläufen reproduzieren.
Das ist kein OpenAI-Problem. Auf identischem japanischem Audio, vom selben Konto am selben Tag, hielt OpenAIs eigenes gpt-realtime-translate konstante 3,33 Sekunden und deckte 98% der Sätze ab. Der Fehler liegt darin, ein Full-Duplex-Konversationsmodell zum Dolmetschen zu prompten, nicht beim Anbieter. Deshalb steht in der Spalte oben für Japanisch k. A.: Wenn ein Fünftel des Inhalts nie ankommt, beschreibt ein Median nur den Teil, der übrig blieb.
6. So nutzen Sie GPT-Live heute zum Übersetzen
- Aktualisieren Sie die ChatGPT-App auf iOS oder Android (oder nutzen Sie chatgpt.com). Gratis-Konten laufen mit GPT-Live-1 mini; Go-, Plus- und Pro-Konten mit GPT-Live-1.
- Tippen Sie auf das Voice-Symbol im Eingabefeld, um eine Sitzung zu starten.
- Geben Sie die Übersetzungsanweisung gleich zu Beginn: "Übersetze simultan alles, was ich sage, ins Japanische. Beantworte keine Fragen, kommentiere nichts, übersetze nur." In den Messungen hielt diese Anweisung ausnahmslos.
- Für Gespräche in beide Richtungen fordern Sie beide Richtungen an: "Übersetze mein Englisch ins Japanische und übersetze jedes Japanisch, das du hörst, ins Englische."
- Halten Sie die Sitzungen kurz. Die gemessene Verzögerung ist in der ersten Minute am geringsten und verdoppelt sich bis zur dritten Minute ungefähr, also bleibt die Übersetzung näher am Sprecher, wenn Sie ein langes Gespräch in kürzere Abschnitte aufteilen.
- Entwickler können
gpt-live-1direkt am Endpunktv1/live/sessionsaufrufen oder stattdessengpt-realtime-translatenutzen, wenn die Aufgabe Übersetzung und nicht Konversation ist.
7. Wann GPT-Live passt und wann nicht
GPT-Live ist die richtige Wahl, wenn
- Sie kostenlose Echtzeit-Übersetzung ohne Installation wollen und ChatGPT ohnehin nutzen. Der Gratis-Plan enthält ein Full-Duplex-Sprachmodell.
- Das Gespräch kurz ist: nach dem Weg fragen, ein schneller Austausch, Smalltalk auf Reisen. Die Drift hat keine Zeit, sich aufzubauen, und der erste Austausch wirkt unmittelbar.
- Sie den Assistenten rund um die Übersetzung schätzen: Sie können Rückfragen stellen, Kontext bekommen oder GPT-5.5 mitten im Gespräch etwas nachschlagen lassen.
Ein anderes Tool passt besser, wenn
- Die Sprache kontinuierlich läuft. In einem Meeting, einem Vortrag oder einem Telefonat, in dem eine Seite minutenlang redet, wird das gemessene Verzögerungsplateau von 10 bis 14 Sekunden zur gesamten Erfahrung.
- Sie ins Japanische übersetzen oder in eine Sprache, deren Verhalten Sie nicht überprüft haben. Die Abdeckung schwankte beim selben Modell zwischen zwei Sprachen von 98% auf 17%.
- Sie beim Zuhören ein lesbares zweisprachiges Transkript brauchen. GPT-Live liefert ein Chat-Protokoll, keine Nebeneinander-Ansicht von Original und Übersetzung, die sich nie selbst umschreibt.
- Sie übersetzte Telefonanrufe brauchen. Keine der OpenAI-Oberflächen wählt eine Telefonnummer. LiveLingo führt ausgehende Anrufe an normale Rufnummern mit laufender Übersetzung auf der Leitung, wobei der Angerufene keine App benötigt.
Ein ehrliches Zugeständnis. LiveLingo (Herausgeber dieses Leitfadens) gehört in die Kategorie der dedizierten Übersetzer, lesen Sie den Vergleich also mit diesem Wissen. GPT-Lives Gesprächsnatürlichkeit ist ein echter Fortschritt, sein Full-Duplex-Sprecherwechsel ist jeder dedizierten Übersetzer-App voraus, unserer eingeschlossen, sein Gratis-Plan macht es zum einfachsten Weg, Live-Sprachübersetzung heute auszuprobieren, und es hielt die Dolmetscherrolle 27 Minuten lang ohne einen einzigen Aussetzer. Was es nicht schafft, ist, mit einem Sprecher Schritt zu halten, der nicht wartet. Spezifikationen im direkten Vergleich: /compare/chatgpt-translation. Vollständige Messwerte: /research/gpt-live-1-interpreter-test. OpenAIs komplettes Übersetzungsangebot: /de/guides/openai-live-translation.
8. Häufig gestellte Fragen
Was ist GPT-Live?
GPT-Live ist OpenAIs Full-Duplex-Sprachmodellfamilie, vorgestellt in ChatGPT am 8. Juli 2026. Zwei Modelle erschienen: GPT-Live-1 (Standard für die Bezahlpläne Go, Plus und Pro) und GPT-Live-1 mini (Standard für Gratis-Nutzer). Anders als der abgelöste Advanced Voice Mode hört und spricht GPT-Live gleichzeitig. Es lässt sich natürlich unterbrechen, gibt Rückmeldelaute, während man spricht, und liefert Live-Übersetzung, noch während man redet. Komplexe Anfragen delegiert es im Hintergrund an GPT-5.5. Es läuft auf iOS, Android und chatgpt.com und steht seit dem 10. September 2026 auch Entwicklern als gpt-live-1 in der OpenAI-API zur Verfügung.
Kann GPT-Live in Echtzeit übersetzen?
Ja, und in den Messungen fiel es über 27 Minuten Audio kein einziges Mal aus der Dolmetscherrolle. Die Übersetzung wird per Prompt gestartet, nicht über einen Modus-Schalter: Sagen Sie dem Assistenten "übersetze simultan alles, was ich sage, ins Japanische", und er spricht eine laufende Übersetzung, während Sie reden. Die Grenze liegt beim Tempo, nicht beim Gehorsam: Über eine Sitzung von 452 Sekunden stieg die Fertigstellungsverzögerung bei Englisch nach Spanisch von 5,7 Sekunden auf ein Plateau von 10 bis 14 Sekunden.
Hat GPT-Live eine API?
Ja, seit dem 10. September 2026. GPT-Live-1 ist als Modell gpt-live-1 am Endpunkt v1/live/sessions verfügbar, zu $0.05 pro Gesprächsminute für die Sprachschicht; das Backend-Modell, das das Reasoning übernimmt, wird separat abgerechnet. Das hat sich gegenüber dem ChatGPT-Debüt vom 8. Juli geändert, als GPT-Live ein reines ChatGPT-Feature war. OpenAI bietet zusätzlich ein eigens gebautes Übersetzungsmodell an, gpt-realtime-translate, zu $0.034 pro Minute mit 70+ Eingabesprachen und 13 Ausgabesprachen.
Wie viel Verzögerung fügt GPT-Live beim Übersetzen hinzu?
Gemessen über die API am 15. September 2026: im Median 11,72 Sekunden, bis ein Satz auf Spanisch fertig ausgegeben ist, mit einem Anstieg im Lauf der Sitzung von 5,7 Sekunden in der ersten Minute auf ein Plateau von 10 bis 14 Sekunden ab der dritten Minute. Auf identischem Audio maß OpenAIs eigenes gpt-realtime-translate 2,65 Sekunden, Gemini 3.5 Live Translate 1,51 Sekunden und LiveLingo 0,94 Sekunden, alle drei über dieselben 452 Sekunden konstant statt driftend.
Warum hat GPT-Live Probleme mit der japanischen Übersetzung?
Es fällt so weit zurück, dass es nicht mehr aufholt. Nur 17% der japanischen Sätze wurden innerhalb von 30 Sekunden nach dem Sprechen übersetzt, gegenüber 98% beim selben Modell ins Spanische; die Ausgabe kam im Median 50,7 Sekunden zu spät, und 20 von 90 Sätzen wurden überhaupt nie übersetzt. Das Ergebnis ließ sich in zwei Durchläufen reproduzieren. OpenAIs spezialisiertes gpt-realtime-translate deckte auf demselben Audio 98% bei konstanten 3,33 Sekunden ab. Der Einbruch hängt also daran, ein Konversationsmodell zum Dolmetschen zu prompten, und nicht an OpenAIs Japanisch.
Ist GPT-Live kostenlos?
In ChatGPT ja, mit einer Plan-Aufteilung. GPT-Live-1 mini ist das Standard-Sprachmodell für kostenlose ChatGPT-Konten; die Bezahlpläne Go, Plus und Pro erhalten das größere GPT-Live-1. Ein neues Abo wurde nicht eingeführt, und die Nutzungslimits für Voice variieren je nach Plan, ohne veröffentlichte Minutenkontingente. Die API ist davon getrennt und wird mit $0.05 pro Minute für die Sprachschicht plus Nutzung des Backend-Modells abgerechnet.
Welche Sprachen unterstützt GPT-Live für die Übersetzung?
OpenAI hat keine Sprachliste veröffentlicht. Die Launch-Materialien sagen, Voice sei für "die meisten gesprochenen Sprachen" optimiert, und legen für andere Akzent- und Sprachbeherrschungslücken offen. Das gemessene Verhalten unterscheidet sich stark nach Sprache: Dasselbe Modell deckte 98% der spanischen Sätze innerhalb von 30 Sekunden ab, aber nur 17% der japanischen. OpenAIs entwicklerorientiertes Übersetzungsmodell gpt-realtime-translate dokumentiert 70+ Eingabesprachen und 13 Ausgabesprachen: Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Russisch, Chinesisch, Japanisch, Koreanisch, Hindi, Indonesisch und Vietnamesisch.
Wie schlägt sich GPT-Live gegen Gemini Live bei der Übersetzung?
Unterschiedliche Architektur-Entscheidungen, und beide sind inzwischen messbar. GPT-Live ist ein Full-Duplex-Konversationsassistent, der auf Anfrage übersetzt. Googles Gemini 3.5 Live Translate ist ein dediziertes Streaming-Sprache-zu-Sprache-Modell. Auf identischem Audio von 452 Sekunden hielt Gemini eine konstante Fertigstellungsverzögerung von 1,51 Sekunden bei Englisch nach Spanisch und 1,92 Sekunden ins Japanische, während gpt-live-1 im Spanischen auf ein Plateau von 10 bis 14 Sekunden stieg und im Japanischen nur 17% der Sätze innerhalb von 30 Sekunden abdeckte. Ein dedizierter Übersetzungspfad hält einen konstanten Versatz, statt Verzögerung anzusammeln.
Wie wechselt man von GPT-Live zurück zum Advanced Voice Mode?
Öffnen Sie die ChatGPT-Voice-Einstellungen und wählen Sie den Advanced Voice Mode aus. GPT-Live hat ihn am 8. Juli 2026 als Standard abgelöst, aber OpenAI hat den alten Modus wählbar gelassen, für Nutzer, die Funktionen brauchen, die GPT-Live nicht unterstützt, etwa Video und Screensharing.
Wie verhindert man, dass GPT-Live unterbricht oder "mhmm" sagt?
In der Konsumenten-App lassen sich die Rückmeldelaute nicht vollständig abschalten. Die Abhilfe ist eine explizite Anweisung zu Beginn der Sitzung, etwa "übersetze nur, was ich sage, und füge nichts hinzu". In den API-Messungen hielt diese Anweisung ausnahmslos, mit null Rollenbrüchen über 27 Minuten. Die Dolmetscherrolle selbst ist also zuverlässig, auch wenn Gesprächseinwürfe in ChatGPT weiterhin möglich sind. Blockiert das Verhalten Ihren Anwendungsfall, bleibt der Advanced Voice Mode in den Voice-Einstellungen wählbar.
Welches Tool sollte man aktuell für die Live-Übersetzung von Gesprächen nutzen?
Für kurze Wortwechsel ist GPT-Live gut und innerhalb von ChatGPT kostenlos. Für kontinuierliche Sprache, also ein Meeting, einen Vortrag oder ein langes Telefonat, nimmt man einen spezialisierten Weg. Gemessen auf identischem Audio von 452 Sekunden lag die Fertigstellungsverzögerung bei 0,94 Sekunden für LiveLingo, 1,51 für Gemini 3.5 Live Translate und 2,65 für OpenAIs eigenes gpt-realtime-translate, alle konstant, gegenüber steigenden 10 bis 14 Sekunden für das geprompte gpt-live-1. Für übersetzte Anrufe an normale Rufnummern wählt keine der OpenAI-Oberflächen; das ist eine andere Produktkategorie.
9. Quellen
- OpenAI. Introducing GPT-Live. OpenAI blog, 8. Juli 2026. openai.com
- OpenAI Developers. GPT-Live-1 model reference (API-Verfügbarkeit, Endpunkt, Preis). developers.openai.com
- OpenAI. GPT-Live system card. OpenAI Deployment Safety, Juli 2026. deploymentsafety.openai.com
- OpenAI. ChatGPT Voice (Hilfezentrum). help.openai.com
- TechCrunch. OpenAI releases new voice models for more natural live conversations, 8. Juli 2026. techcrunch.com
- MarkTechPost. OpenAI Releases GPT-Live and GPT-Live-1 mini: Full-Duplex Voice Models That Delegate Deeper Reasoning to GPT-5.5, 8. Juli 2026. marktechpost.com
- MacRumors. OpenAI Introduces GPT-Live to Make ChatGPT Voice Feel Like a Real Conversation, 8. Juli 2026. macrumors.com
- The Decoder. ChatGPT can now listen and talk at the same time, Juli 2026. the-decoder.com
- Simon Willison. Introducing GPT-Live (Notizen aus dem Vorabzugang), 8. Juli 2026. simonwillison.net
- OpenAI Developers. gpt-realtime-translate model reference und realtime translation guide. developers.openai.com
- Artificial Analysis. Speech to Speech Quality Index (Platzierung von GPT-Live-1 und Zeit bis zum ersten Audio). artificialanalysis.ai
- LiveLingo Research. GPT-Live-1 Interpreter Test, 15. September 2026. Daten pro Clip unter CC-BY 4.0. livelingo.io/research/gpt-live-1-interpreter-test
- LiveLingo Research. Real-Time Voice Translation Benchmark 2026. livelingo.io/research/benchmark-2026. Dataset DOI: 10.5281/zenodo.21250032
- LiveLingo. ChatGPT-Übersetzung 2026: Voice Mode, gpt-realtime-translate API und Whisper im Vergleich. livelingo.io/de/guides/openai-live-translation
Am 16. September 2026 aktualisiert, weil GPT-Live-1 am 10. September 2026 die OpenAI-API erreicht hat, und ergänzt um die ersten unabhängigen Messungen seines Übersetzungsverhaltens. Modellnamen, Plan-Zuordnung, Endpunkt und Preise wurden am 16. September 2026 gegen OpenAIs Entwicklerdokumentation geprüft. Die Messwerte betreffen das API-Modell und nicht die ChatGPT-Konsumentenerfahrung; OpenAI kann Pläne, Limits, Sprachabdeckung und Modellverhalten schnell ändern.