LiveLingoLiveLingoTry free

Tłumaczenie GPT-Live: funkcje, ograniczenia i zmierzone opóźnienie (2026)

GPT-Live-1 i GPT-Live-1 mini to pełnodupleksowe modele głosowe OpenAI: słuchają i mówią jednocześnie, a tłumaczenie na żywo jest jedną z ich flagowych funkcji. Zadebiutowały w ChatGPT 8 lipca 2026, a 10 września 2026 trafiły do API OpenAI, dzięki czemu obietnicę tłumaczenia można wreszcie zmierzyć, zamiast przyjmować ją na wiarę. Ten przewodnik opisuje, co wydano, jak faktycznie działa tu tłumaczenie i co niezależny pomiar pokazuje o jego ograniczeniach.

Konflikt interesów

Ten przewodnik publikuje LiveLingo (Lunana Global Inc.), produkt do tłumaczenia głosowego konkurujący z tłumaczeniem głosowym ChatGPT. Mamy finansowy interes w adopcji LiveLingo. Twierdzenia faktyczne o GPT-Live są oparte na ogłoszeniu OpenAI, karcie systemowej i dokumentacji deweloperskiej oraz na niezależnych relacjach z premiery, wszystkie podlinkowane w tekście i w sekcji Źródła. Pomiary w Sekcji 5 to własne liczby LiveLingo, zebrane przez API OpenAI na tym samym audio, które dostał każdy inny system; dane per wypowiedź są opublikowane na livelingo.io/research/gpt-live-1-interpreter-test do niezależnej weryfikacji.

Szybka odpowiedź: czy GPT-Live tłumaczy na żywo?

Tak, i niezawodnie trzyma się roli tłumacza, ale przy mowie ciągłej stopniowo zostaje w tyle. W ChatGPT rozpocznij sesję głosową i powiedz na przykład: "tłumacz symultanicznie wszystko, co powiem, na hiszpański". Ponieważ modele są pełnodupleksowe, tłumaczenie płynie, gdy jeszcze mówisz. Darmowe konta dostają GPT-Live-1 mini; płatne plany Go, Plus i Pro dostają GPT-Live-1. Od 10 września 2026 deweloperzy mogą też wywołać model bezpośrednio jako gpt-live-1 w endpoincie v1/live/sessions za $0.05 za minutę plus użycie modelu zaplecza. W sesji trwającej 452 sekundy opóźnienie ukończenia wzrosło z 5,7 sekundy do plateau 10-14 sekund z angielskiego na hiszpański, a z angielskiego na japoński model przetłumaczył tylko 17% zdań w ciągu 30 sekund.

1. Co OpenAI wydało i co zmieniło się we wrześniu

OpenAI ogłosiło GPT-Live w środę 8 lipca 2026 we wpisie na blogu i transmisji na żywo (Introducing GPT-Live). Wydano dwa modele: GPT-Live-1, nowy domyślny model głosowy dla płatnych planów Go, Plus i Pro, oraz GPT-Live-1 mini, nowy domyślny dla kont darmowych (za MacRumors i The Decoder). Oba zastępują Advanced Voice Mode jako domyślny głos ChatGPT, a stary tryb pozostaje do wyboru w ustawieniach głosu.

10 września 2026 modele trafiły do API OpenAI, i to najważniejsza zmiana od premiery. GPT-Live-1 można teraz wywołać jako gpt-live-1 w endpoincie v1/live/sessions, w cenie $0.05 za minutę rozmowy za warstwę głosową, przy czym model zaplecza odpowiadający za rozumowanie jest rozliczany osobno (dokumentacja modelu). Do tego czasu obietnica tłumaczenia opierała się wyłącznie na demonstracji OpenAI i relacjach prasowych. Teraz da się ją zmierzyć bezpośrednio, i dokładnie to robi Sekcja 5.

Cechą definiującą jest pełnodupleksowe audio: model przetwarza to, co słyszy, podczas gdy mówi, podejmując decyzje interakcyjne wiele razy na sekundę, więc można mu naturalnie przerywać, odpowiada potakiwaniami ("mhm", "jasne"), gdy mówisz, albo milczy, gdy myślisz (MarkTechPost). Wszystko, co wymaga wyszukiwania w sieci, głębszego rozumowania lub pracy agentowej, GPT-Live deleguje w tle do GPT-5.5 i kontynuuje rozmowę, gdy wynik wraca. Użytkownicy mogą wybrać trzy poziomy rozumowania (Instant, Medium, High); wyższe poziomy kierują do GPT-5.5 Thinking.

Opublikowane ewaluacje OpenAI skupiają się na zdolnościach, nie na szybkości: przy poziomie High GPT-Live-1 osiąga 84,2% na GPQA wobec 45,3% dla Advanced Voice Mode oraz 75,2% na BrowseComp wobec 0,7%. W testach preferencji ludzkich GPT-Live-1 był preferowany nad Advanced Voice Mode w 75,7% rozmów, a mini w 69,2% (The Decoder, cytując ogłoszenie OpenAI). Niezależnie od tego Artificial Analysis stawia GPT-Live-1 na drugim miejscu w swoim indeksie mowa-do-mowy z wynikiem 81,5 i czasem 1,34 sekundy do pierwszego audio. OpenAI nadal nie publikuje żadnych liczb opóźnień dotyczących tłumaczenia.

2. Jak działa tłumaczenie na żywo w GPT-Live

Tłumaczenie na żywo to jedna z funkcji, które OpenAI wprost wymienia w materiałach premierowych: architektura pełnego dupleksu pozwala modelowi "prowadzić bardziej naturalną wymianę, lepiej wyczuwać czas, a nawet wykonywać tłumaczenie na żywo" (ogłoszenie OpenAI). Na briefingach prasowych OpenAI demonstrowało model wypowiadający bieżące tłumaczenie, gdy prezenter mówił.

To polecenie, nie tryb

Nie ma przełącznika tłumacza, wyboru pary językowej ani dedykowanego interfejsu tłumaczenia. Rozpoczynasz sesję głosową i instruujesz asystenta: "Chcę, żebyś tłumaczył symultanicznie wszystko, co mówię, na hindi". Model wypowiada wtedy mówione tłumaczenie w trakcie Twojej wypowiedzi i kontynuuje, aż każesz mu przestać lub zmienić kierunek. To ten sam wzorzec wywoływany poleceniem, który ChatGPT Voice ma od majowego wydania Realtime 2026; zmieniło się pełnodupleksowe dostarczanie, dzięki któremu tłumaczenie nakłada się na Twoją mowę, zamiast czekać na koniec tury.

Rola się utrzymuje, co wcale nie jest oczywiste

Oczywisty tryb awarii modelu konwersacyjnego, któremu każe się tłumaczyć, jest taki, że zaczyna odpowiadać mówcy zamiast go tłumaczyć. To się nie wydarzyło. Przez 27 minut tłumaczonego audio w pomiarach, obejmujących angielski na hiszpański, angielski na japoński i chiński na angielski, model ani razu nie odpowiedział mówcy zamiast go przetłumaczyć: żadnych pytań doprecyzowujących, żadnego komentarza, żadnego powrotu do zachowania asystenta. Problem nie leży w wykonywaniu instrukcji.

Kompromis: najpierw asystent

GPT-Live to ogólny asystent konwersacyjny, który tłumaczy na żądanie, a nie dedykowany tłumacz, i ten kształt ma konsekwencje raczej dla tempa niż dla posłuszeństwa. Model konwersacyjny mówi w naturalnym tempie i ani nie kompresuje, ani nie porzuca treści, gdy zostaje w tyle. Tłumaczenie ustne ma odwrotny wymóg: mówca idzie dalej niezależnie od wszystkiego, więc system, który nie nadąża, musi streszczać, pomijać albo zaakceptować nieograniczone opóźnienie. W aplikacji konsumenckiej potakiwania, które sprawiają, że rozmowa brzmi naturalnie ("mhm", "tak"), wstrzykują do sesji tłumaczeniowej audio niebędące tłumaczeniem, a użytkownicy z pierwszego dnia powszechnie zgłaszali je jako natrętne (BigGo).

3. GPT-Live kontra dedykowany tłumacz OpenAI

OpenAI dostarcza dwie różne powierzchnie tłumaczenia na żywo, i są to osobne stosy. 7 maja 2026 OpenAI wydało gpt-realtime-translate w Realtime API: dedykowany strumieniowy model tłumaczenia mowy na mowę, trenowany na tysiącach godzin nagrań profesjonalnych tłumaczy ustnych, skonfigurowany, aby pozostać wyłącznie w roli tłumacza i czekać na wystarczający kontekst przed wygenerowaniem mowy (ogłoszenie OpenAI). GPT-Live to ogólnego przeznaczenia pełnodupleksowy asystent, który tłumaczy na życzenie. Oba są już dostępne dla deweloperów, co po raz pierwszy umożliwia bezpośrednie porównanie.

Dwie powierzchnie tłumaczenia na żywo OpenAI według stanu na 16 września 2026. Fakty za ogłoszeniami i dokumentacją deweloperską OpenAI; pomiary za LiveLingo Research.
GPT-Live (gpt-live-1)gpt-realtime-translate
Czym jestPełnodupleksowy asystent głosowy; tłumaczenie na polecenieDedykowany strumieniowy model tłumaczenia mowy na mowę
WydanyChatGPT 8 lipca 2026; API 10 września 20267 maja 2026
DostępAplikacja ChatGPT oraz endpoint API /v1/live/sessionsRealtime API, endpoint /v1/realtime/translations
CenaZawarty w planach ChatGPT; $0.05/min przez API plus model zaplecza$0.034 za minutę audio
JęzykiNieopublikowane; "większość używanych języków", ujawnione braki akcentu70+ języków wejściowych; 13 wyjściowych (udokumentowane)
Trzyma się roli tłumaczaTak, gdy dostanie instrukcję; zero wyjść z roli w 27 minutach testówTak; z założenia wyłącznie tłumaczenie, bez promptów systemowych
Opóźnienie ukończenia, en→esMediana 11,72 s, rosnąca do plateau 10-14 sMediana 2,65 s, płasko
Pokrycie japońskiego w ciągu 30 s17%98%
TranskryptyPrzyrosty transkryptu źródła i wyjściaPrzyrosty tekstowe mowy źródłowej i tłumaczonej

13 udokumentowanych języków wyjściowych gpt-realtime-translate: angielski, hiszpański, portugalski, francuski, niemiecki, włoski, rosyjski, chiński, japoński, koreański, hindi, indonezyjski i wietnamski (OpenAI Cookbook). OpenAI nadal nie publikuje listy języków GPT-Live, więc jedynym drogowskazem jest zmierzone zachowanie, a to różni się ogromnie zależnie od języka.

Warto wprost sprostować dwie rzeczy z tygodnia premiery, bo wczesne relacje pomieszały obie. Po pierwsze, krążące w niektórych wpisach kwoty "$32 za milion tokenów audio wejścia, $64 wyjścia" nie dotyczą GPT-Live, tylko gpt-realtime-2, innego modelu. Po drugie, powtarzane w lipcu zdanie, że GPT-Live "w ogóle nie jest dostępny przez API", przestało być prawdziwe 10 września 2026: model ma dziś identyfikator gpt-live-1, endpoint v1/live/sessions i cennik $0.05 za minutę warstwy głosowej plus osobno rozliczany model zaplecza. Teksty opisujące GPT-Live jako funkcję wyłącznie ChatGPT są nieaktualne.

4. Ograniczenia ujawniane przez OpenAI i niezależne testy

  • Opóźnienie kumuluje się przy mowie ciągłej. Zmierzone opóźnienie ukończenia wzrosło z 5,7 sekundy do plateau 10-14 sekund w ciągu trzech minut przy tłumaczeniu z angielskiego na hiszpański i utrzymało się tam do końca sesji.
  • Japoński degraduje się dramatycznie. 17% zdań przetłumaczonych w ciągu 30 sekund, wobec 98% dla tego samego modelu na hiszpański, przy czym 20 z 90 zdań nie zostało przetłumaczonych w ogóle.
  • Limity użycia są realne, ale nieopublikowane. Centrum pomocy OpenAI podaje, że limity użycia głosu zależą od planu i opcji Voice oraz mogą się zmieniać. Zewnętrzne doniesienia o konkretnych liczbach są ze sobą sprzeczne; każdą konkretną wartość traktuj jako niezweryfikowaną.
  • Brak oficjalnych liczb opóźnień. OpenAI wydało benchmarki zdolności (GPQA, BrowseComp, wskaźniki preferencji), ale żadnych pomiarów czasu do pierwszego audio ani zaległości dla tłumaczenia.
  • Pokrycie językowe jest nieudokumentowane. "Większość używanych języków", z ujawnionymi nienatywnymi akcentami i brakami w płynności dla pozostałych.
  • Potakiwań nie da się w pełni wyłączyć w aplikacji konsumenckiej, choć wyraźna instrukcja "tylko tłumacz" utrzymała się bez wyjątku w testach przez API.
  • Monitoring bezpieczeństwa może się wtrącić. Według karty systemowej GPT-Live monitoring w czasie rzeczywistym może pokierować odpowiedzią lub ją przerwać, odtworzyć mówiony komunikat bezpieczeństwa albo zakończyć rozmowy wysokiego ryzyka.

5. Co pokazują niezależne pomiary

Co zmierzyliśmy (a czego nie)

Te liczby pochodzą z modelu gpt-live-1 wywoływanego przez API OpenAI, poinstruowanego, aby zachowywał się jak tłumacz symultaniczny; pomiar z 15 września 2026. To nie są pomiary konsumenckiego doświadczenia ChatGPT: darmowe konta działają na GPT-Live-1 mini, a aplikacja dokłada detekcję głosu po stronie klienta i własne promptowanie, których żaden harness nie wyizoluje. Każdy system w porównaniu dostał identyczne audio odtwarzane w identycznym tempie rzeczywistym, a dane per wypowiedź są opublikowane na livelingo.io/research/gpt-live-1-interpreter-test.

Odtwarzalność

Każdą liczbę można odtworzyć z tego samego 452-sekundowego ciągłego strumienia audio, tego samego tempa odtwarzania w czasie rzeczywistym i tego samego harnessu w Pythonie zastosowanego jednakowo do czterech systemów. Wynik japoński powtórzył się w dwóch niezależnych przebiegach. Dane per wypowiedź (per-clip.json) i metodologia są opublikowane na licencji CC-BY 4.0 na livelingo.io/research/gpt-live-1-interpreter-test.

Opóźnienie ukończenia to moment, w którym tłumaczenie zdania zostało dostarczone w całości, minus moment, w którym mówca skończył je wypowiadać. Jeden 452-sekundowy ciągły strumień, 90 zdań, identyczne audio dla każdego systemu. Pełna metodologia: /research/gpt-live-1-interpreter-test.
SystemOpóźnienie en→esOpóźnienie en→jaPokrycie japońskiego w ciągu 30 sW skali sesji
LiveLingo0,94 s0,88 s100%Płasko
Gemini 3.5 Live Translate1,51 s1,92 s99%Płasko
OpenAI gpt-realtime-translate2,65 s3,33 s98%Płasko
GPT-Live-1 (promptowany)11,72 snd.17%Rośnie do 10-14 s

Nigdy nie wychodzi z roli. Przez 27 minut tłumaczonego audio ani razu nie odpowiedział mówcy zamiast go przetłumaczyć, w żadnym kierunku. To naprawdę trudne, a dedykowane modele tłumaczeniowe nawet nie muszą tego próbować.

Stopniowo zostaje w tyle. Przy tłumaczeniu z angielskiego na hiszpański opóźnienie ukończenia wzrosło z 5,7 sekundy w zerowej minucie do plateau między 10 a 14 sekundami około trzeciej minuty i tam pozostało. Kształt tej krzywej ma znaczenie: opóźnienie nie rośnie w nieskończoność, ale słuchacz, który dołączy w szóstej minucie, słyszy tłumaczenie mniej więcej dwanaście sekund za salą.

Angielski na japoński załamuje się. Tylko 17% zdań zostało przetłumaczonych w ciągu 30 sekund, wobec 98% dla tego samego modelu na hiszpański. Mediana wyjścia spóźniała się o 50,7 sekundy, a 20 z 90 zdań nie zostało przetłumaczonych w ogóle. Model przestał generować wyjście mniej więcej siedem sekund po końcu audio, zamiast domykać zaległość, więc nie nadrobił, tylko porzucił to, do czego nie dotarł. Wynik powtórzył się w dwóch niezależnych przebiegach.

To nie jest problem OpenAI. Na identycznym japońskim audio, z tego samego konta tego samego dnia, własny gpt-realtime-translate od OpenAI utrzymał płaskie 3,33 sekundy i pokrył 98% zdań. Winne jest promptowanie pełnodupleksowego modelu konwersacyjnego do roli tłumacza, a nie dostawca. Dlatego też w kolumnie opóźnień powyżej dla japońskiego widnieje nd.: gdy piąta część treści nigdy nie dociera, mediana opisuje tylko tę część, która przetrwała.

6. Jak używać GPT-Live do tłumaczenia już dziś

  1. Zaktualizuj aplikację ChatGPT na iOS lub Android (albo użyj chatgpt.com). Konta darmowe działają na GPT-Live-1 mini; konta Go, Plus i Pro na GPT-Live-1.
  2. Dotknij ikony głosu w polu wiadomości, aby rozpocząć sesję.
  3. Podaj instrukcję tłumaczenia na początku: "Tłumacz symultanicznie wszystko, co mówię, na japoński. Nie odpowiadaj na pytania, nie komentuj, tylko tłumacz". W pomiarach ta instrukcja utrzymała się bez wyjątku.
  4. Dla rozmowy dwukierunkowej poproś o oba kierunki: "Tłumacz mój angielski na japoński, a każdy usłyszany japoński na angielski".
  5. Utrzymuj krótkie sesje. Zmierzone opóźnienie jest najmniejsze w pierwszej minucie i mniej więcej podwaja się do trzeciej, więc dzielenie długiej rozmowy na krótsze wymiany trzyma tłumaczenie bliżej mówcy.
  6. Deweloperzy mogą wywołać gpt-live-1 bezpośrednio w endpoincie v1/live/sessions albo użyć gpt-realtime-translate, jeśli zadaniem jest tłumaczenie, a nie rozmowa.

7. Kiedy GPT-Live pasuje, a kiedy nie

GPT-Live to właściwy wybór, gdy

  • Chcesz darmowego tłumaczenia na żywo bez instalacji i już używasz ChatGPT. Darmowy plan obejmuje pełnodupleksowy model głosowy.
  • Rozmowa jest krótka: pytanie o drogę, szybka wymiana, podróżna pogawędka. Dryf nie ma czasu się nawarstwić, a pierwsza wymiana sprawia wrażenie natychmiastowej.
  • Cenisz asystenta wokół tłumaczenia: możesz dopytać, uzyskać kontekst albo poprosić GPT-5.5 o sprawdzenie czegoś w trakcie rozmowy.

Inne narzędzie pasuje lepiej, gdy

  • Mowa jest ciągła. Spotkanie, wykład albo rozmowa, w której jedna strona mówi kilka minut bez przerwy, to sytuacja, w której zmierzone plateau opóźnienia na poziomie 10-14 sekund staje się całym doświadczeniem.
  • Tłumaczysz na japoński albo na dowolny język, którego zachowania nie zweryfikowałeś. Pokrycie wahało się od 98% do 17% między dwoma językami w tym samym modelu.
  • Potrzebujesz czytelnego dwujęzycznego transkryptu podczas słuchania. GPT-Live daje zapis czatu, a nie widok źródła i tłumaczenia obok siebie, który nigdy się nie przepisuje.
  • Potrzebujesz tłumaczonych rozmów telefonicznych. Żadna z powierzchni OpenAI nie dzwoni na numer telefonu. LiveLingo wykonuje połączenia wychodzące na zwykłe numery z tłumaczeniem działającym na linii, a odbiorca nie potrzebuje aplikacji.

Uczciwe przyznanie. LiveLingo (wydawca tego przewodnika) należy do kategorii dedykowanych tłumaczy, więc czytaj to porównanie z tą świadomością. Konwersacyjna naturalność GPT-Live to realny postęp, jego pełnodupleksowa wymiana tur wyprzedza każdą dedykowaną aplikację tłumacza, łącznie z naszą, darmowy plan czyni go dziś najłatwiejszym sposobem, aby ktokolwiek wypróbował tłumaczenie głosowe na żywo, a przez 27 minut utrzymał rolę tłumacza bez jednego potknięcia. Czego nie potrafi, to dotrzymać kroku mówcy, który nie czeka. Specyfikacje obok siebie: /compare/chatgpt-translation. Pełne pomiary: /research/gpt-live-1-interpreter-test. Pełna oferta tłumaczeniowa OpenAI: /pl/guides/openai-live-translation.

8. Często zadawane pytania

Czym jest GPT-Live?

GPT-Live to rodzina pełnodupleksowych modeli głosowych OpenAI, zaprezentowana w ChatGPT 8 lipca 2026. Wydano dwa modele: GPT-Live-1 (domyślny dla płatnych planów Go, Plus i Pro) oraz GPT-Live-1 mini (domyślny dla użytkowników darmowych). W przeciwieństwie do zastępowanego Advanced Voice Mode, GPT-Live słucha i mówi jednocześnie, więc można mu naturalnie przerywać, wtrąca potakiwania, gdy mówisz, i wykonuje tłumaczenie na żywo, gdy jeszcze mówisz. Złożone zapytania deleguje w tle do GPT-5.5. Działa na iOS, Android i chatgpt.com, a od 10 września 2026 jest też dostępny dla deweloperów jako gpt-live-1 w API OpenAI.

Czy GPT-Live tłumaczy w czasie rzeczywistym?

Tak, a w pomiarach ani razu nie wyszedł z roli tłumacza przez 27 minut nagrania. Tłumaczenie wywołuje się poleceniem, a nie przełącznikiem trybu: każ asystentowi "tłumaczyć symultanicznie wszystko, co powiem, na japoński", a on wypowiada bieżące tłumaczenie, gdy mówisz. Ograniczeniem jest tempo, nie posłuszeństwo: opóźnienie ukończenia wzrosło z 5,7 sekundy do plateau 10-14 sekund z angielskiego na hiszpański w sesji trwającej 452 sekundy.

Czy GPT-Live ma API?

Tak, od 10 września 2026. GPT-Live-1 jest dostępny jako model gpt-live-1 w endpoincie v1/live/sessions, w cenie $0.05 za minutę rozmowy za warstwę głosową, przy czym model zaplecza odpowiadający za rozumowanie jest rozliczany osobno. To zmiana względem premiery w ChatGPT z 8 lipca, gdy GPT-Live był dostępny wyłącznie w ChatGPT. OpenAI oferuje też osobny, dedykowany model tłumaczeniowy gpt-realtime-translate w cenie $0.034 za minutę, z 70+ językami wejściowymi i 13 wyjściowymi.

Jakie opóźnienie dodaje GPT-Live przy tłumaczeniu?

Pomiar przez API z 15 września 2026: mediana 11,72 sekundy do zakończenia dostarczenia zdania z angielskiego na hiszpański, rosnąca w trakcie sesji z 5,7 sekundy w zerowej minucie do plateau 10-14 sekund około trzeciej minuty. Na identycznym audio własny gpt-realtime-translate od OpenAI uzyskał 2,65 sekundy, Gemini 3.5 Live Translate 1,51 sekundy, a LiveLingo 0,94 sekundy, wszystkie płasko przez te same 452 sekundy, bez narastania.

Dlaczego GPT-Live ma problem z tłumaczeniem na japoński?

Zostaje w tyle na tyle mocno, że przestaje nadrabiać. Tylko 17% japońskich zdań zostało przetłumaczonych w ciągu 30 sekund od wypowiedzenia, wobec 98% dla tego samego modelu na hiszpański, mediana wyjścia spóźniała się o 50,7 sekundy, a 20 z 90 zdań nie zostało przetłumaczonych w ogóle. Wynik powtórzył się w dwóch przebiegach. Dedykowany gpt-realtime-translate od OpenAI pokrył 98% przy płaskich 3,33 sekundy na tym samym audio, więc to efekt promptowania modelu konwersacyjnego, a nie ograniczenie japońskiego u OpenAI.

Czy GPT-Live jest darmowy?

W ChatGPT tak, z podziałem na plany. GPT-Live-1 mini jest domyślnym modelem głosowym dla darmowych kont; płatne plany Go, Plus i Pro dostają większy GPT-Live-1. Nie wprowadzono nowej subskrypcji, a limity użycia głosu zależą od planu i nie mają opublikowanych progów minutowych. API jest osobne i rozliczane licznikiem: $0.05 za minutę warstwy głosowej plus użycie modelu zaplecza.

Jakie języki obsługuje GPT-Live w tłumaczeniu?

OpenAI nie opublikowało listy języków. Materiały premierowe mówią, że głos jest zoptymalizowany dla "większości używanych języków", i ujawniają braki akcentu i płynności dla pozostałych. Zmierzone zachowanie różni się drastycznie zależnie od języka: ten sam model pokrył 98% hiszpańskich zdań w ciągu 30 sekund, ale tylko 17% japońskich. Deweloperski model tłumaczeniowy OpenAI, gpt-realtime-translate, dokumentuje 70+ języków wejściowych i 13 wyjściowych: angielski, hiszpański, portugalski, francuski, niemiecki, włoski, rosyjski, chiński, japoński, koreański, hindi, indonezyjski i wietnamski.

Jak GPT-Live wypada na tle Gemini Live w tłumaczeniu?

To różne zakłady architektoniczne, a oba da się już zmierzyć. GPT-Live to pełnodupleksowy asystent konwersacyjny, który tłumaczy na żądanie. Gemini 3.5 Live Translate od Google to dedykowany strumieniowy model tłumaczenia mowy na mowę. Na identycznym 452-sekundowym audio Gemini utrzymał płaskie 1,51 sekundy opóźnienia ukończenia z angielskiego na hiszpański i 1,92 sekundy na japoński, podczas gdy gpt-live-1 urósł do plateau 10-14 sekund po hiszpańsku i pokrył tylko 17% japońskich zdań w ciągu 30 sekund. Dedykowana ścieżka tłumaczeniowa utrzymuje stały offset, zamiast kumulować opóźnienie.

Jak wrócić do Advanced Voice Mode z GPT-Live?

Otwórz ustawienia głosu w ChatGPT i wybierz Advanced Voice Mode. GPT-Live zastąpił go jako tryb domyślny 8 lipca 2026, ale OpenAI pozostawiło stary tryb do wyboru dla użytkowników, którzy potrzebują funkcji nieobsługiwanych przez GPT-Live, takich jak wideo i udostępnianie ekranu.

Jak powstrzymać GPT-Live przed przerywaniem lub mówieniem "mhm"?

W aplikacji konsumenckiej nie da się całkowicie wyłączyć potakiwań. Obejściem jest wyraźna instrukcja na początku sesji, na przykład "tłumacz tylko to, co mówię, nic nie dodawaj". W pomiarach przez API ta instrukcja utrzymała się bez wyjątku: zero wyjść z roli przez 27 minut, więc sama rola tłumacza jest niezawodna, choć w ChatGPT konwersacyjne wtrącenia nadal są możliwe. Jeśli to zachowanie blokuje twój scenariusz, Advanced Voice Mode pozostaje do wyboru w ustawieniach głosu.

Którego narzędzia użyć do tłumaczenia rozmów na żywo już teraz?

Do krótkich wymian GPT-Live jest dobry i darmowy wewnątrz ChatGPT. Do mowy ciągłej, takiej jak spotkanie, wykład czy długa rozmowa, użyj ścieżki dedykowanej. Zmierzone na identycznym 452-sekundowym audio opóźnienie ukończenia wyniosło 0,94 sekundy dla LiveLingo, 1,51 dla Gemini 3.5 Live Translate i 2,65 dla własnego gpt-realtime-translate od OpenAI, wszystkie płasko, wobec rosnących 10-14 sekund dla promptowanego gpt-live-1. Do tłumaczonych połączeń na zwykłe numery telefonów żadna z powierzchni OpenAI nie dzwoni; to inna kategoria produktu.

9. Źródła

Zaktualizowano 16 września 2026, aby uwzględnić udostępnienie GPT-Live-1 w API OpenAI 10 września 2026 oraz dodać pierwsze niezależne pomiary jego zachowania przy tłumaczeniu. Nazwy modeli, przypisanie planów, endpoint i cennik zweryfikowano 16 września 2026 względem dokumentacji deweloperskiej OpenAI. Pomiary dotyczą modelu z API, a nie konsumenckiego doświadczenia ChatGPT; OpenAI może szybko zmienić plany, limity, pokrycie językowe i zachowanie modelu.