Hírek / AI Modellek / OpenAI GPT-Live: 5 döntő újítás az emberibb ChatGPT-hanghoz
OpenAI GPT-Live

OpenAI GPT-Live: 5 döntő újítás az emberibb ChatGPT-hanghoz

Az OpenAI GPT-Live hangmodellcsaláddal az OpenAI 2026. július 8-án bemutatta azt, amit a ChatGPT hangalapú használatának eddigi legnagyobb átalakításának szán: két új modell, a GPT-Live-1 és a GPT-Live-1 mini arra készült, hogy a beszélgetés folyamatos, megszakítás nélküli és emberibb legyen. A modellek iOS-en, Androidon és a ChatGPT.com felületén azonnal elérhetők.

A hír azért fontos, mert az OpenAI nem egyszerűen egy hangot cserélt le. A GPT-Live egy új architektúrát hoz, amely szétválasztja a beszélgetést és a mélyebb gondolkodást — és a saját méréseik szerint a felhasználók háromnegyede ezt jobbnak találja a korábbi Advanced Voice Mode-nál.

Mi új az OpenAI GPT-Live hangmodellekben?

A korábbi hangasszisztensek jellemzően egy merev láncot követtek: a beszédet szöveggé alakították, a szöveget egy nyelvi modell feldolgozta, majd a választ visszaalakították beszéddé. Ez a felépítés lassú volt, és könnyen félbeszakadt egy szünettől vagy háttérzajtól. A ChatGPT korábbi turn-based Advanced Voice Mode-ja is ebbe a merev, felváltva beszélő logikába illeszkedett.

A GPT-Live ezzel szemben full-duplex működésű. Ez azt jelenti, hogy a modell másodpercenként többször hoz interakciós döntést: beszéljen, hallgasson, tartson szünetet, szakítsa félbe a felhasználót, vagy hívjon meg egy eszközt. Nem vár arra, hogy „köre legyen”, hanem folyamatosan reagál — ahogy egy valódi beszélgetőpartner tenné.

Ez a különbség a gyakorlatban ott érződik, ahol a régi asszisztensek elakadtak: közbevágásnál, gondolkodó szüneteknél vagy amikor menet közben pontosítasz valamit.

Smart Delegation: a beszélgetés és a nehéz munka szétválik

A GPT-Live legfontosabb technikai újítása a Smart Delegation, vagyis az intelligens delegálás. A hangot lebonyolító GPT-Live modell le van választva a mélyebb munkáról. Amikor a feladat webkeresést, tudományos következtetést vagy összetettebb ágens-műveletet igényel, a GPT-Live ezt a háttérben futó erősebb modellnek adja át — indításkor a GPT-5.5-nek —, miközben végig fenntartja a beszélgetést veled.

Ez azt a régi frusztrációt oldja meg, amikor a hangasszisztens „elgondolkodott”, és közben néma maradt. A GPT-Live tud beszélni hozzád, jelezni, hogy dolgozik a válaszon, miközben a nehéz számítás a háttérben zajlik.

A felhasználó ráadásul állíthatja, milyen mélyen gondolkodjon a rendszer. Három fokozat közül lehet választani: Instant (a GPT-5.5 Instant fut a háttérben), Medium és High (a GPT-5.5 Thinking egyre nagyobb mélységgel). Minél magasabb a fokozat, annál pontosabb, de annál lassabb a válasz.

Hogyan teljesít a GPT-Live a benchmarkokon?

Az OpenAI közvetlen összehasonlítást közölt a korábbi Advanced Voice Mode-dal (AVM) szemben. A számok forrása maga a bejelentés, ezért ezek gyártói mérések — de a nagyságrendjük beszédes.

Az 5–10 perces teszteken a felhasználók a GPT-Live-1-et az esetek 75,7%-ában, a GPT-Live-1 minit pedig 69,2%-ában preferálták az AVM-mel szemben. A beszélgetés folyamatosságát 7-es skálán értékelve a GPT-Live-1 4,96 pontot kapott, a mini 4,33-at, míg a régi AVM csak 3,80-at.

A tényleges intelligenciában még nagyobb a szakadék. A GPQA tudományos következtetési teszten az AVM mindössze 45,3%-ot ért el, míg a GPT-Live-1 az Instant fokozaton 76,5%-ot, High fokozaton pedig 84,2%-ot. A GPQA egy nehéz, szakértői szintű kérdéssor, amely azt méri, mennyire tud a modell valódi tudományos problémákon gondolkodni.

A webes ágens-feladatokat mérő BrowseComp teszten a különbség drámai: a régi AVM 0,7%-on teljesített, a GPT-Live-1 High fokozata viszont 75,2%-on.

Ez a több mint százszoros különbség jól mutatja a Smart Delegation lényegét: a hangmodell önmagában nem lett mindentudó, de hozzáfér a háttérben futó erős modell képességeihez. A közbenső fokozatok is meggyőzőek — a GPT-Live-1 Medium 60,6%-ot ért el ugyanezen a BrowseComp teszten.

Vizuális kártyák és a jelenlegi korlátok

A GPT-Live nem csak hang. Beszéd közben a kijelzőn gazdag vizuális kártyák jelennek meg: időjárás, részvényárfolyamok, sporteredmények, térképek és hasonló adatok. Így a hangalapú válasz kiegészül a szemmel is befogadható információval, ami a telefonos használatnál különösen hasznos.

Fontos ugyanakkor a korlátokat is látni. Indításkor a GPT-Live nem támogat videót vagy képernyőmegosztást — vagyis a kamerán keresztüli, „mutasd meg, mit látsz” típusú interakció egyelőre kimarad. Ez a funkció más asszisztenseknél már megjelent, így itt az OpenAI jelenleg lemaradásban van.

Milyen biztonsági korlátokat épített be az OpenAI?

A hangalapú, folyamatos beszélgetés új kockázatokat is hoz, és az OpenAI ezt külön kezelte. A modelleket kiterjesztett audio-natív és szintetikus teszteknek vetették alá a legfőbb kockázati területeken: önkárosítás, pszichózis, függőség, erőszak és szexuális tartalom.

Bevezettek egy valós idejű beavatkozási mechanizmust is (safe steering), amely már a beszélgetés közben képes eltéríteni a választ egy biztonságosabb irányba, nem csak utólag szűrni. Ez a folyamatos hangbeszélgetésnél azért fontos, mert itt nincs „elküldés” gomb, ami előtt szűrni lehetne.

A hang-imitáció ellen is megelőző korlátokat állítottak: a GPT-Live 9 beépített hangot használ, és nem engedi tetszőleges hang klónozását. Ez a deepfake-jellegű visszaélések egy részét eleve kizárja.

Kinek érdemes már most kipróbálnia?

A hozzáférés az előfizetéstől függ. A GPT-Live-1 alapértelmezetten elérhető a Go, Plus és Pro felhasználóknak, míg az ingyenes (Free) felhasználók a GPT-Live-1 mini modellt kapják. Az API-elérhetőség egyelőre nem indult el, csak „hamarosan” jelzést kapott — ez a fejlesztők számára fontos korlát, mert saját alkalmazásba még nem építhető be.

A benchmarkok és a felépítés alapján az alábbi öt döntéshozói következtetés vonható le arról, mit jelent a GPT-Live a gyakorlatban.

5 döntéshozói következtetés a GPT-Live-ról

  1. A hang végre komoly munkára is alkalmas: a BrowseComp 0,7%-ról 75,2%-ra ugrása azt jelzi, hogy a hangasszisztens már valódi webes és ágens-feladatokra is bevethető, nem csak időjárás-lekérdezésre.
  2. A delegálás a jövő mintája: a beszélgetés és a nehéz gondolkodás szétválasztása olyan architektúra, amit más gyártók is átvehetnek — érdemes ehhez igazítani a saját AI-integrációs terveket.
  3. A fokozatok költség-kompromisszumot jelentenek: az Instant gyors, a High pontos, de lassabb. Aki ügyfélszolgálati vagy belső hangfolyamatot tervez, tudatosan válasszon a sebesség és a pontosság között.
  4. Az API hiánya most korlát: saját termékbe egyelőre nem építhető be a GPT-Live, ezért éles fejlesztést még nem érdemes rá tervezni.
  5. A videó hiánya rés a piacon: a képernyőmegosztás és kameraalapú interakció kimaradása versenyhátrány, amit a következő verziók valószínűleg pótolnak — ez érdemi különbség a rivális asszisztensekhez képest.

A hang lesz az AI következő fő felülete

A GPT-Live nem csupán egy kellemesebb hangú ChatGPT. A full-duplex architektúra és a Smart Delegation együtt azt jelzi, hogy az OpenAI a hangot már nem kényelmi funkciónak, hanem elsődleges felületnek tekinti — olyannak, amelyen keresztül a teljes modellintelligencia elérhető.

A benchmarkszakadék a régi AVM és az új modellek között akkora, hogy a hangalapú AI eddigi „butább testvér” státusza gyakorlatilag megszűnt. A valódi kérdés már nem az, hogy a hang működik-e jól, hanem az, hogy mikor kap videót és nyílt API-t.

Kapcsolódó modell-elemzésünkben részletesen összehasonlítjuk a piac vezető szolgáltatásait: Melyik AI előfizetés éri meg 2026-ban? ChatGPT vs Claude vs Gemini vs Codex. A hivatalos részletek az OpenAI bejelentésében olvashatók. További AI-modell hírekért iratkozz fel az AI Hírek hírlevelére.

Vélemény, hozzászólás?

Az e-mail címet nem tesszük közzé. A kötelező mezőket * karakterrel jelöltük