Mire használható a GPT-Live API? A GPT-Live-1 az OpenAI full-duplex hangmodellje, amely egyszerre hallgat és beszél. 2026. szeptember 10. óta az API-ban is elérhető, így beépíthető saját alkalmazásba, weboldalba és telefonos rendszerbe. Tipikus felhasználása a telefonos időpontfoglalás, a rendelésstátusz-ügyintézés, az első szintű AI telefonos ügyfélszolgálat élő átadással, a weboldali hangasszisztens, a nyelvgyakorlás és a hangvezérelt belső eszközök. A modell a beszélgetést viszi, a gondolkodást és az eszközhívásokat pedig egy általad választott háttérmodellnek (például a GPT-5.6 Lunának, a GPT-5.6 Terrának vagy a GPT-6 Astrának) adja át, miközben a hívó tovább beszélhet.
Mennyibe kerül, és működik magyarul? A hangréteg ára 0,05 dollár percenként, másodpercre számlázva, ami az MNB 2026. szeptember 11-i árfolyamán 15,69 forint percenként. A háttérmodell tokenjei külön díjat jelentenek; saját kalkulációnk szerint egy hívás a három KKV-forgatókönyvben telefonvonallal együtt 42,72 és 75,04 forint közé esik. A magyar nyelvre az OpenAI nem adott ki dokumentált támogatást: a 12 új hang angol és brazíliai portugál, ezért magyar bevezetés előtt valódi hívásokkal futtatott pilot kell. Az EU-s adatrezidencia elérhető, 10 százalékos felárral.
2026. július 8-án az OpenAI a ChatGPT-be tette be a GPT-Live-ot, és akkor csak annyit ígért, hogy az API „hamarosan" jön. Erről a fogyasztói indulásról a ChatGPT új hangjáról, a GPT-Live-ról szóló cikkünkben írtunk részletesen. Két hónappal később, szeptember 10-én megjött a fejlesztői változat is.
Ez a cikk nem a „mi az a GPT-Live" kérdésre felel, hanem arra, amit egy fejlesztő vagy egy cégvezető ilyenkor kérdez: mit lehet vele építeni, mennyibe kerül forintban, és hol lehet elcsúszni vele. Végigolvastuk a teljes fejlesztői dokumentációt, kiszámoltuk három tipikus KKV-forgatókönyv havi költségét, és összegyűjtöttük azokat a buktatókat, amelyek a bejelentésből nem derülnek ki.
Mit jelentett be az OpenAI a GPT-Live API-ról szeptember 10-én?
Az OpenAI hivatalos bejelentése szerint a GPT-Live-1 ugyanazt a természetes, közbevágható beszélgetést hozza az API-ba, amit a ChatGPT hangmódjában július óta használnak. A fejlesztői kiadásnál a cég az irányíthatóságra helyezte a hangsúlyt: a hangnemet, a tempót és a beszélgetési stílust a system prompt állítja be.
A bejelentés hat fő képességet sorol fel:
- Megszakítás-kezelés egyetlen modellben, a láncolt beszédfelismerő–nyelvi modell–beszédszintetizátor architektúra késleltetése és törékeny átadásai nélkül.
- Érvelés és eszközhívás delegálása egy háttérmodellnek, például a GPT-6 Astrának vagy más szolgáltató modelljének.
- Hangnem, tempó és stílus beállítása a system promptban.
- Csend és háttérzaj jobb kezelése, anélkül, hogy a modell megszakítaná a beszélgetést vagy minden lépést hangosan narrálna.
- Megbízhatóbb hosszú sessionök, jobb kontextusmegtartással.
- Telefonos támogatás full-duplex hangügynökökhöz, az éttermi foglalástól az ügyfélszolgálatig.
| Jellemző | Érték |
|---|---|
| Modellnév az API-ban | gpt-live-1 |
| Ár | 0,05 $ / perc, másodpercre számlázva; a háttérmodell és az eszközök külön |
| Bemenet és kimenet | hang és szöveg; kép és videó nem támogatott |
| Végpont | v1/live/sessions (a Chat Completions, a Responses és a Realtime végponton nem érhető el) |
| Funkciók | streaming és function calling igen; structured outputs és finomhangolás nem |
| Kontextusablak | 128 000 token (instrukciók, szöveg és hangtokenek együtt) |
| Egyidejű sessionök | Tier 1: 25, Tier 2: 50, Tier 3: 200, Tier 4: 300, Tier 5: 500; ingyenes szinten nem érhető el |
| Hangok | 12 új hang: 10 angol, 2 brazíliai portugál; egyedi hang az értékesítésen keresztül |
| Tudásdátum | 2025. július 31. |
| Adatrezidencia | USA és Európa (az adatrezidenciás végpont 10% felárral) |
Az elnevezés röviden: a GPT-Live a modellcsalád neve, a GPT-Live-1 az API-ban elérhető modell (azonosítója gpt-live-1), a GPT-Live-1 mini pedig a ChatGPT ingyenes felhasználóinak szánt kisebb változat. Az API-ban egyelőre csak a GPT-Live-1 érhető el, az OpenAI árlistáján a mini nem szerepel. Aki nagyvállalati szinten, saját fejlesztés nélkül keres megoldást, annak az OpenAI a szintén GPT-Live-1-re épülő OpenAI Presence platformot kínálja, amelyhez a fiókmenedzseren keresztül lehet hozzáférni.
Hogyan működik a GPT-Live API? Beszélgetés és háttérmodell kettéosztva
A legfontosabb különbség a korábbi hangmodellekhez képest az, hogy a GPT-Live két részre bontja a munkát. A fejlesztői dokumentáció szerint a GPT-Live a beszélgetést kezeli: hallgat, beszél, és eldönti, mikor kér segítséget. A háttér (backend) végzi az átadott feladatokat, vagyis információt keres, eszközt hív és lezárja a műveletet.
A hangréteg és a háttér közötti feladatátadást az OpenAI delegálásnak hívja. A gyakorlatban így néz ki: a hívó megkérdezi, hol tart a rendelése, a háttér lekérdezi a státuszt, közben a hívó hozzátesz még egy részletet, és a modell akkor mondja el az eredményt, amikor megérkezett. Nincs kínos csend, és nem kell megvárni, amíg a gép „befejezi a gondolkodást".
A The New Stack elemzése jól összefoglalja az ötletet: a fejlesztőnek nem kell a teljes láncot menedzselnie, egy modell viszi a beszélgetést, a nehezebb gondolkodás pedig máshol történik. A háttérmodell lehet a GPT-6 Astra, egy kisebb modell, mint a Luna, vagy akár egy másik szolgáltató modellje.
Responses vagy kliens delegálás: melyiket válaszd?
A delegálási útmutató két módot kínál, és a választás a session létrehozásakor dől el. Menet közben nem lehet váltani, ahhoz új session kell.
| Szempont | Responses delegálás | Kliens delegálás |
|---|---|---|
| Ki futtatja a háttérmunkát? | Az OpenAI által hosztolt Responses-modell | A te alkalmazásod, bármilyen modellel vagy szolgáltatással |
| Fejlesztési ráfordítás | Kisebb: a GPT-Live készíti elő a kéréseket és kezeli a kapcsolatot | Nagyobb: a kontextust és a hívásokat te építed |
| Eredmények ellenőrzése | A háttér válasza közvetlenül a GPT-Live-hoz jut | Validálhatod, kitakarhatod vagy eldobhatod, mielőtt továbbmegy |
| Támogatott eszközök | Function és web_search | Bármi, amit a saját backended tud |
| Mikor ideális? | Első prototípus, egyszerű eszközlánc | Meglévő szöveges ügynök, több modell, szigorú adatkezelés |
Az OpenAI azt javasolja, hogy Responses delegálással kezdj, és akkor válts kliens módra, ha a háttér kontextusa, végrehajtása vagy a visszaküldött eredmények felett több kontroll kell. Háttérmodellnek a dokumentáció a GPT-5.6 Terrát ajánlja kiindulásként, költségérzékeny terhelésre pedig a GPT-5.6 Lunát.
Milyen bekötési módjai vannak a GPT-Live-nak az OpenAI API-ban?
- WebRTC böngészős hangalkalmazásokhoz: a hang médiasávon, az események adatcsatornán mennek.
- WebSocket szerveroldali integrációhoz, például egy telefonos hangfolyam továbbításához.
- Sideband kapcsolat, amellyel a szervered egy már futó sessionhöz csatlakozik: átiratot olvas, eszközt futtat, utasítást küld, miközben a hang a böngészőben vagy a telefonvonalon marad.
- Telefonos és SIP bekötés, közvetlen SIP-trönkkel vagy szerveroldali hanghíddal.
Kész partnerintegráció van a Twilio, a Telnyx, a LiveKit és a Daily/Pipecat platformhoz. A Twilio a bejelentés napján natív GPT-Live szolgáltatót adott a Twilio Agent Connect SDK-hoz, bejövő és kimenő hívásokat bemutató útmutatókkal együtt.
Mennyivel jobb, mint a GPT-Realtime-2.1? A benchmarkok
Az OpenAI saját mérései szerint a GPT-Live-1 mind a hat közölt tesztben jobb az elődeinél: a válasza 0,798 másodperc alatt indul a GPT-Realtime-2.1 1,41 másodpercével szemben, és a Full Duplex Bench v1.5 interaktivitási tesztjén 80,1 pontot ér el a GPT-Realtime-2.1 45,4 pontjával szemben.
Az alábbi számok az OpenAI saját mérései, független ellenőrzésük még nem jelent meg. Egy részüknél a háttérben is futott egy modell, ezt a táblázat jelzi. A korábbi generációról a GPT-Realtime-2 elemzésünkben írtunk.
| Mérés | GPT-Live-1 | GPT-Realtime-2.1 | GPT-Realtime-2 |
|---|---|---|---|
| Tau3 Voice — ügyfélszolgálati feladatok (Astra medium háttérrel) | 86,2% | 45,7% | 42,4% |
| Tau Banking Voice — banki ügyintézés tudásbázissal (Astra medium háttérrel) | 32,0% | 12,4% | 10,3% |
| Full Duplex Bench v1.5 — interaktivitás | 80,1 | 45,4 | 47,8 |
| Full Duplex Bench v1 — válaszkésleltetés (a kisebb a jobb) | 0,798 mp | 1,41 mp | 1,63 mp |
| Full Duplex Bench v3 — eszközhívás (Terra low háttérrel) | 87,0% | 60,0% | 58,0% |
| Artificial Analysis Conversational Dynamics | 97,3 | 95,7 | 95,3 |
A táblázatban a „medium" és a „low" a háttérmodell gondolkodási (reasoning) szintjét jelöli. A Tau3-as ugrás látványos, de érdemes tisztán látni, mit mér. A 86,2 százalékot a GPT-Live-1 a GPT-6 Astrával a háttérben érte el, vagyis az eredmény a hangréteg és egy csúcsmodell közös teljesítménye. A késleltetési és az interaktivitási sorokat viszont az OpenAI háttérmodell megjelölése nélkül közölte.
Mire használható a GPT-Live API? 9 felhasználás a telefonos ügyfélszolgálattól a nyelvtanulásig
A GPT-Live API kilenc tipikus felhasználása: telefonos időpontfoglalás, rendelésstátusz és webshop-ügyfélszolgálat, AI telefonos ügyfélszolgálat élő átadással, weboldali hangasszisztens, nyelvtanulás, élő tolmácsolás, kihangosított munka zajos környezetben, hangvezérelt fejlesztés, valamint lead-kvalifikálás és visszahívás. Az első ügyfelek, köztük a Yelp, a Speak, a Fin, a Cognition és az EliseAI, már éles vagy tesztüzemben használják. Az alábbi lista a dokumentált eseteket és a magyar KKV-knál kézenfekvő felhasználásokat gyűjti össze.
1. AI telefonos asszisztens időpontfoglaláshoz: szalon, rendelő, autószerviz
Ez a GPT-Live „tankönyvi" esete: az OpenAI saját migrációs útmutatója is egy időpontfoglaló asszisztenssel mutatja be a működést. A háttér lekérdezi a szabad időpontokat, a hívó megerősíti a választást, és csak utána történik meg a foglalás. A Yelp a Yelp Host szolgáltatásban asztalfoglalásra és ételrendelésre használja.
„Adding GPT‑Live‑1 into Yelp Host and Hatch improved turn-taking and accuracy over our traditional voice architecture. When Yelp Host uses GPT‑Live‑1 to answer calls, like reservations and food orders, we're seeing meaningful improvements in call handling rates."
„Amikor a GPT-Live-1-et beépítettük a Yelp Hostba és a Hatchbe, a hagyományos hangarchitektúránkhoz képest javult a fordulóváltás és a pontosság. Amikor a Yelp Host a GPT-Live-1-gyel fogadja a hívásokat, például foglalásokat és ételrendeléseket, érdemben javul a sikeresen kezelt hívások aránya."
— Alex Levy, technológiai igazgató (CTO), Yelp · Forrás: OpenAI
Tipp: a foglalás megerősítését ne a promptra bízd. Az OpenAI dokumentációja egyértelmű: a prompt irányítja a modellt, de az engedélyeket és a kötelező megerősítéseket az alkalmazásod kódjának kell kikényszerítenie.
2. Rendelésstátusz és webshop-ügyfélszolgálat
A „hol a csomagom?" típusú hívások nagy számban jönnek, rövidek, és jól körülhatárolt adatot kérnek. Az OpenAI a bejelentésben példaként azt hozza, hogy a nagy volumenű feladatokhoz, például az időpontfoglaláshoz és a rendelésfrissítéshez egy kisebb modell, mint a Luna, a bonyolult ügyfélügyekhez pedig az Astra illik.
Tipp: ha a hívó telefonszáma alapján már a hívás elején be tudod tölteni a legutóbbi rendelését, add át a sessionnek induláskor. A költségoptimalizálási útmutató szerint így a hívónak nem kell megismételnie az adatokat, és a beszélgetés, vagyis a számlázott idő is rövidebb lesz.
3. AI telefonos ügyfélszolgálat élő átadással
Az első szintű ügyintézés a klasszikus AI ügyfélszolgálat és AI callcenter feladata: a hangügynök oldja meg az egyszerű ügyeket, a bonyolultakat pedig adja át embernek. A Fin ügyfélszolgálati AI-ügynök a bejelentés szerint a GPT-Live természetes beszélgetését a saját támogatási rendszerével kombinálja, hogy a mélyebb munkát is elvégezze. Telefonos bekötésnél az átadásra külön végpont van: a refer hívással a beszélgetés egy SIP-címre, például egy ügyeletes kollégához kapcsolható.
Tipp: az átadás feltételeit írd le konkrétan („ha a hívó panaszt tesz", „ha kétszer nem sikerül azonosítani"), ne csak annyit, hogy „ha szükséges". Az OpenAI prompting útmutatója a delegálási szabályoknál is ugyanezt kéri.
4. Weboldali vagy alkalmazáson belüli hangasszisztens
WebRTC-vel a böngészőből közvetlenül lehet beszélni a modellel. A dokumentáció külön leírja, hogyan adj át a modellnek rövid összefoglalót az éppen nyitott oldalról vagy a kiválasztott termékről, így érti, mire gondol a felhasználó, amikor azt mondja: „ezt a csomagot".
Tipp: a pontos adatokat, például egy rendelésszámot, engedd begépelni is. A dokumentáció szerint a begépelt értéket közvetlenül a feladatot kezelő háttérnek érdemes továbbítani, felhasználói adatként, és nem a hangmodellnek szóló utasításként.
5. AI nyelvtanulás és beszédgyakorló partner
A nyelvtanulásnál a legkínosabb hiba az, amikor a gép belevág a tanuló gondolkodási szünetébe. A Speak nyelvtanuló alkalmazás a Live Tutor óráinál pontosan ezt, a gondolkodási szünetekbe való belevágást mérte a GPT-Live-1-gyel.
„A good language tutor knows when to give learners space and when to step in, and GPT‑Live‑1 brings that naturalness to Speak’s Live Tutor Lessons—in our early evaluations, it cut interruptions during thinking pauses by almost 80% compared with previous turn-based systems."
„Egy jó nyelvtanár tudja, mikor hagyjon teret a tanulónak és mikor lépjen közbe, és a GPT-Live-1 ezt a természetességet hozza el a Speak Live Tutor óráiba. Korai méréseinkben a korábbi, fordulóalapú rendszerekhez képest közel 80 százalékkal csökkentette a gondolkodási szünetekbe való belevágást."
— Andrew Hsu, társalapító és CTO, Speak · Forrás: OpenAI
6. Élő tolmácsolás
A prompting útmutató kész tolmács-promptot is tartalmaz, amely minden elhangzott mondatot a célnyelvre fordít, és semmilyen kérést nem hajt végre. Az OpenAI szerint ezt a szerepet nem szabad összekeverni egy normál ügyfélszolgálati prompttal. Ha csak fordításra kell a hang, érdemes összevetni az OpenAI kifejezetten erre készült gpt-realtime-translate modelljével is.
7. Kihangosított munka zajos környezetben
Szerviztechnikus a gép mellett, raktáros két polc között, sofőr úton: nekik a kézmentes hangasszisztens a valódi segítség. A GPT-Live bejelentett erőssége a háttérzaj és a csend jobb kezelése, a háttérmodell pedig a gépkönyvekből vagy a raktárrendszerből adhat választ. Ez nem dokumentált ügyfélpélda, hanem a képességekből adódó lehetőség, amit a saját környezetedben kell tesztelni.
8. Hangvezérelt fejlesztés és belső eszközök
A Cognition az OpenAI bejelentésében idézett nyilatkozata szerint a Devin nevű AI-mérnökükkel a GPT-Live-1-en keresztül már úgy lehet dolgozni, mint egy csapattárssal: át lehet beszélni egy ötletet, vagy át lehet adni a munkát, amikor nem vagy a gépnél. Az OpenAI a bejelentésben mintakódot is adott a Codexszel való összekötéshez. A The New Stack szerint az EliseAI egészségügyi cég a korábbi, láncolt megoldásáról a GPT-Live-1-re váltva 23 000 sor kódot törölt, és 80 százalékkal egyszerűsítette a kódbázisát.
Tipp: hosszú háttérmunka alatt zárd le a hangsessiont. Az OpenAI költségútmutatója szerint a háttér tovább dolgozhat, a felhasználó pedig egy „Folytatás" gombbal vagy értesítésre új sessiont indíthat a mentett kontextussal.
9. Lead-kvalifikálás és visszahívás
A bejövő érdeklődőt a hangügynök kikérdezheti, rögzítheti a CRM-ben, és időpontot foglalhat neki. Kimenő hívásoknál két korlátra figyelj. Az OpenAI közvetlen SIP-bekötése csak bejövő hívást fogad, kimenő hívást partneren, például a Twilion vagy a Telnyxen keresztül lehet indítani. Az üzenetrögzítő felismeréséhez pedig a dokumentáció szerint külön, hangot elemző detektor kell, mert a GPT-Live delegálási eseménye nem adja át a nyers hangot.
Tipp: kimenő, marketingcélú hívás előtt ellenőriztesd a hozzájárulási és adatkezelési feltételeket, és a hívás elején mindig jelezd, hogy az ügyfél mesterséges intelligenciával beszél.
Mennyibe kerül a GPT-Live API forintban?
A GPT-Live-1 hangrétege 0,05 dollár percenként, másodpercre számlázva, ami az MNB 2026. szeptember 11-i árfolyamán 15,69 forint percenként, óránként 941 forint. A háttérmodell tokenjei külön díjat jelentenek. Saját kalkulációnk szerint Twilio SIP-bekötéssel és háttérmodellel együtt egy hívás a három KKV-forgatókönyvben 42,72 és 75,04 forint közé esik.
A percdíj egyszerűnek tűnik, de a költségútmutató egy fontos részletet is rögzít: az aktív sessionidőbe minden beleszámít. A díj akkor is fut, amikor a hívó beszél, amikor a modell beszél, amikor mindketten hallgatnak, és amikor a háttér dolgozik. A The Decoder összefoglalója ezért szárazon meg is jegyzi: „At $0.05 per minute, it's not cheap", vagyis percenként 5 centtel nem olcsó.
Saját kalkulációnkat három tipikus magyar KKV-helyzetre készítettük el, az MNB 2026. szeptember 11-i 313,73 forintos dollárárfolyamával. A telefonos bekötést a Twilio magyarországi árlistája szerinti SIP-interfész díjjal (0,004 $/perc) számoltuk.
| Forgatókönyv | Hívás/hó | Átlagos hossz | Hangréteg | Háttérmodell | Twilio SIP | Összesen | Hívásonként |
|---|---|---|---|---|---|---|---|
| Szépségszalon, időpontfoglalás | 300 | 2,5 perc | 11 765 Ft | 109 Ft (1 delegálás, Luna) | 941 Ft | 12 815 Ft | 42,72 Ft |
| Webshop, rendelésstátusz | 1 000 | 3 perc | 47 060 Ft | 728 Ft (2 delegálás, Luna) | 3 765 Ft | 51 552 Ft | 51,55 Ft |
| Szerviz, összetett ügyfélszolgálat | 3 000 | 4 perc | 188 238 Ft | 21 836 Ft (2 delegálás, Terra) | 15 059 Ft | 225 133 Ft | 75,04 Ft |
A számítás feltevései: delegálásonként 4 000 bemeneti és 300 kimeneti token, cache nélkül. Az OpenAI modelloldala szerint a háttérmodell ára millió tokenenként Lunánál 0,20 dollár bemenet és 1,20 dollár kimenet, Terránál 2 és 12 dollár. A táblázat nem tartalmazza a telefonszám havidíját, a fejlesztést, a hosztingot és az üzemeltetést. EU-s adatrezidenciával a hangréteg ára 10 százalékkal nő, ekkor a három forgatókönyv 13 992, 56 258 és 243 956 forint.
A GPT-Live költségtáblázatából három tanulság jön ki. Az első, hogy a költség szinte teljesen a hangidő: Luna háttérrel a háttérmodell a számlának csak 0,9–1,4 százaléka (109 forint a 12 815-ből, 728 forint az 51 552-ből), Terra háttérrel is nagyjából a tizede. A második, hogy egy óra hangidő 941 forint, csendben is.
Ez a 941 forintos óradíj nem vethető össze közvetlenül egy bérrel, mert egy ember egyszerre egy hívást visz, és nem minden munkaperce hívás. Tájékozódásnak viszont segít: a 2026-os bruttó minimálbér, a 322 800 forint, havi 174 munkaórával számolva nagyjából 1 855 forintos bruttó óradíjat jelent.
A harmadik tanulság, hogy a nagyobb háttérmodell nem feltétlenül drágább. Ha gyorsabban lezárja az ügyet, a megspórolt hangperc többet ér a plusz tokennél. Az OpenAI ezért a sikeres feladatonkénti költség mérését javasolja, a sikertelen próbálkozásokkal és újrapróbálásokkal együtt.
17 gyakorlati tipp a GPT-Live API bevezetéséhez
Az alábbi tippek a hivatalos dokumentáció útmutatóiból (bekötés, promptolás, sessionkezelés, delegálás, költség, migráció) és a saját hangbotos tapasztalatainkból állnak össze.
Tervezés és architektúra
1. Bontsd ketté a promptot. A hangmodell promptjába csak a szerep, a hangnem és a delegálási szabályok kerüljenek. Az üzleti szabályok, a folyamatok és az eszközleírások a háttér promptjába valók. A régi, egyetlen Realtime-promptot ne másold át egy az egyben.
2. Kezdd Responses delegálással, és válts, ha kell. Kliens módra akkor van szükség, ha a háttér eredményét ellenőrizni, kitakarni vagy más rendszerekkel kombinálni kell, mielőtt a modellhez jut.
3. Tartsd az állapotot az alkalmazásodban. A sessionkezelési útmutató szerint a GPT-Live tömöríti a beszélgetés előzményeit: 90 százalékos kontextustelítettség felett új hangmotort indít, amely az eredeti instrukciókat és legfeljebb 8 192 tokennyi előzményt kap meg. A megerősített foglalás, a rendelésszám és a feladat állapota ezért a te adatbázisodba kerüljön.
4. Az elhallgatás nem állítja le a háttérmunkát. Ha a hívó közbevág, hogy „mégis péntek, nem csütörtök", a háttérben futó csütörtöki lekérdezést neked kell érvényteleníteni. Verziózd a feladatot, és a késve érkező, elavult eredményt dobd el.
5. Figyelj a dupla műveletre. Ha egy eszközhívás válasza elveszett, újrapróbálás előtt ellenőrizd, nem történt-e meg már a foglalás. A dokumentáció szerint a műveleti azonosítókat és a feladatverziókat a delegálási azonosítóktól külön kell kezelni.
Promptolás magyar nyelvre
6. Magyarul írd a promptot, ha magyarul kell beszélnie. A prompting útmutató szerint az instrukciókat és a példaválaszokat azon a nyelven érdemes megírni, amelyen a modellnek beszélnie kell.
7. Ne a telefonszámból találd ki a nyelvet. Az OpenAI kifejezetten azt kéri, hogy a köszöntés nyelvét ne a hívó nevéből, telefonszámából vagy tartózkodási helyéből következtesd ki, hanem az alkalmazás adja meg.
8. Használd a hivatalos promptszerkezetet. Négy blokk kell: személyiség, visszajelzési (backchannel) szabály, közbevágási szabály és delegálási szabály. A saját magyar adaptációnk egy szalon példáján:
Te Anna vagy, a Példa Szalon nyugodt, barátságos hangasszisztense.
Természetesen, kapkodás nélkül beszélj. Légy világos és tömör, ne túlzottan lelkes.
Ha a hívó ideges, röviden ismerd el, és a következő hasznos lépésre koncentrálj.
Visszajelzési szabály: mérsékelten jelezd, hogy figyelsz ("aha", "értem"),
de ne vágj a hívó szavába.
Közbevágási szabály: ha a hívó beszélni kezd, hagyd abba, és figyelj.
Delegálási szabály:
A háttérrendszer képességei:
- Időpontok: szabad időpontok lekérdezése, foglalás, módosítás, lemondás.
Delegálj a háttérnek, ha:
- a hívó szabad időpontot kérdez, vagy foglalni, módosítani, lemondani szeretne;
- egy javítás megváltoztatja a már folyamatban lévő foglalást.
Ne delegálj, ha:
- a hívó köszön, vagy egy már elhangzott eredmény megismétlését kéri;
- előbb egy rövid tisztázó kérdés kell.
Csak akkor mondd, hogy a foglalás megtörtént, ha a háttér visszaigazolta.
Várakozás közben ne találgasd az eredményt.
9. Ne tiltsd le általánosan a „közbeszólást". A „soha ne beszélj, amíg a felhasználó beszél" típusú szabály az OpenAI szerint a hasznos figyelő hangokat („aha", „értem") is elnyomhatja. Ha más viselkedés kell, módosítsd a visszajelzési szabályt, és hallgass vissza valódi beszélgetéseket.
10. Számoknál kérdezzen vissza a modell, és a háttér adja meg a kimondható formát. Egy korábbi, Vapi-alapú magyar hangbot-kísérletünkben épp a telefonszámok visszaolvasásánál csúszott el minden: a rendszer összekeverte a számjegyeket. A GPT-Live útmutatója is azt javasolja, hogy bizonytalan név, dátum vagy szám esetén a modell egy rövid kérdéssel pontosítson. Mi ezt azzal egészítenénk ki, hogy a háttér a számot csoportokra bontva adja vissza („harminc, egy-kettő-három, négy-öt-hat-hét"), mert így kevesebb teret hagy a szabad megfogalmazásnak. Magyar nyelven ezt mindenképp teszteld.
Költségkontroll
11. Adj át minden ismert adatot a hívás elején. Minden perc, amit a hívó adategyeztetéssel tölt, 15,69 forint.
12. Ne indíts sessiont előre. WebRTC-s session létrehozásakor az OpenAI 15 másodperc hangidőt azonnal kiszámláz, amit a session elindulása után a futásidőből jóváír. A költségútmutató szerint ezzel akkor kell külön számolni, ha gyakran újracsatlakozol, vagy a sessiont azelőtt hozod létre, hogy a felhasználó beszélni akarna.
13. A felhasználási eseményeket ne add össze. A session.usage.updated esemény kumulált másodperceket jelent, nem növekményt. A végső értéket a session.closed eseményből vedd.
14. Használj prompt-cache-t a háttérben. A stabil instrukciók és eszközdefiníciók kerüljenek a háttérprompt elejére. Az OpenAI modelloldala szerint Lunánál a cache-elt bemenet ára 0,02 dollár millió tokenenként a normál 0,20 helyett.
Telefon, biztonság, tesztelés
15. Telefonnál ne alakítsd át a hangot, ha nem muszáj. A GPT-Live WebSocketen fogadja a 8 kHz-es G.711 μ-law és A-law hangot, így ha a telefonszolgáltató ugyanebben a formátumban küldi, a hangadatot konverzió nélkül továbbíthatod.
16. Számolj a moderációval és a limitekkel. Egyes moderációs események lezárják a sessiont, mások csak az aktuális beszédet vágják el. Tier 1-en egyszerre 25 session futhat, ezt vesd össze a csúcsidős hívásszámmal.
17. Tesztelj három lépcsőben. Az OpenAI „Crawl, Walk, Run" módszert javasol: először szintetikus hanggal, egylépéses kérésekre, aztán valódi emberi felvételekkel, végül szimulált hívóval, többfordulós beszélgetésben. Magyar bevezetésnél a második lépcsőben legyen tájszólás, háttérzaj, név, dátum és telefonszám is.
Beszél magyarul a GPT-Live-1?
A magyar nyelvi támogatás nem dokumentált: az OpenAI a GPT-Live-1-hez nem közölt nyelvi listát, ezért a magyar minőséget a döntés előtt pilot hívásokkal kell ellenőrizni. A sessionkezelési útmutatóban felsorolt 12 új hangból tíz angol (ausztrál, brit, ír, észak-amerikai, filippínó és amerikai déli beszédstílussal), kettő brazíliai portugál. A bejelentés szerint a cég a hangválasztékot és a nyelvi elérhetőséget a következő hónapokban bővíti.
A júliusi, fogyasztói bejelentésben az OpenAI azt írta, hogy a GPT-Live-ot a ChatGPT legnépszerűbb nyelveire optimalizálta, és egyes nyelveken a modell nem anyanyelvi akcentussal vagy akadozó gördülékenységgel beszélhet. A dokumentáció külön megjegyzi, hogy a hangok regionális jellege a beszédstílust írja le, és nem garantálja az akcentus hűségét.
A gyakorlati következtetés: magyar ügyfélszolgálatra a GPT-Live-1-et csak pilot után érdemes élesíteni. Rögzíts 30–50 valódi, anonimizált hívást, és mérd külön a beszédfelismerést (értette-e a nevet, a számot, a tájszólást) és a kimondást (természetes-e, jó-e a hangsúly). Ha a magyar hangminőség nem elég jó, a láncolt megoldás magyar beszédszintetizátorral továbbra is reális alternatíva. Erről az ElevenLabs Speech Engine cikkünkben írtunk.
GPT-Live, Realtime API vagy láncolt megoldás: melyiket válaszd?
A GPT-Live akkor jó választás, ha természetes, közbevágható beszélgetés kell, egy meglévő szöveges ügynök elé tett hangfelülettel. A Realtime API egyszerűbb ügynökhöz illik, ahol egyetlen modell végzi a beszédet, az érvelést és az eszközhasználatot. A láncolt megoldás pedig akkor jobb, ha minden lépést szövegszinten ellenőrizni kell, vagy a magyar hangminőség az elsődleges szempont.
Az OpenAI hangügynök-útmutatója három architektúrát különít el. Aki eddig az OpenAI API szöveges modelljeivel (sokan ChatGPT API-ként ismerik) épített chatbotot, annak jó hír, hogy a GPT-Live kliens delegálással a meglévő szöveges ügynök elé tehető hangfelületként, az üzleti logika és az eszközök maradhatnak. Az alábbi táblázat a hivatalos leírást egészíti ki magyar szempontokkal.
| Szempont | GPT-Live | Realtime API | Láncolt (beszédfelismerés → nyelvi modell → beszédszintézis) |
|---|---|---|---|
| Mire való? | Full-duplex beszélgetés külön háttérrel | Beszéd, érvelés és eszközhasználat egy modellben | Minden lépés külön ellenőrizhető és cserélhető |
| Árazás | 0,05 $/perc + a háttérmodell tokenjei | Hangtoken-alapú (GPT-Realtime-2.1: 32 $ bemenet, 64 $ kimenet millió hangtokenenként) | Komponensenként adódik össze |
| Csend és várakozás | Fizetős, a sessionidő fut | Hangaktivitás-érzékeléssel az üres hang nem számít bemeneti tokennek | Szolgáltatótól függ |
| Magyar hang | Nem dokumentált, pilot kell | Tesztelendő | Választható magyar hang |
| Mikor jó választás? | Természetes, közbevágható beszélgetés, meglévő szöveges ügynökkel | Egyszerűbb ügynök, egyetlen modellel | Szigorú szövegszintű ellenőrzés, vagy ha a magyar hangminőség az elsődleges |
Mikor NE a GPT-Live-ot válaszd?
- Ha a döntés a nyers hangon múlik, például üzenetrögzítő felismerésén, és nem akarsz mellé külön detektort építeni.
- Ha minden elhangzó mondatot lejátszás előtt jóvá kell hagyni. A GPT-Live beszélhet, miközben az ellenőrzés fut, és egy utólagos utasítás a már elhangzott hangot nem vonja vissza.
- Ha szó szerinti szöveg kell, például kötelező jogi tájékoztatás. Erre az OpenAI előre rögzített hangfájl lejátszását javasolja.
- Ha a hívásokban sok a várakozás, például hosszú tartásra kapcsolás. A csendes perc is 15,69 forint.
- Ha a magyar pilot nem hozza a szükséges minőséget.
GDPR, adatkezelés és EU AI Act: mire figyelj?
Az OpenAI adatkezelési oldala szerint a GPT-Live sessionök adatait nem használják tanításra. A visszaélés-figyelés célú megőrzés 30 nap, és a végpont bizonyos korlátokkal jogosult a nulla adatmegőrzésre (Zero Data Retention). A GPT-Live az Egyesült Államokban és Európában is támogatja az adatrezidenciát. Az adatrezidenciás végpontokra a 2026. március 5. után kiadott modelleknél 10 százalékos felár vonatkozik.
A hívásfelvétel alapból ki van kapcsolva. Ha a store: true beállítással bekapcsolod, a kész felvétel 30 napig letölthető sztereó WAV-fájlként, utána lejár. Fontos részlet, hogy a dokumentáció szerint nincs nyilvános végpont a tárolt session törlésére, nulla adatmegőrzés mellett pedig a tárolás automatikusan kikapcsol.
Az EU AI Act 50. cikkének átláthatósági kötelezettsége 2026. augusztus 2. óta él: az ügyfélnek tudnia kell, hogy mesterséges intelligenciával beszél. A GPT-Live-nál ezt a session elején egy session.instructions.append utasítással lehet kérni, de a dokumentáció szerint a pontos szövegű elhangzás így sem garantált. Ha a közlés szó szerinti formája jogi követelmény, játssz le előre rögzített hangüzenetet, és ellenőrizd, hogy valóban elhangzott.
A szabályozási hátteret az EU AI Act KKV-útmutatónkban foglaltuk össze. A hangfelvétel személyes adat, ezért a GDPR szerinti tájékoztatás és jogalap is kell. Ezt a bevezetés előtt egyeztesd adatvédelmi szakemberrel.
Hogyan kezdj hozzá? Bevezetés öt lépésben
- Válassz egyetlen, szűk folyamatot. Az időpontfoglalás vagy a rendelésstátusz jó kezdés: kevés eszköz kell hozzá, és a siker egyértelműen mérhető.
- Szerezz OpenAI API kulcsot, és tartsd a szerveren. A GPT-Live az ingyenes API-szinten nem érhető el, fizetős fiók kell. A kulcs a dokumentáció szerint soha ne kerüljön a böngészőbe.
- Írd meg a két promptot és a háttéreszközöket. A hangprompt magyarul készüljön, négy blokkal (személyiség, visszajelzési szabály, közbevágási szabály, delegálási szabály), a háttér Responses delegálással, GPT-5.6 Terra vagy GPT-5.6 Luna modellel.
- Kösd be a csatornát, és futtass pilotot. Weboldalra a WebRTC gyorsindító, telefonra a Twilio vagy a Telnyx partnerintegráció a legrövidebb út. Utána 30–50 hívással mérd a feladat sikerességét, a válasz indulásának idejét, a félreértett számokat és a sikeres ügyenkénti költséget.
- Élesíts átláthatósági közléssel és felügyelettel. Legyen AI-tájékoztatás, emberi átadási útvonal, és heti rendszerességgel nézd át a hívásátiratokat.
Ha a hangügynököt egy nagyobb AI-rendszer részeként terveznéd, az AI agent fejlesztési útmutatónk végigveszi a tervezés, az eszközök és a felügyelet teljes folyamatát. Az ügynökök biztonsági kockázatairól pedig az AI-ügynök incidensekről szóló cikkünkben írtunk.
Gyakori kérdések a GPT-Live API-ról
Mennyibe kerül a GPT-Live API?
A GPT-Live-1 hangrétege 0,05 dollár percenként, másodpercre számlázva, felfelé kerekítés nélkül. Ez az MNB 2026. szeptember 11-i árfolyamán 15,69 forint percenként, óránként 941 forint. A díj a csendes és a háttérmunkára várakozó időre is vonatkozik. A háttérmodell tokenjei külön díjat jelentenek: a GPT-5.6 Luna millió tokenenként 0,20 dollár bemenet és 1,20 dollár kimenet, a GPT-5.6 Terra 2 és 12 dollár. Saját kalkulációnk szerint egy 3 perces, két háttérhívásos webshop-hívás Twilio SIP-bekötéssel nagyjából 52 forintba kerül. EU-s adatrezidenciával a hangréteg 10 százalékkal drágább.
Beszél magyarul a GPT-Live-1?
Az OpenAI nem közölt nyelvi listát, és a magyar nyelvre nem adott ki dokumentált támogatást. A 12 új API-hang tíz angol és két brazíliai portugál hang. A júliusi bejelentésben a cég azt írta, hogy a GPT-Live-ot a ChatGPT legnépszerűbb nyelveire optimalizálta, és egyes nyelveken nem anyanyelvi akcentus vagy gördülékenységi hiányosság fordulhat elő. Magyar bevezetés előtt ezért 30–50 valódi, anonimizált hívással érdemes pilotot futtatni, külön mérve a beszédfelismerést és a kimondás minőségét. A promptot magyarul érdemes megírni, mert az OpenAI szerint azon a nyelven kell, amelyen a modellnek beszélnie kell.
Mi a különbség a GPT-Live és a Realtime API között?
A GPT-Live a beszélgetést kezeli, a gondolkodást és az eszközhívásokat pedig egy választható háttérmodellnek delegálja, így a hívó beszélhet, amíg a háttér dolgozik. A Realtime API-ban egyetlen modell végzi a beszédet, az érvelést és az eszközválasztást. Az árazás is eltér: a GPT-Live percdíjas (0,05 dollár percenként plusz a háttérmodell tokenjei), a GPT-Realtime-2.1 hangtoken-alapú. A GPT-Live-1 a saját v1/live/sessions végpontján fut, a Realtime végponton nem érhető el. Költségszempontból a legfontosabb különbség a csend: a GPT-Live-nál a várakozás is fizetős sessionidő, a Realtime API-ban hangaktivitás-érzékeléssel az üres hang nem számít bemeneti tokennek. Az OpenAI saját mérései szerint a GPT-Live-1 a Full Duplex Bench v1.5 interaktivitási tesztjén 80,1 pontot ért el a GPT-Realtime-2.1 45,4 pontjával szemben.
Használható a GPT-Live telefonos ügyfélszolgálatra Magyarországon?
Technikailag igen. A GPT-Live-1 támogatja a telefonos bekötést közvetlen SIP-trönkkel vagy szerveroldali hanghíddal, és kész integráció van a Twilio, a Telnyx, a LiveKit és a Daily/Pipecat platformhoz. A közvetlen SIP csak bejövő hívást fogad, kimenő hívást partneren keresztül lehet indítani. Az EU-s adatrezidencia elérhető 10 százalékos felárral. Az EU AI Act 50. cikke szerint 2026. augusztus 2. óta jelezni kell, hogy a hívó mesterséges intelligenciával beszél, a hangfelvétel pedig a GDPR szerint személyes adat. A magyar hangminőséget éles indulás előtt pilot hívásokkal kell ellenőrizni.
Kell programozni a GPT-Live használatához?
Igen, a GPT-Live-1 egy API, tehát fejlesztés kell hozzá: szerveroldali OpenAI API kulcs, sessionkezelés, háttérmodell vagy saját ügynök, telefonos használatnál pedig a vonal bekötése. Az ingyenes API-szinten nem érhető el, a Tier 1 fiók egyszerre 25 sessiont futtathat. A munkát rövidíti a Twilio Agent Connect kész GPT-Live szolgáltatója és az OpenAI WebRTC gyorsindító mintája. Nagyvállalati, saját fejlesztés nélküli megoldásként az OpenAI a szintén GPT-Live-1-re épülő OpenAI Presence platformot kínálja, amelyhez a fiókmenedzseren keresztül lehet hozzáférni.
Összegzés: kinek éri meg most a GPT-Live API?
A GPT-Live API egy magyar KKV-nak ma ott éri meg, ahol sok a rövid, ismétlődő hívás, és a sikeres kimenet egyértelmű: időpontfoglalás, rendelésstátusz, első szintű ügyintézés. Két dolgot viszont nem szabad kihagyni: a magyar nyelvű pilotot és a sikeres ügyenkénti költség mérését. A percdíj a csendre is fut, a magyar hangminőséget pedig egyelőre senki nem garantálja.
A GPT-Live-1 API két rétegre bontja a hangügynököt: a hangmodell a természetes, közbevágható párbeszédet viszi, a gondolkodást és az eszközhívásokat egy választott háttérmodell végzi. Az OpenAI saját, független ellenőrzés nélküli mérései szerint gyorsabban reagál az elődeinél (0,798 másodperc az 1,41 helyett), és GPT-6 Astra háttérrel a Tau3 ügyfélszolgálati teszten 86,2 százalékot ér el a GPT-Realtime-2.1 45,7 százalékával szemben. A Speak korai mérése pedig közel 80 százalékkal kevesebb belevágást mutatott a gondolkodási szünetekbe, a korábbi fordulóalapú rendszerekhez képest.
Hangügynököt terveznél a cégednek? Segítünk felmérni, melyik folyamatnál térül meg, melyik architektúra illik hozzá, és hogyan felel meg az EU AI Act átláthatósági szabályainak. Kérj ingyenes konzultációt, vagy nézd meg az AI agent fejlesztési szolgáltatásunkat.
A cikk AI-asszisztált kutatással és szerkesztéssel, emberi szakmai ellenőrzés mellett készült. Minden hivatkozott forrást publikálás előtt ellenőrzünk.




