Tokenek egyszerűen: mit jelentenek, és miért érdemes tudni róluk

Dióhéjban
- A token a szöveg legkisebb egysége: szó, szórészlet, szótő vagy írásjel, amellyel a modell dolgozik.
- A válasz hossza, a bemenet, a kontextusablak és a költség mind tokenben mérődik.
- A magyar szöveg a ragozás miatt jellemzően több tokent foglal, mint a szószám sugallná.
- Tömör prompttal és a releváns szöveg beillesztésével kevesebb tokent használsz.
- A bemenet és a kimenet együtt fér el a kontextusablakban, ezért mindkettőre érdemes figyelni.
A token a szöveg apró darabja, amelyre a modell a bemenetet és a kimenetet bontja: gyakran egy szó, egy szórészlet vagy egy írásjel. A modell nem betűkben vagy szavakban, hanem tokenekben számol, és ezek szabják meg a válasz hosszát, a költséget és a kontextus korlátait. Ez a cikk közérthetően bemutatja, mik a tokenek, és miért érdemes ismerned őket.
Mi az a token?
A token a szöveg legkisebb egysége, amelyre a modell feldarabolja a bemenetet és amelyben előállítja a kimenetet. Egy token gyakran egy rövidebb szó, egy hosszabb szó egy darabja, egy szótő vagy egy írásjel. A modell nem betűnként és nem is mindig szavanként dolgozik, hanem ezekben a köztes egységekben, a tokenekben.
A tokenizálás az a folyamat, amelynek során a szöveg tokenekre bomlik. A gyakori szavak sokszor egyetlen tokent alkotnak, a ritkább vagy hosszabb szavak több tokenre esnek szét. A magyar nyelvben, ahol a szavak toldalékokkal hosszúra nyúlhatnak, egy szó gyakran több tokenből áll, mint az angolban ugyanaz a jelentés.
A token nem azonos a szóval és nem is a karakterrel. Egy rövid magyar szó lehet egyetlen token, egy hosszú, ragozott szó pedig három-négy token is. Az írásjelek, a szóközök és a számok is tokeneket foglalnak. Ezért a szöveg hosszát tokenben mérve más képet kapsz, mint szó- vagy karakterszámban.
Miért érdemes tudni a tokenekről?
A tokenek ismerete azért hasznos, mert a modell minden korlátja tokenben van megadva. A válasz maximális hossza, a bemenet befogadóképessége és a feldolgozás költsége mind tokenben mérődik. Ha nem tudsz a tokenekről, meglepetésként érhet, ha a modell váratlanul rövidebb választ ad, vagy ha egy hosszú szöveg nem fér be a bemenetbe.
A tokenek határozzák meg a kontextusablak méretét is, vagyis azt, mennyi szöveget képes a modell egyszerre figyelembe venni. A bemenet és a kimenet együtt nem lépheti túl ezt a korlátot. Ha a beszélgetés vagy a beillesztett szöveg túl hosszú, a modell a korábbi részeket kénytelen figyelmen kívül hagyni, ami a válasz minőségét rontja.
A tokenek a költséget is meghatározzák a fizetős felületeken. A felhasznált tokenek száma alapján számolják a díjat, ezért a hosszú promptok és a hosszú válaszok többe kerülnek. A tokenek tudatos kezelésével rövidebb, célzottabb promptokat írhatsz, ami időt és a felhasznált erőforrást is megtakarít, miközben a válasz minősége megmarad.

Hogyan viszonyul a token a szavakhoz?
A token és a szó között nincs pontos, állandó arány, de van egy hasznos hüvelykujjszabály. Angolban egy token nagyjából háromnegyed szónak felel meg átlagosan, magyarban viszont a ragozás miatt gyakran több token jut egy szóra. Ezért ugyanaz a jelentés magyarul általában több tokent igényel, mint angolul.
A hosszú, összetett és ragozott szavak több tokenre bomlanak. Egy egyszerű, gyakori szó lehet egyetlen token, de egy ritkább, toldalékokkal ellátott szó három-négy tokenből is állhat. A szaknyelvi kifejezések és a nevek szintén több tokent foglalhatnak, mert a modell ezeket kisebb darabokra bontja a feldolgozáshoz.
A gyakorlatban a token és a szó közötti arányt nem kell fejben pontosan kiszámolnod. Elég tudnod, hogy a magyar szöveg tokenben hosszabb, mint a szavak száma sugallná, és ezzel számolni a hosszkorlátoknál. Ha egy hosszú szöveget dolgozol fel, jó előre gondolni arra, hogy tokenben számítva több helyet foglal, mint várnád.
Hogyan gazdálkodj a tokenekkel?
A tokenekkel úgy gazdálkodsz jól, ha a promptot tömören, felesleges ismétlés nélkül fogalmazod meg. Minden szó és írásjel tokent foglal, ezért a felesleges bevezetők, udvariassági fordulatok és ismétlések helyet vesznek el. A célzott, lényegre törő prompt kevesebb tokent használ, és gyakran jobb választ is ad, mert a modell a lényegre figyelhet.
A feldolgozandó szövegből hagyd el azt, ami nem szükséges a feladathoz. Ha egy hosszú dokumentumból csak egy részre van szükség, ne az egészet illeszd be, hanem a releváns szakaszt. Így a bemenet rövidebb marad, több hely jut a válasznak a kontextusablakban, és a feldolgozás is gazdaságosabb lesz.
A válasz hosszát is érdemes tudatosan szabályozni. Ha rövid összefoglalóra van szükséged, kérd egyértelműen, hogy a modell ne írjon feleslegesen hosszan. Ezzel a kimeneti tokenek számát csökkented, ami gyorsabb és gazdaságosabb választ ad. A hossz szabályozása egyszerre kíméli a kontextusablakot és a felhasznált erőforrást.
Példa: hogyan számolódnak a tokenek?
Vegyünk egy egyszerű magyar mondatot: "A kutya a kertben ül." Ez néhány szóból áll, de tokenben számolva a szóközök, az írásjel és az esetleges szórészletek miatt valamivel több egységből tevődik össze. A modell nem a mondat egészét, hanem ezeket az apró darabokat dolgozza fel egymás után.
Egy ragozott, hosszabb szó jól mutatja a különbséget. A "megbeszélhetnénk" szó egyetlen szó, de a modell több tokenre bonthatja, mert összetett szerkezetű, toldalékokkal. Ugyanez a jelenség figyelhető meg a hosszú összetett szavaknál és a szaknyelvi kifejezéseknél, amelyek tokenben aránytalanul többet foglalnak.
A gyakorlatban egy átlagos bekezdés tokenszáma érezhetően magasabb, mint a szavak száma, különösen magyar szövegnél. Ezért ha egy hosszú cikket vagy dokumentumot dolgozol fel, számolj azzal, hogy tokenben lényegesen többet foglal, mint amennyit a szószám alapján gondolnál. Ez a tudás segít reálisan megbecsülni, mi fér be a kontextusablakba.

Tokenek és a kontextusablak kapcsolata
A kontextusablak az a tokenben mért keret, amelyet a modell egyszerre képes figyelembe venni. A bemenet, vagyis a rendszerprompt, a beszélgetés előzménye és az aktuális kérés, valamint a kimenet együttesen fér el ebben a keretben. Ha a bemenet túl sok tokent foglal, kevesebb hely marad a válasznak.
Ha a beszélgetés vagy a beillesztett szöveg túllépi a kontextusablakot, a modell a legrégebbi részeket kénytelen figyelmen kívül hagyni. Ilyenkor előfordulhat, hogy a válasz elfelejt korábbi, fontos részleteket. A tokenek tudatos kezelése segít elkerülni, hogy a lényeges információ kiszoruljon a modell látóköréből.
A hosszú beszélgetéseknél érdemes időnként összefoglalni a lényeget, és a felesleges részeket elhagyni. Így a fontos információ tömörebb, kevesebb tokent foglaló formában marad a kontextusban. A token és a kontextusablak összefüggésének megértése kulcsfontosságú ahhoz, hogy hosszabb, összetettebb feladatoknál is megbízhatóan dolgozz a modellel.
Gyakori tévhitek a tokenekről
Az egyik gyakori tévhit, hogy egy token mindig egy szó. Valójában a token lehet szórészlet, szótő vagy írásjel is, és egy hosszabb szó több tokenre bomlik. Ezért a szószám és a tokenszám nem cserélhető fel, különösen a magyar nyelvben, ahol a ragozás miatt a tokenszám jellemzően magasabb.
A másik tévhit, hogy csak a válasz hossza számít a tokeneknél. Valójában a bemenet is tokent foglal, méghozzá gyakran jelentőset, hiszen a rendszerprompt, a beszélgetés előzménye és a beillesztett szöveg mind beleszámít. A teljes felhasználás a bemenet és a kimenet összege, ezért mindkettőre érdemes figyelni.
A harmadik tévhit, hogy a tokenekkel csak fejlesztőknek kell foglalkozniuk. Valójában bárkinek hasznos megértenie az alapokat, aki rendszeresen dolgozik nyelvi modellel. A tokenek ismerete segít megérteni, miért rövidül le néha a válasz, miért nem fér be egy hosszú szöveg, és hogyan írhatsz gazdaságosabb, hatékonyabb promptokat.
Hasznos forrás
A tokenek szerepéről és a promptok gazdaságos felépítéséről a hivatalos promptépítési útmutató további háttérrel szolgál. a promptépítés hivatalos útmutatója.
Gyakran ismételt kérdések
Mi az a token egyszerűen?
A token a szöveg legkisebb egysége, amellyel a modell dolgozik: gyakran egy szó, egy szórészlet, egy szótő vagy egy írásjel. A modell a bemenetet tokenekre bontja, és tokenekben állítja elő a választ is.
Egy token egyenlő egy szóval?
Nem. Egy token lehet egy egész szó, de gyakran csak egy szórészlet vagy írásjel. A hosszabb, ragozott szavak több tokenre bomlanak. A magyar nyelvben a ragozás miatt jellemzően több token jut egy szóra, mint az angolban.
Miért fontos a tokenek ismerete?
Mert a válasz hossza, a bemenet befogadóképessége, a kontextusablak és a költség is tokenben mérődik. A tokenek ismeretében megérted, miért rövidül le néha a válasz, miért nem fér be egy hosszú szöveg, és hogyan írhatsz gazdaságosabb promptot.
Hogyan csökkenthetem a felhasznált tokenek számát?
Fogalmazz tömören, kerüld a felesleges ismétlést és a hosszú bevezetőket. A feldolgozandó szövegből csak a releváns részt illeszd be, és szabályozd a válasz hosszát. Így a bemenet és a kimenet is kevesebb tokent foglal.
Mi a token és a kontextusablak kapcsolata?
A kontextusablak a tokenben mért keret, amelyben a bemenet és a kimenet együtt elfér. Ha a bemenet túl sok tokent foglal, kevesebb hely marad a válasznak, és a modell a legrégebbi részeket figyelmen kívül hagyhatja.
Miért foglal a magyar szöveg több tokent?
Mert a magyar nyelv ragozó, és a toldalékokkal hosszúra nyúló szavak több tokenre bomlanak. Ugyanaz a jelentés magyarul jellemzően több tokent igényel, mint angolul, ezért a hosszkorlátoknál érdemes ezzel számolni.
Vágj bele kész promptokkal
Több mint 225 prompt csomag vár, azonnali letöltéssel.
Prompt csomagok böngészése