Blog

Tokenek egyszerűen: mit jelentenek, és miért érdemes tudni róluk

N
Szerző tartalomstratéga és prompt-tervező

Tartalomstratéga és prompt-tervező, kis- és középvállalkozásoknak segít az AI bevezetésében.

Tokenek egyszerűen: mit jelentenek, és miért érdemes tudni róluk

Dióhéjban

  • A token a szöveg legkisebb egysége: szó, szórészlet, szótő vagy írásjel, amellyel a modell dolgozik.
  • A válasz hossza, a bemenet, a kontextusablak és a költség mind tokenben mérődik.
  • A magyar szöveg a ragozás miatt jellemzően több tokent foglal, mint a szószám sugallná.
  • Tömör prompttal és a releváns szöveg beillesztésével kevesebb tokent használsz.
  • A bemenet és a kimenet együtt fér el a kontextusablakban, ezért mindkettőre érdemes figyelni.

A token a szöveg apró darabja, amelyre a modell a bemenetet és a kimenetet bontja: gyakran egy szó, egy szórészlet vagy egy írásjel. A modell nem betűkben vagy szavakban, hanem tokenekben számol, és ezek szabják meg a válasz hosszát, a költséget és a kontextus korlátait. Ez a cikk közérthetően bemutatja, mik a tokenek, és miért érdemes ismerned őket.

Mi az a token?

A token a szöveg legkisebb egysége, amelyre a modell feldarabolja a bemenetet és amelyben előállítja a kimenetet. Egy token gyakran egy rövidebb szó, egy hosszabb szó egy darabja, egy szótő vagy egy írásjel. A modell nem betűnként és nem is mindig szavanként dolgozik, hanem ezekben a köztes egységekben, a tokenekben.

A tokenizálás az a folyamat, amelynek során a szöveg tokenekre bomlik. A gyakori szavak sokszor egyetlen tokent alkotnak, a ritkább vagy hosszabb szavak több tokenre esnek szét. A magyar nyelvben, ahol a szavak toldalékokkal hosszúra nyúlhatnak, egy szó gyakran több tokenből áll, mint az angolban ugyanaz a jelentés.

A token nem azonos a szóval és nem is a karakterrel. Egy rövid magyar szó lehet egyetlen token, egy hosszú, ragozott szó pedig három-négy token is. Az írásjelek, a szóközök és a számok is tokeneket foglalnak. Ezért a szöveg hosszát tokenben mérve más képet kapsz, mint szó- vagy karakterszámban.

Miért érdemes tudni a tokenekről?

A tokenek ismerete azért hasznos, mert a modell minden korlátja tokenben van megadva. A válasz maximális hossza, a bemenet befogadóképessége és a feldolgozás költsége mind tokenben mérődik. Ha nem tudsz a tokenekről, meglepetésként érhet, ha a modell váratlanul rövidebb választ ad, vagy ha egy hosszú szöveg nem fér be a bemenetbe.

A tokenek határozzák meg a kontextusablak méretét is, vagyis azt, mennyi szöveget képes a modell egyszerre figyelembe venni. A bemenet és a kimenet együtt nem lépheti túl ezt a korlátot. Ha a beszélgetés vagy a beillesztett szöveg túl hosszú, a modell a korábbi részeket kénytelen figyelmen kívül hagyni, ami a válasz minőségét rontja.

A tokenek a költséget is meghatározzák a fizetős felületeken. A felhasznált tokenek száma alapján számolják a díjat, ezért a hosszú promptok és a hosszú válaszok többe kerülnek. A tokenek tudatos kezelésével rövidebb, célzottabb promptokat írhatsz, ami időt és a felhasznált erőforrást is megtakarít, miközben a válasz minősége megmarad.

Egy magyar mondat tokenekre bontását bemutató ábra szórészletekkel
A modell a mondatot apró darabokra, tokenekre bontja; egy hosszú, ragozott szó több tokenből is állhat.

Hogyan viszonyul a token a szavakhoz?

A token és a szó között nincs pontos, állandó arány, de van egy hasznos hüvelykujjszabály. Angolban egy token nagyjából háromnegyed szónak felel meg átlagosan, magyarban viszont a ragozás miatt gyakran több token jut egy szóra. Ezért ugyanaz a jelentés magyarul általában több tokent igényel, mint angolul.

A hosszú, összetett és ragozott szavak több tokenre bomlanak. Egy egyszerű, gyakori szó lehet egyetlen token, de egy ritkább, toldalékokkal ellátott szó három-négy tokenből is állhat. A szaknyelvi kifejezések és a nevek szintén több tokent foglalhatnak, mert a modell ezeket kisebb darabokra bontja a feldolgozáshoz.

A gyakorlatban a token és a szó közötti arányt nem kell fejben pontosan kiszámolnod. Elég tudnod, hogy a magyar szöveg tokenben hosszabb, mint a szavak száma sugallná, és ezzel számolni a hosszkorlátoknál. Ha egy hosszú szöveget dolgozol fel, jó előre gondolni arra, hogy tokenben számítva több helyet foglal, mint várnád.

Hogyan gazdálkodj a tokenekkel?

A tokenekkel úgy gazdálkodsz jól, ha a promptot tömören, felesleges ismétlés nélkül fogalmazod meg. Minden szó és írásjel tokent foglal, ezért a felesleges bevezetők, udvariassági fordulatok és ismétlések helyet vesznek el. A célzott, lényegre törő prompt kevesebb tokent használ, és gyakran jobb választ is ad, mert a modell a lényegre figyelhet.

A feldolgozandó szövegből hagyd el azt, ami nem szükséges a feladathoz. Ha egy hosszú dokumentumból csak egy részre van szükség, ne az egészet illeszd be, hanem a releváns szakaszt. Így a bemenet rövidebb marad, több hely jut a válasznak a kontextusablakban, és a feldolgozás is gazdaságosabb lesz.

A válasz hosszát is érdemes tudatosan szabályozni. Ha rövid összefoglalóra van szükséged, kérd egyértelműen, hogy a modell ne írjon feleslegesen hosszan. Ezzel a kimeneti tokenek számát csökkented, ami gyorsabb és gazdaságosabb választ ad. A hossz szabályozása egyszerre kíméli a kontextusablakot és a felhasznált erőforrást.

Példa: hogyan számolódnak a tokenek?

Vegyünk egy egyszerű magyar mondatot: "A kutya a kertben ül." Ez néhány szóból áll, de tokenben számolva a szóközök, az írásjel és az esetleges szórészletek miatt valamivel több egységből tevődik össze. A modell nem a mondat egészét, hanem ezeket az apró darabokat dolgozza fel egymás után.

Egy ragozott, hosszabb szó jól mutatja a különbséget. A "megbeszélhetnénk" szó egyetlen szó, de a modell több tokenre bonthatja, mert összetett szerkezetű, toldalékokkal. Ugyanez a jelenség figyelhető meg a hosszú összetett szavaknál és a szaknyelvi kifejezéseknél, amelyek tokenben aránytalanul többet foglalnak.

A gyakorlatban egy átlagos bekezdés tokenszáma érezhetően magasabb, mint a szavak száma, különösen magyar szövegnél. Ezért ha egy hosszú cikket vagy dokumentumot dolgozol fel, számolj azzal, hogy tokenben lényegesen többet foglal, mint amennyit a szószám alapján gondolnál. Ez a tudás segít reálisan megbecsülni, mi fér be a kontextusablakba.

A bemenet és a kimenet együttes tokenhasználata a kontextusablakon belül
A bemenet és a válasz együtt fér el a kontextusablakban; a túl hosszú bemenet kiszoríthatja a korábbi részeket.

Tokenek és a kontextusablak kapcsolata

A kontextusablak az a tokenben mért keret, amelyet a modell egyszerre képes figyelembe venni. A bemenet, vagyis a rendszerprompt, a beszélgetés előzménye és az aktuális kérés, valamint a kimenet együttesen fér el ebben a keretben. Ha a bemenet túl sok tokent foglal, kevesebb hely marad a válasznak.

Ha a beszélgetés vagy a beillesztett szöveg túllépi a kontextusablakot, a modell a legrégebbi részeket kénytelen figyelmen kívül hagyni. Ilyenkor előfordulhat, hogy a válasz elfelejt korábbi, fontos részleteket. A tokenek tudatos kezelése segít elkerülni, hogy a lényeges információ kiszoruljon a modell látóköréből.

A hosszú beszélgetéseknél érdemes időnként összefoglalni a lényeget, és a felesleges részeket elhagyni. Így a fontos információ tömörebb, kevesebb tokent foglaló formában marad a kontextusban. A token és a kontextusablak összefüggésének megértése kulcsfontosságú ahhoz, hogy hosszabb, összetettebb feladatoknál is megbízhatóan dolgozz a modellel.

Gyakori tévhitek a tokenekről

Az egyik gyakori tévhit, hogy egy token mindig egy szó. Valójában a token lehet szórészlet, szótő vagy írásjel is, és egy hosszabb szó több tokenre bomlik. Ezért a szószám és a tokenszám nem cserélhető fel, különösen a magyar nyelvben, ahol a ragozás miatt a tokenszám jellemzően magasabb.

A másik tévhit, hogy csak a válasz hossza számít a tokeneknél. Valójában a bemenet is tokent foglal, méghozzá gyakran jelentőset, hiszen a rendszerprompt, a beszélgetés előzménye és a beillesztett szöveg mind beleszámít. A teljes felhasználás a bemenet és a kimenet összege, ezért mindkettőre érdemes figyelni.

A harmadik tévhit, hogy a tokenekkel csak fejlesztőknek kell foglalkozniuk. Valójában bárkinek hasznos megértenie az alapokat, aki rendszeresen dolgozik nyelvi modellel. A tokenek ismerete segít megérteni, miért rövidül le néha a válasz, miért nem fér be egy hosszú szöveg, és hogyan írhatsz gazdaságosabb, hatékonyabb promptokat.

Hasznos forrás

A tokenek szerepéről és a promptok gazdaságos felépítéséről a hivatalos promptépítési útmutató további háttérrel szolgál. a promptépítés hivatalos útmutatója.

Gyakran ismételt kérdések

Mi az a token egyszerűen?

A token a szöveg legkisebb egysége, amellyel a modell dolgozik: gyakran egy szó, egy szórészlet, egy szótő vagy egy írásjel. A modell a bemenetet tokenekre bontja, és tokenekben állítja elő a választ is.

Egy token egyenlő egy szóval?

Nem. Egy token lehet egy egész szó, de gyakran csak egy szórészlet vagy írásjel. A hosszabb, ragozott szavak több tokenre bomlanak. A magyar nyelvben a ragozás miatt jellemzően több token jut egy szóra, mint az angolban.

Miért fontos a tokenek ismerete?

Mert a válasz hossza, a bemenet befogadóképessége, a kontextusablak és a költség is tokenben mérődik. A tokenek ismeretében megérted, miért rövidül le néha a válasz, miért nem fér be egy hosszú szöveg, és hogyan írhatsz gazdaságosabb promptot.

Hogyan csökkenthetem a felhasznált tokenek számát?

Fogalmazz tömören, kerüld a felesleges ismétlést és a hosszú bevezetőket. A feldolgozandó szövegből csak a releváns részt illeszd be, és szabályozd a válasz hosszát. Így a bemenet és a kimenet is kevesebb tokent foglal.

Mi a token és a kontextusablak kapcsolata?

A kontextusablak a tokenben mért keret, amelyben a bemenet és a kimenet együtt elfér. Ha a bemenet túl sok tokent foglal, kevesebb hely marad a válasznak, és a modell a legrégebbi részeket figyelmen kívül hagyhatja.

Miért foglal a magyar szöveg több tokent?

Mert a magyar nyelv ragozó, és a toldalékokkal hosszúra nyúló szavak több tokenre bomlanak. Ugyanaz a jelentés magyarul jellemzően több tokent igényel, mint angolul, ezért a hosszkorlátoknál érdemes ezzel számolni.

Vágj bele kész promptokkal

Több mint 225 prompt csomag vár, azonnali letöltéssel.

Prompt csomagok böngészése

További cikkek

Kosárhoz adva