Blog

Saját dokumentumok használata: a kontextus-injektálás alapjai

N
Szerző tartalomstratéga és prompt-tervező

Tartalomstratéga és prompt-tervező, kis- és középvállalkozásoknak segít az AI bevezetésében.

Saját dokumentumok használata: a kontextus-injektálás alapjai

Dióhéjban

  • A kontextus-injektálás a saját forrásaidat illeszti a promptba, és abból válaszoltat.
  • Különítsd el egyértelműen a forrást az utasítástól egy jelölt szakaszban.
  • Kösd ki a forráshűséget: csak a megadott szövegből dolgozzon a modell.
  • Kérj hivatkozást a forrásra, hogy a válasz ellenőrizhető legyen.
  • Hosszú anyagnál szűkíts a releváns részekre vagy bontsd részekre a feladatot.

A kontextus-injektálás azt jelenti, hogy a saját szövegeidet, dokumentumaidat közvetlenül a promptba illeszted, és megkéred a modellt, hogy kizárólag ezek alapján válaszoljon. Így a válasz nem az általános tudásból, hanem a te forrásaidból származik. Ezzel pontosabb, ellenőrizhető és a saját anyagodhoz kötött eredményt kapsz, ami sokkal megbízhatóbb, mint a modell emlékezetére hagyatkozni.

Mi az a kontextus-injektálás?

A kontextus-injektálás az a módszer, amikor a saját forrásaidat, például egy szerződést, egy kézikönyvet vagy egy jegyzethalmazt beilleszted a promptba, és a modell ezekből dolgozik. A válasz így nem az általános betanításból, hanem az általad megadott, konkrét szövegből ered.

A módszer lényege, hogy a modell figyelmét a saját anyagodra irányítod. Ahelyett, hogy a modell emlékezetéből próbálna válaszolni egy céges folyamatra vagy egy egyedi dokumentumra, a valós forrás ott van előtte, és abból idéz vagy von le következtetést.

A kontextus-injektálás nem tanítja meg tartósan a modellt a dokumentumaidra. A megadott szöveg csak az adott beszélgetés idejére van jelen, egyfajta ideiglenes munkaanyagként. Ettől viszont pontosan azt kapod, amire szükséged van: a te forrásodra épülő választ.

Miért fontos a saját forrás beillesztése?

A saját forrás beillesztése azért fontos, mert a modell általános tudása nem ismeri a te konkrét dokumentumaidat. Egy belső szabályzat, egy egyedi ajánlat vagy egy friss jegyzőkönyv nincs benne a betanításban, ezért csak akkor tud róla pontosan válaszolni, ha megadod neki.

A beillesztett forrás csökkenti a téves állítások esélyét. Ha a modell konkrét szövegből dolgozik, sokkal ritkábban talál ki adatot, mert van mihez igazodnia. A válasz visszavezethető a forrásra, így te is ellenőrizni tudod, honnan származik egy-egy állítás.

A módszer emellett naprakészséget ad. A modell tudása egy adott időpontig terjed, a beillesztett dokumentum viszont lehet a mai anyagod. Így olyan információról is pontos választ kapsz, amely a modell betanítása után keletkezett.

Saját dokumentum beillesztve a promptba, jól elkülönített forrásszakaszként
A saját forrás egyértelmű elkülönítése segít a modellnek megkülönböztetni a feldolgozandó szöveget az utasítástól.

Hogyan illeszd be helyesen a dokumentumot?

Először különítsd el egyértelműen a forrást az utasítástól. Tedd a dokumentumot egy jól jelölt szakaszba, és a promptban mondd ki, hogy ez a forrásanyag, amiből dolgozni kell. Így a modell nem keveri össze a válaszra váró kérdést a feldolgozandó szöveggel.

Másodszor add meg, hogy a modell kizárólag a beillesztett forrásból válaszoljon, és ha valamire a szöveg nem ad választ, azt mondja ki nyíltan. Ezzel megelőzöd, hogy a hiányzó információt az általános tudásából egészítse ki, ami félrevezető lehet.

Harmadszor, ha lehet, kérj hivatkozást a forrásra. Megkérheted, hogy minden fontos állításnál jelölje meg, a dokumentum melyik részére támaszkodik. Így a válasz ellenőrizhetővé válik, és gyorsan visszakeresed az eredeti helyet a saját anyagodban.

Mennyi szöveg fér egy promptba?

A beilleszthető szöveg mennyisége a modell kontextus-ablakától függ, ami meghatározza, mekkora anyaggal tud egyszerre dolgozni. A mai modellek ablaka jelentős, sok oldalnyi szöveget elbír, de nem korlátlan, ezért érdemes tudatosan gazdálkodni vele.

Hosszú dokumentumnál a fontos részekre érdemes szűkíteni. Ha csak a releváns fejezeteket illeszted be, a modell figyelme nem oszlik meg fölösleges szövegen, és pontosabb választ ad. A teljes anyag beillesztése nem mindig jobb, mint a jól kiválasztott részleté.

Nagyon nagy anyagnál a részekre bontás segít. A dokumentumot szakaszokra oszthatod, és lépésenként dolgozhatsz velük, majd az eredményeket összegezheted. Így olyan mennyiséggel is boldogulsz, ami egyben nem férne be a modell ablakába.

Példa: válasz egy belső szabályzatból

Tegyük fel, hogy egy céges távmunka-szabályzatból szeretnél választ kapni. A promptban a szabályzat szövegét egy jelölt forrásszakaszba teszed, majd megadod az utasítást: "Az alábbi szabályzat alapján válaszolj a kérdésre. Csak a megadott szövegből dolgozz."

A kérdés lehet: "Hány távmunkanap engedélyezett havonta, és milyen jóváhagyás szükséges hozzá?" A modell a beillesztett szabályzatból keresi ki a választ, ahelyett hogy az általános ismereteiből próbálná kitalálni, hogyan szokott ez működni.

A prompt záró része a forráshűséget biztosítja: "Ha a szabályzat nem rendelkezik a kérdésről, azt írd, hogy erről a dokumentum nem tartalmaz információt." Így ahelyett, hogy a modell kitalálna egy hihető, de téves választ, egyértelműen jelzi a hiányt.

Gyakori hibák a kontextus-injektálásnál

A leggyakoribb hiba, hogy nem kötöd ki a forráshűséget. Ha nem mondod meg, hogy kizárólag a beillesztett szövegből dolgozzon, a modell keverheti a forrást az általános tudásával, és nem lesz egyértelmű, honnan származik egy-egy állítás.

Másik gyakori hiba, hogy a forrás és az utasítás összemosódik. Ha a dokumentum nincs egyértelműen elkülönítve, a modell egy részét utasításnak nézheti, vagy fordítva. A jól jelölt forrásszakasz ezt a zavart megszünteti.

Harmadik hiba a fölöslegesen sok szöveg beillesztése. Ha a lényeges rész elvész egy hatalmas anyagban, a modell figyelme szétszóródik, és a pontosság romlik. Érdemes a releváns részekre szűkíteni, mielőtt beillesztenéd a forrást.

Mikor NE injektálj kontextust?

Ne illessz be forrást olyankor, amikor éppen a modell általános tudására vagy kíváncsi, vagy szabad ötletelést vársz. Ha a válasz lényege a tágabb rálátás vagy a kreatív felvetés, a szűk forrásra korlátozás inkább leszűkíti a lehetőségeket.

Kerüld az injektálást bizalmas adatoknál, ha a felhasznált eszköz nem felel meg az adatkezelési elvárásaidnak. Mielőtt érzékeny dokumentumot illesztesz be, győződj meg róla, milyen adatkezelési feltételek vonatkoznak a szolgáltatásra.

Ne injektálj olyan hatalmas anyagot, amely nem fér a kontextus-ablakba. Ilyenkor a részletek egy része elveszhet, és a válasz megbízhatatlanná válik. Nagy anyagnál bontsd részekre a feladatot, ahelyett hogy mindent egyszerre próbálnál betuszkolni.

A modell a beillesztett szabályzatból válaszol, és jelzi, ha egy adat hiányzik
A forráshűség kikötésével a modell inkább jelzi a hiányt, mint hogy hihető, de téves választ találjon ki.

Hogyan tedd ezt rutinná?

Készíts sablont a visszatérő forrásalapú feladataidhoz, benne a jelölt forrásszakasszal és a forráshűséget kikötő utasítással. Így legközelebb csak a dokumentumot és a kérdést cseréled, a keret pedig biztosítja a pontos, forráshoz kötött választ.

Alakíts ki szokást a forrás előszűrésére. Mielőtt beillesztenéd, jelöld ki a valóban releváns részeket, hogy a modell figyelme oda összpontosuljon. Ez egyszerre javítja a pontosságot és takarít meg helyet a kontextus-ablakban.

A promptx.hu több forrásalapú csomagja eleve tartalmazza a jól elkülönített forrásszakaszt és a forráshűség kikötését. Egy átgondolt sablon megmutatja, hogyan érdemes a saját dokumentumaidat beilleszteni, hogy pontos és ellenőrizhető választ kapj.

Hogyan tartsd rendben a beillesztett forrásokat?

A beillesztett dokumentumok rendezettsége közvetlenül befolyásolja a válasz minőségét. Ha több forrást adsz a modellnek, jelöld meg mindegyiket rövid, egyértelmű címkével, például A és B dokumentumként, hogy a válaszban egyértelműen hivatkozni tudjon rájuk. A címkézett forrás visszakereshetővé teszi az állításokat, és sokkal könnyebbé teszi az utólagos ellenőrzést.

A hosszú anyagokat érdemes témák szerint kisebb, összefüggő részekre bontani, mielőtt beilleszted őket. A modell könnyebben megtalálja a lényeget egy jól tagolt, fejezetekre osztott szövegben, mint egy összefüggő, több oldalas tömbben. A tagolás ráadásul csökkenti annak esélyét, hogy egy fontos rész a hosszú kontextus közepén elsikkadjon és kimaradjon a válaszból.

Végül tartsd nyilván, melyik dokumentumnak melyik változatát adtad be. Ha egy szerződés vagy egy leírás időközben frissül, a régi és az új változat összekeverése téves választ szül. Egy egyszerű dátum vagy verziószám a forrás tetején elég ahhoz, hogy mindig tudd, a modell pontosan mire alapozta a kimenetét, és szükség esetén vissza tudd követni.

A kontextus mérete véges, ezért érdemes csak a valóban releváns részeket beilleszteni. Ha mindent bemásolsz, a modell figyelme szétszóródik, és a lényeg elveszhet a sok háttéranyag között. A gondos válogatás sokszor jobb választ ad, mint a teljes dokumentumhalmaz gépies beillesztése. A szűrés időt is megtakarít, mert a modellnek kevesebb szöveget kell feldolgoznia, és a válasz is fókuszáltabb, célzottabb lesz.

Hasznos forrás

A hosszú dokumentumok beillesztéséről és a kontextus-ablak hatékony kihasználásáról részletes tanácsokat találsz az Anthropic hivatalos útmutatójában. az Anthropic tanácsai a hosszú kontextus kezeléséhez.

Gyakran ismételt kérdések

Megtanulja a modell tartósan a dokumentumaimat?

Nem. A beillesztett szöveg csak az adott beszélgetés idejére van jelen, mint ideiglenes munkaanyag. A következő beszélgetésben újra be kell illesztened, ha ugyanabból a forrásból szeretnél dolgozni.

Miért találhat ki mégis adatot a modell?

Jellemzően azért, mert nem kötötted ki a forráshűséget. Ha nem mondod meg, hogy kizárólag a beillesztett szövegből dolgozzon, kiegészítheti a választ az általános tudásából. Érdemes kifejezetten kérni, hogy a hiányt jelezze.

Mennyi szöveget illeszthetek be?

A modell kontextus-ablaka szab határt, ami ma sok oldalnyi szöveget elbír, de nem korlátlan. Hosszú anyagnál érdemes a releváns részekre szűkíteni, nagyon nagy dokumentumnál pedig részekre bontani a feladatot.

Hogyan ellenőrzöm a választ?

Kérd, hogy a modell minden fontos állításnál jelölje meg, a dokumentum melyik részére támaszkodik. Így visszakeresheted az eredeti helyet a saját anyagodban, és meggyőződhetsz róla, hogy a válasz valóban a forrásból ered.

Biztonságos érzékeny dokumentumot beilleszteni?

Csak akkor, ha a felhasznált eszköz adatkezelése megfelel az elvárásaidnak. Bizalmas anyag beillesztése előtt mindig győződj meg a szolgáltatás adatkezelési feltételeiről, és kerüld a valóban érzékeny adatok megosztását.

Működik ez minden modellnél?

Igen, a kontextus-injektálás modellfüggetlen. A ChatGPT, a Claude és a Gemini mind képes a beillesztett forrásból dolgozni. A különbség inkább a kontextus-ablak méretében van, ami meghatározza, mennyi szöveget kezel egyszerre.

Vágj bele kész promptokkal

Több mint 225 prompt csomag vár, azonnali letöltéssel.

Prompt csomagok böngészése

További cikkek

Kosárhoz adva