Az AWS többfordulós megerősítéses tanulással fejleszt keresőügynököt

Az AWS bemutatta, hogyan hangoltak finomra egy keresőügynököt többfordulós megerősítéses tanulással az Amazon SageMaker AI szolgáltatásban. A módszer célja, hogy kisebb modellel is megbízható, többlépéses keresési viselkedést érjenek el.
- Az AWS többfordulós megerősítéses tanulással hangolt keresőügynököt.
- A megoldás Qwen3.6-27B modellt használ BM25- és vektorkereséssel.
- A jutalmazás alapja az nDCG@10 keresési mérőszám volt.
- A maximális forduló- vagy tokenlimit elérése mínusz 1 jutalmat kapott.
- A bemutatott tréningben 1 epochot, 128-as kötegméretet és 32-es párhuzamosságot állítottak be.
A keresőügynök több körben dolgozik
A nagy nyelvi modellekre épülő keresőügynökök önállóan dönthetnek arról, mire keressenek rá, melyik keresési módszert használják, és mikor fejezzék be a keresést. Több interakciós körben dolgoznak, így az újabb döntéseket a korábban megtalált információk alapján módosíthatják.
Az AWS szerint ennek a viselkedésnek a kialakítása nehéz feladat. Egy kisebb alapmodell megfelelő hangolás nélkül ritkán működik megbízhatóan több körön keresztül, egy fejlettebb modell használata pedig nagyobb késleltetéssel és költséggel járhat. A finomhangolás egy harmadik lehetőséget adhat: a kisebb modellt közvetlenül az adott eszközökhöz és környezethez igazítják.
A vállalat szerint a hagyományos felügyelt finomhangoláshoz szakértők által készített, ideális többlépéses példákra lenne szükség, amelyek költségesek, és az adott környezethez gyakran nem állnak rendelkezésre. Az egyfordulós megerősítéses tanulás pedig az egyes válaszokat külön értékeli, miközben a keresőügynök döntései egymásra épülnek.
Mit kínál az Amazon SageMaker AI MTRL?
Az Amazon SageMaker AI többfordulós megerősítéses tanulása, vagyis az MTRL, egy ügynöki feladatot egymást követő döntések sorozataként kezel. Többfordulós futtatásokkal hoz létre tanítási adatokat, majd szabályalapú gradiensmódszerekkel optimalizálja a modellt.
A szolgáltatásban az ügyfelek saját jutalmazási függvényt, eszközhasználati ciklust és többfordulós beszélgetési struktúrát határozhatnak meg. Az AWS leírása szerint a futtatás szerver nélküli, tokenenkénti díjazással működik, így nem szükséges GPU-fürtöket kiépíteni és kezelni.
A generálás és a gradiensfrissítések párhuzamosan végezhetők. Az elérhető algoritmuskönyvtár többek között a Proximal Policy Optimization, a Clipped Importance Sampling Policy Optimization és az importance sampling veszteségfüggvényeit, valamint több csoportalapú előnybecslőt tartalmaz. A tréning megszakítható és később folytatható, a modell viselkedése pedig fordulónként és a tanítási lépések során is vizsgálható MLflow-ban.
Qwen3.6-27B modell BM25- és vektorkereséssel
Az AWS a bemutatott megoldásban egy Qwen3.6-27B modellt hangolt finomra keresőügynökként. A modellhez két keresőeszköz tartozott. A lexikális BM25-keresés a pontos kulcsszavak és azonosítók esetén lehet hasznos, míg a vektorkeresés a lekérdezéseket és a dokumentumokat beágyazási vektorokká alakítja, majd szemantikai hasonlóságot számol.
A tanításhoz több adatkészletet használtak, köztük a FRAMES, BRIGHT, Enterprise RAG, ESCI, Musique és MLQA gyűjteményeket. Tesztelésre a FreshStack, a WixQA, a BrowseComp-Plus és a Wands adatkészleteket tartották fenn. Az AWS minden tanítási adatkészleten belül az esetek 5 százalékát validációra különítette el.
A fő mérőszám az nDCG@10 volt. Ez azt méri, hogy a tíz legelőkelőbb helyre került dokumentumok mennyire felelnek meg az ideális sorrendnek. Az AWS ezt közvetlenül jutalmazási függvényként használta: a teljes, többfordulós keresés végén a jutalom azt tükrözte, mennyire egyeztek a megtalált dokumentumok a helyes eredményekkel.
A jutalmazás a keresés teljes eredményét értékeli
Ha az ügynök elérte a megengedett maximális fordulószámot vagy egy forduló maximális mintavételi tokenmennyiségét, az AWS mínusz 1 jutalmat adott. A vállalat ezt a hibás működési módok elkerülésére szolgáló büntetésként írja le, amelyhez nem kellett összetett köztes jutalmakat kézzel megtervezni.
A bemutatott tréningkonfigurációban a MultiTurnRLTrainer SDK-t használták. Három fő paramétert módosítottak, a többi beállítást alapértelmezett értéken hagyták: a teljes tanítási adaton végzett áthaladások száma 1, a globális kötegméret 128, a párhuzamos futtatások maximális száma pedig 32 volt.
Az AWS szerint az MTRL azért illeszkedik jól a keresőügynökökhöz, mert egyértelműen meghatározható a jutalom, adott a többfordulós interakciós ciklus, és rendelkezésre áll a környezetet biztosító keresőeszközök köre. A szolgáltatás a modell értékelését is támogatja, mielőtt azt Amazon SageMaker AI-végpontra vagy Amazon Bedrockra telepítenék.


