A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER

A NAVER LABS Europe kutatói olyan nagy nyelvi modellekre épülő ügynökök betanítási módszerét mutatták be, amely a korábbi tapasztalatok visszakeresését és a felügyelt finomhangolást kombinálja. A vállalat szerint az eljárás javítja az ismeretlen feladatokra való általánosítást.
- A NAVER LABS Europe a tapasztalat-visszakeresést és a finomhangolást kombináló módszert mutatott be.
- A kutatás LoRA-ra épülő, felügyelt finomhangolási receptet használ.
- A vizsgálat a tapasztalatok tárolását, lekérdezését és kiválasztását is elemzi.
- A közlés szerint a módszer javítja az ismeretlen feladatokra való általánosítást.
- A tanulmányt az EMNLP budapesti konferenciáján mutatják be 2026. október 24. és 29. között.
A kutatás problémája az új feladatok kezelése
A nagy nyelvi modellek fejlődése felgyorsította az általános célú mesterségesintelligencia-ügynökök fejlesztését, az ismeretlen feladatokra való megbízható általánosítás azonban továbbra is komoly kihívás. A NAVER LABS Europe kutatói szerint a jelenlegi megközelítések jellemzően két irány valamelyikére épülnek.
Az egyik a finomhangolás, amelynek során a modellt célzott adatokkal tanítják tovább. A másik a memóriával kiegészített, tanítás nélküli generálás, ahol az ügynök korábbi tapasztalatokat keres vissza, majd ezeket az aktuális feladat megoldásakor használja fel. A forrás szerint a finomhangolás gyakran nem képes új feladatokra kiterjedni, a tapasztalatok visszakeresése pedig sok esetben gyengébben teljesít a felügyelt módszereknél.
A visszakeresést beépítették a finomhangolásba
A kutatócsoport célja annak szisztematikus vizsgálata volt, hogyan lehet a visszakeresett munkafolyamatokat, vagyis trajektóriákat az ügynökök tanításában hatékonyan felhasználni. Első lépésként egy LoRA-ra épülő, felügyelt finomhangolási receptet dolgoztak ki. A NAVER LABS Europe közlése szerint ez több korszerű ügynöktréning-folyamatnál jobb eredményt ért el.
A kutatás részletesen elemezte a tapasztalatok visszakeresésének kulcsfontosságú beállításait is. A vizsgált szempontok között szerepelt, hogyan tárolják a korábbi tapasztalatokat, milyen lekérdezéssel keresik meg őket, és milyen munkafolyamatokat választanak ki az ügynök aktuális helyzetéhez.
A végső javaslat olyan folyamat, amely a tapasztalatok visszakeresését közvetlenül a finomhangolási eljárásba integrálja. Így a modell a korábbi példákat nem kizárólag használat közben kapja meg, hanem a tanítás során is megtanulja alkalmazni azokat.
Az eredmény a kutatók szerint jobban általánosít
A NAVER LABS Europe szerint a kombinált megközelítés jelentősen javítja az ügynökök teljesítményét azokon a feladatokon, amelyekkel a tanítás során nem találkoztak. A kutatók ezt olyan skálázható és hatékony keretként írják le, amelynek segítségével az ügynökök megtanulhatnak tanulni a tapasztalataikból.
A tanulmány szerzői Thomas Palmeira Ferraz, Romain Deffayet, Vassilina Nikoulina, Hervé Déjean és Stéphane Clinchant. A publikációt Hervé Déjean jegyzi, és a dolgozatot a budapesti Conference on Empirical Methods in Natural Language Processing konferencián mutatják be, amelyet 2026. október 24. és 29. között rendeznek meg.
A kutatás illeszkedik a NAVER LABS Europe robotikával kapcsolatos munkájához is. A szervezet olyan mesterségesintelligencia-komponenseken dolgozik, amelyek segíthetik a robotokat a környezetük megértésében, a tudás frissítésében, valamint az emberekkel, más robotokkal és rendszerekkel való biztonságos együttműködésben. A most bemutatott módszer a forrás alapján elsősorban az ügynökök tanításának és új feladatokra való alkalmazásának keretét bővíti.
NAVER LABS Europe: Retrieval-augmented LLM agents: Learning to learn from experience


