A Spotify szerint az LLM-ek megbízhatóbban rangsorolhatják az ajánlókat

A Spotify kutatása szerint a nagy nyelvi modellek az egyes ajánlások megítélésében csak közepes pontosságúak, az ajánlórendszerek összehasonlításában viszont megbízható rangsort adhatnak. A módszert filmek és podcastok ajánlásain is vizsgálták.
- A hagyományos offline mérés releváns, de még nem látott ajánlásokat is hátrányosan kezelhet.
- Az ML-32M-ext adatállomány annotálása több mint 10 000 kanadai dollárba került 51 felhasználónál.
- Az LLM-ek egyedi tételeknél 55 és 57 százalék közötti egyezést értek el az emberekkel.
- A rendszerrangsoroknál az LLM-értékelés Kendall-féle tau értéke legfeljebb 0,92 volt.
- A Spotify az LLM-bírálatot emberi értékelés és A/B teszt melletti kiegészítő jelzésként ajánlja.
A hagyományos tesztelés fontos elemeket hagyhat ki
A Spotify Research szeptember 22-én közzétett tanulmánya azt vizsgálja, használhatók-e nagy nyelvi modellek értékelőként ajánlórendszerek tesztelésében. A vállalat szerint a szokásos offline módszer a felhasználói interakciókat tanító- és tesztadatokra bontja, majd azt méri, hogy a modell képes-e előre jelezni a korábban rögzített fogyasztást.
Ennek két korlátja van. A tesztadatok csak azokat a tételeket jelölik pozitív példaként, amelyeket a felhasználó ténylegesen megnézett vagy meghallgatott, így egy még nem látott, de releváns ajánlás hátrányba kerülhet. Emellett az eredmények öröklik a naplókat létrehozó éles rendszer megjelenítési és népszerűségi torzításait.
A keresőrendszerek értékelésében régóta alkalmazott Cranfield-módszer ezt úgy kezeli, hogy emberek bírálják el az összegyűjtött ajánlásokat. A Spotify által használt, ML-32M-ext nevű MovieLens-kiterjesztés elkészítése több mint 10 000 kanadai dollár annotációs költséggel járt 51 felhasználó esetében.
Jelentősen eltérő rendszerrangsorok születtek
A kutatók 52 rendszerkonfigurációt hasonlítottak össze. A hagyományos tanító- és tesztfelosztásban a top 100 eredményben szereplő tételeknek csak körülbelül 7 százalékához tartozott relevanciaérték. A Cranfield-alapú gyűjteményben ez az arány nagyjából 57 százalékra nőtt.
A két módszer rendszerrangsorai csak gyengén egyeztek: a Kendall-féle tau értéke 0,26 volt, miközben a tanulmány által idézett, elfogadható egyezéshez gyakran 0,90-et használnak. Egy konfiguráció az egyik értékelésben az első helyen végzett, a másikban viszont a 43. lett. Egy másik a 47. helyről a 14. helyre került.
Az LLM-értékelő a felhasználó legfeljebb 1000, metaadatokkal kiegészített filmértékelését kapta meg, majd egy ajánlott film iránti érdeklődést kellett megbecsülnie a humán annotátorok által is használt, 0-tól 7-ig terjedő skálán. Az egyes tételeknél mért egyezés 55 és 57 százalék között alakult. A részletesebb metaadatok, például a szereplők, a nyelvek és a műfajok, valamint a hosszabb felhasználói előzmény javította az eredményeket.
A rendszer könnyebben különítette el az érdektelen és az érdekes filmeket, mint az érdekes és a nagyon érdekes tételeket. Rendszerszinten ugyanakkor az LLM-alapú címkékből számított rangsor a nDCG@100 mutatónál legfeljebb 0,92-es Kendall-féle tau értéket ért el. A Cranfield-rangsorhoz képest a medián abszolút helyezéseltérés egy pozíció volt, a hagyományos tesztfelosztásnál viszont nyolc.
Podcastoknál is eltért az LLM és a hagyományos mérés
A Spotify egy iparági podcastajánlási esetben is tesztelte a módszert. Az értékelő több szempont, köztük a téma, a műsorvezető, a stílus, a hangnem és a műfaj alapján mérte, mennyire illeszkedik az ajánlás a felhasználó érdeklődéséhez.
Négy hónapos fejlesztés alatt az LLM pontszámait a hagyományos offline mutatókkal és emberi annotációkkal együtt használták a végső modell kiválasztásához. A két módszer jelentősen eltérő modelleket ítélt a legjobbnak. Egy népszerűségi torzítást mérséklő változatnál a naplózott interakciókra épülő offline mutatók romlottak, az LLM-értékelés pontszámai viszont javultak.
A Spotify 20 munkatárssal végzett belső összehasonlításában a dolgozók ugyanazt a változatot részesítették előnyben, amelyet az LLM is támogatott. Ezt a modellt később további visszakeresési forrásként telepítették.
A kutatók szerint az LLM-bírálók nem váltják ki sem az emberi értékelést, sem az A/B teszteket. Kiegészítő jelzésként használhatók előszűrésre, modellek rangsorolására és a ritka emberi címkék bővítésére, miközben az emberi értékelés marad az alap. A módszer értékét az adja, hogy az egyedi hibák részben kiegyenlítődhetnek a rendszerszintű összehasonlításokban, a teljes körű emberi annotációnál alacsonyabb költség mellett.
Spotify Research: From IR to RecSys: Evaluating LLM-based Judges in Cranfield-style Recommendation Collections


