Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Spotify szerint az LLM-ek megbízhatóbban rangsorolhatják az ajánlókat

2026. szeptember 22. 19:42Forrás: Spotify Research
A Spotify szerint az LLM-ek megbízhatóbban rangsorolhatják az ajánlókat
Kép: Spotify Research

A Spotify kutatása szerint a nagy nyelvi modellek az egyes ajánlások megítélésében csak közepes pontosságúak, az ajánlórendszerek összehasonlításában viszont megbízható rangsort adhatnak. A módszert filmek és podcastok ajánlásain is vizsgálták.

A lényeg röviden
  • A hagyományos offline mérés releváns, de még nem látott ajánlásokat is hátrányosan kezelhet.
  • Az ML-32M-ext adatállomány annotálása több mint 10 000 kanadai dollárba került 51 felhasználónál.
  • Az LLM-ek egyedi tételeknél 55 és 57 százalék közötti egyezést értek el az emberekkel.
  • A rendszerrangsoroknál az LLM-értékelés Kendall-féle tau értéke legfeljebb 0,92 volt.
  • A Spotify az LLM-bírálatot emberi értékelés és A/B teszt melletti kiegészítő jelzésként ajánlja.

A hagyományos tesztelés fontos elemeket hagyhat ki

A Spotify Research szeptember 22-én közzétett tanulmánya azt vizsgálja, használhatók-e nagy nyelvi modellek értékelőként ajánlórendszerek tesztelésében. A vállalat szerint a szokásos offline módszer a felhasználói interakciókat tanító- és tesztadatokra bontja, majd azt méri, hogy a modell képes-e előre jelezni a korábban rögzített fogyasztást.

Ennek két korlátja van. A tesztadatok csak azokat a tételeket jelölik pozitív példaként, amelyeket a felhasználó ténylegesen megnézett vagy meghallgatott, így egy még nem látott, de releváns ajánlás hátrányba kerülhet. Emellett az eredmények öröklik a naplókat létrehozó éles rendszer megjelenítési és népszerűségi torzításait.

A keresőrendszerek értékelésében régóta alkalmazott Cranfield-módszer ezt úgy kezeli, hogy emberek bírálják el az összegyűjtött ajánlásokat. A Spotify által használt, ML-32M-ext nevű MovieLens-kiterjesztés elkészítése több mint 10 000 kanadai dollár annotációs költséggel járt 51 felhasználó esetében.

Jelentősen eltérő rendszerrangsorok születtek

A kutatók 52 rendszerkonfigurációt hasonlítottak össze. A hagyományos tanító- és tesztfelosztásban a top 100 eredményben szereplő tételeknek csak körülbelül 7 százalékához tartozott relevanciaérték. A Cranfield-alapú gyűjteményben ez az arány nagyjából 57 százalékra nőtt.

A két módszer rendszerrangsorai csak gyengén egyeztek: a Kendall-féle tau értéke 0,26 volt, miközben a tanulmány által idézett, elfogadható egyezéshez gyakran 0,90-et használnak. Egy konfiguráció az egyik értékelésben az első helyen végzett, a másikban viszont a 43. lett. Egy másik a 47. helyről a 14. helyre került.

Az LLM-értékelő a felhasználó legfeljebb 1000, metaadatokkal kiegészített filmértékelését kapta meg, majd egy ajánlott film iránti érdeklődést kellett megbecsülnie a humán annotátorok által is használt, 0-tól 7-ig terjedő skálán. Az egyes tételeknél mért egyezés 55 és 57 százalék között alakult. A részletesebb metaadatok, például a szereplők, a nyelvek és a műfajok, valamint a hosszabb felhasználói előzmény javította az eredményeket.

A rendszer könnyebben különítette el az érdektelen és az érdekes filmeket, mint az érdekes és a nagyon érdekes tételeket. Rendszerszinten ugyanakkor az LLM-alapú címkékből számított rangsor a nDCG@100 mutatónál legfeljebb 0,92-es Kendall-féle tau értéket ért el. A Cranfield-rangsorhoz képest a medián abszolút helyezéseltérés egy pozíció volt, a hagyományos tesztfelosztásnál viszont nyolc.

Podcastoknál is eltért az LLM és a hagyományos mérés

A Spotify egy iparági podcastajánlási esetben is tesztelte a módszert. Az értékelő több szempont, köztük a téma, a műsorvezető, a stílus, a hangnem és a műfaj alapján mérte, mennyire illeszkedik az ajánlás a felhasználó érdeklődéséhez.

Négy hónapos fejlesztés alatt az LLM pontszámait a hagyományos offline mutatókkal és emberi annotációkkal együtt használták a végső modell kiválasztásához. A két módszer jelentősen eltérő modelleket ítélt a legjobbnak. Egy népszerűségi torzítást mérséklő változatnál a naplózott interakciókra épülő offline mutatók romlottak, az LLM-értékelés pontszámai viszont javultak.

A Spotify 20 munkatárssal végzett belső összehasonlításában a dolgozók ugyanazt a változatot részesítették előnyben, amelyet az LLM is támogatott. Ezt a modellt később további visszakeresési forrásként telepítették.

A kutatók szerint az LLM-bírálók nem váltják ki sem az emberi értékelést, sem az A/B teszteket. Kiegészítő jelzésként használhatók előszűrésre, modellek rangsorolására és a ritka emberi címkék bővítésére, miközben az emberi értékelés marad az alap. A módszer értékét az adja, hogy az egyedi hibák részben kiegyenlítődhetnek a rendszerszintű összehasonlításokban, a teljes körű emberi annotációnál alacsonyabb költség mellett.

Spotify ResearchMovieLensRecSys '26Unified Search and Recommendation Workshopkutatási eredményvállalati AI

Kapcsolódó hírek

A generatív AI átírhatja a jogi szolgáltatások számlázását
Cégek és üzlet2026. október 3. 10:27

A generatív AI átírhatja a jogi szolgáltatások számlázását

A vállalati jogi csapatok egyre gyorsabban vezetik be a generatív AI-t, ami felülvizsgálhatja a külső ügyvédi irodákkal fenntartott kapcsolatokat és a jogi…

A jogsegélyszolgálatok 88 százaléka szerint az AI csökkentheti az igazságszolgáltatási szakadékot
Kutatás2026. október 3. 10:27

A jogsegélyszolgálatok 88 százaléka szerint az AI csökkentheti az igazságszolgáltatási szakadékot

A jogsegélyszervezetek 88 százaléka szerint a mesterséges intelligencia legalább bizonyos mértékben segíthet csökkenteni az igazságszolgáltatáshoz való hozzáférés…

A generatív AI átformálhatja a vállalati jogi munkát
Kutatás2026. október 3. 10:27

A generatív AI átformálhatja a vállalati jogi munkát

Gyorsan terjed a generatív mesterséges intelligencia a vállalati jogi osztályokon, amelyek egyre több munkát végeznének házon belül. Az Everlaw és az ACC felmérése…