A Spotify szintetikus beszélgetésekkel fejleszti ajánlóügynökét

A Spotify szintetikus, többfordulós beszélgetésekkel tanítja és teszteli beszélgető ajánlóügynökét. A vállalat szerint az automatizált önfejlesztő ciklus és az új ajánlási élmény az éles tesztben is javította a felhasználói mutatókat.
- A Spotify öt többfordulós beszélgetési képességet tesztelt szintetikus adatokkal.
- A teljesítmény négy fordulón túl romlott a legnagyobb mértékben.
- Az önfejlesztő ciklus egy futtatásban 8 százalékkal javította a pass@1 mutatót.
- Az A/B tesztben a további zenehallgatás 14 százalékkal nőtt.
- Az új ajánlási élményt az eredmények után élesítették.
A valódi beszélgetések hiányát szintetikus adatokkal pótolták
A Spotify Research szeptember 25-én ismertette, hogyan kezelték a beszélgető ajánlóügynök fejlesztésének egyik gyakorlati problémáját. A funkció indulása előtt nem álltak rendelkezésre valódi, többfordulós beszélgetések, ezért nem lehetett megfigyelni, hogyan alakulnak a párbeszédek, hol hibázik az ügynök, és mely képességeket kell továbbfejleszteni.
A csapat öt alapvető képességre építette a teszteket. A tartalmi finomítás azt vizsgálja, hogy az ügynök képes-e alkalmazkodni a módosított kéréshez. Az utasítások megőrzése azt méri, hogy emlékszik-e a korábbi korlátozásokra, például arra, hogy csak spanyol nyelvű dalokat kértek. Az előzményekre utaló kifejezések feloldása során olyan kérdéseket kell értelmeznie, mint a „ki a harmadik előadó?”. Emellett kezelnie kell a témaváltást és az olyan kéréseket is, amelyek részletei több fordulóban érkeznek.
A beszélgetéseket két lépésben generálták. Egy párbeszédtervező nyelvi modell egy valódi, egyfordulós kezdőkérésből, például a „rockos hangulatból”, többfordulós tervet készít. Ezután egy UserLLM a terv alapján a működő ajánlóügynökkel kommunikál, így a beszélgetések annak valódi válaszaira, eszközhívásaira és lejátszási listáira épülnek. A tervek auditálhatók, verziózhatók és különböző ügynökverziókon újrajátszhatók.
A hosszabb párbeszédekben romlott a teljesítmény
A módszert emberek is ellenőrizték. Körülbelül 100 beszélgetést vizsgáltak, mindegyiket öt annotátor értékelte. A beszélgetések 98 százalékában megjelent a kijelölt képesség, 93 százalékukat reálisnak tartották, 94 százalékban megfelelőnek ítélték a felhasználó alkalmazkodását, a bírói értékelések pedig 97 százalékban bizonyultak pontosnak.
Az egyes képességek között jelentős eltérések mutatkoztak. A témaváltás felismerése teljesített a legjobban, ezt követte az előzményekre való hivatkozások értelmezése. A tartalmi finomítás és a korábbi utasítások megőrzése nehezebbnek bizonyult, különösen akkor, amikor a korlátozásokat több fordulón keresztül kellett megtartani. A teljesítmény a beszélgetések hosszával is csökkent, a legnagyobb visszaesést négy fordulón túl mérték.
A tesztek konkrét hibákat is feltártak. A lejátszási lista pozícióira utaló kifejezések értelmezése meghiúsulhatott, ha egy hibás eszközhívás megváltoztatta a számok sorrendjét. Zenei munkamenet létrehozásakor az ügynök néha túlságosan összefoglalta a kérést, és elhagyta a korábban megadott korlátozásokat.
Önfejlesztő ciklussal keresték a javításokat
A Spotify a hibák feltárását automatikus javítási folyamattal kapcsolta össze. Egy-egy kérésre több ügynöki tervet mintavételeztek magasabb hőmérsékleten, majd nyelvi modell értékelte az eredményeket. Ha néhány terv sikeres, mások pedig sikertelenek voltak, megbízhatósági hibáról beszéltek. Ilyenkor egy kódoló ügynök összehasonlította a terveket, és az eszközválasztás, az argumentumok vagy a műveletek sorrendje alapján módosítást javasolt.
Ha minden mintavételezett terv hibázott, képességhiányként kezelték a problémát. Ebben az esetben a kódoló ügynök a végrehajtási nyomokat elemezte, majd célzott változtatásokat javasolt az utasításokban vagy az eszközök beállításában. Ilyen lehetett például egy eszközhasználati példa vagy egy útválasztási utasítás hozzáadása. A módosításokat újraértékelték, a javaslatokat pedig egyesítés előtt emberek vizsgálták át.
A Spotify szerint egy futtatásban a folyamat 8 százalékkal javította a pass@1 mutatót a teljes tesztkészleten, egy már erősen optimalizált kézi utasításon felül. A rendszer többek között azt azonosította, hogy a „kérek még előadókat” kérésnek egy meglévő lejátszási listát kell finomítania, a rock műfaji környezetében a „hardcore” kifejezést hardcore punkként kell értelmezni, a „zenei évem” típusú kérésnél pedig a teljes naptári év hallgatási előzményeit kell használni.
Az éles teszt után élesítették a funkciót
A beszélgető ajánlási élményt két hétig tartó A/B tesztben, több piacon, többféle eszközön vizsgálták. A teszt hozzávetőleg 15 millió Spotify-felhasználót ért el. Az új élmény többfordulós beszélgetéseket, információs szándékokat és zenei munkameneteket támogatott, míg az összehasonlítási alap csak a zenei munkamenetek finomítására volt képes.
A Spotify közlése szerint az új élmény 14 százalékkal növelte a további zenehallgatást, 5 százalékkal a heti aktív felhasználók számát, miközben 5 százalékkal csökkentette az átugrási arányt. Az eredmények alapján az ügynököt éles környezetben is bevezették.
A vállalat a jövőben több beszélgetési szándékkal bővítené a kategóriarendszert, a rendelkezésre álló valódi produkciós beszélgetéseket is bevonná, és szélesebb körben alkalmazná az önfejlesztő ciklust. A kutatásról szóló tanulmányt a RecSys 2026 konferencián publikálták.


