Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Spotify szintetikus beszélgetésekkel fejleszti ajánlóügynökét

2026. szeptember 25.Forrás: Spotify Research
A Spotify szintetikus beszélgetésekkel fejleszti ajánlóügynökét
Kép: Spotify Research

A Spotify szintetikus, többfordulós beszélgetésekkel tanítja és teszteli beszélgető ajánlóügynökét. A vállalat szerint az automatizált önfejlesztő ciklus és az új ajánlási élmény az éles tesztben is javította a felhasználói mutatókat.

A lényeg röviden
  • A Spotify öt többfordulós beszélgetési képességet tesztelt szintetikus adatokkal.
  • A teljesítmény négy fordulón túl romlott a legnagyobb mértékben.
  • Az önfejlesztő ciklus egy futtatásban 8 százalékkal javította a pass@1 mutatót.
  • Az A/B tesztben a további zenehallgatás 14 százalékkal nőtt.
  • Az új ajánlási élményt az eredmények után élesítették.

A valódi beszélgetések hiányát szintetikus adatokkal pótolták

A Spotify Research szeptember 25-én ismertette, hogyan kezelték a beszélgető ajánlóügynök fejlesztésének egyik gyakorlati problémáját. A funkció indulása előtt nem álltak rendelkezésre valódi, többfordulós beszélgetések, ezért nem lehetett megfigyelni, hogyan alakulnak a párbeszédek, hol hibázik az ügynök, és mely képességeket kell továbbfejleszteni.

A csapat öt alapvető képességre építette a teszteket. A tartalmi finomítás azt vizsgálja, hogy az ügynök képes-e alkalmazkodni a módosított kéréshez. Az utasítások megőrzése azt méri, hogy emlékszik-e a korábbi korlátozásokra, például arra, hogy csak spanyol nyelvű dalokat kértek. Az előzményekre utaló kifejezések feloldása során olyan kérdéseket kell értelmeznie, mint a „ki a harmadik előadó?”. Emellett kezelnie kell a témaváltást és az olyan kéréseket is, amelyek részletei több fordulóban érkeznek.

A beszélgetéseket két lépésben generálták. Egy párbeszédtervező nyelvi modell egy valódi, egyfordulós kezdőkérésből, például a „rockos hangulatból”, többfordulós tervet készít. Ezután egy UserLLM a terv alapján a működő ajánlóügynökkel kommunikál, így a beszélgetések annak valódi válaszaira, eszközhívásaira és lejátszási listáira épülnek. A tervek auditálhatók, verziózhatók és különböző ügynökverziókon újrajátszhatók.

A hosszabb párbeszédekben romlott a teljesítmény

A módszert emberek is ellenőrizték. Körülbelül 100 beszélgetést vizsgáltak, mindegyiket öt annotátor értékelte. A beszélgetések 98 százalékában megjelent a kijelölt képesség, 93 százalékukat reálisnak tartották, 94 százalékban megfelelőnek ítélték a felhasználó alkalmazkodását, a bírói értékelések pedig 97 százalékban bizonyultak pontosnak.

Az egyes képességek között jelentős eltérések mutatkoztak. A témaváltás felismerése teljesített a legjobban, ezt követte az előzményekre való hivatkozások értelmezése. A tartalmi finomítás és a korábbi utasítások megőrzése nehezebbnek bizonyult, különösen akkor, amikor a korlátozásokat több fordulón keresztül kellett megtartani. A teljesítmény a beszélgetések hosszával is csökkent, a legnagyobb visszaesést négy fordulón túl mérték.

A tesztek konkrét hibákat is feltártak. A lejátszási lista pozícióira utaló kifejezések értelmezése meghiúsulhatott, ha egy hibás eszközhívás megváltoztatta a számok sorrendjét. Zenei munkamenet létrehozásakor az ügynök néha túlságosan összefoglalta a kérést, és elhagyta a korábban megadott korlátozásokat.

Önfejlesztő ciklussal keresték a javításokat

A Spotify a hibák feltárását automatikus javítási folyamattal kapcsolta össze. Egy-egy kérésre több ügynöki tervet mintavételeztek magasabb hőmérsékleten, majd nyelvi modell értékelte az eredményeket. Ha néhány terv sikeres, mások pedig sikertelenek voltak, megbízhatósági hibáról beszéltek. Ilyenkor egy kódoló ügynök összehasonlította a terveket, és az eszközválasztás, az argumentumok vagy a műveletek sorrendje alapján módosítást javasolt.

Ha minden mintavételezett terv hibázott, képességhiányként kezelték a problémát. Ebben az esetben a kódoló ügynök a végrehajtási nyomokat elemezte, majd célzott változtatásokat javasolt az utasításokban vagy az eszközök beállításában. Ilyen lehetett például egy eszközhasználati példa vagy egy útválasztási utasítás hozzáadása. A módosításokat újraértékelték, a javaslatokat pedig egyesítés előtt emberek vizsgálták át.

A Spotify szerint egy futtatásban a folyamat 8 százalékkal javította a pass@1 mutatót a teljes tesztkészleten, egy már erősen optimalizált kézi utasításon felül. A rendszer többek között azt azonosította, hogy a „kérek még előadókat” kérésnek egy meglévő lejátszási listát kell finomítania, a rock műfaji környezetében a „hardcore” kifejezést hardcore punkként kell értelmezni, a „zenei évem” típusú kérésnél pedig a teljes naptári év hallgatási előzményeit kell használni.

Az éles teszt után élesítették a funkciót

A beszélgető ajánlási élményt két hétig tartó A/B tesztben, több piacon, többféle eszközön vizsgálták. A teszt hozzávetőleg 15 millió Spotify-felhasználót ért el. Az új élmény többfordulós beszélgetéseket, információs szándékokat és zenei munkameneteket támogatott, míg az összehasonlítási alap csak a zenei munkamenetek finomítására volt képes.

A Spotify közlése szerint az új élmény 14 százalékkal növelte a további zenehallgatást, 5 százalékkal a heti aktív felhasználók számát, miközben 5 százalékkal csökkentette az átugrási arányt. Az eredmények alapján az ügynököt éles környezetben is bevezették.

A vállalat a jövőben több beszélgetési szándékkal bővítené a kategóriarendszert, a rendelkezésre álló valódi produkciós beszélgetéseket is bevonná, és szélesebb körben alkalmazná az önfejlesztő ciklust. A kutatásról szóló tanulmányt a RecSys 2026 konferencián publikálták.

Kapcsolódó hírek

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER
Kutatás2026. október 4.

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER

A NAVER LABS Europe kutatói olyan nagy nyelvi modellekre épülő ügynökök betanítási módszerét mutatták be, amely a korábbi tapasztalatok visszakeresését és a felügyelt…

A forrás címe szerint az ügynök elkészült, az adatbázis mást mutatott
Kutatás2026. október 3.

A forrás címe szerint az ügynök elkészült, az adatbázis mást mutatott

A Hugging Face oldalának címe szerint egy ügynök késznek jelentett egy feladatot, az adatbázis azonban ellentmondott ennek. A megadott forrásrészlet a történet részletes…

A jogi szakmában már minden második szakember használ generatív AI-t
Kutatás2026. október 3.

A jogi szakmában már minden második szakember használ generatív AI-t

A jogi szakemberek 49 százaléka már aktívan használ generatív AI-t a munkájában, derül ki az Everlaw, az ACEDS és az ILTA közös jelentéséből. A technológia egyre…