A Netflix képes lehet gyorsabban személyre szabni az új címek képeit
A Netflix multimodális beágyazásokkal fejleszti a filmek és sorozatok képeinek, valamint videóelőnézeteinek személyre szabását. A vállalat szerint az új módszer már a cím megjelenése után hamarabb felhasználhatóvá teszi a nézők korábbi ízlésére utaló jeleket.
- A Netflix multimodális beágyazásokkal kezeli a képek személyre szabásának hidegindítását.
- A képeket a CLIP 768 dimenziós vektoraival reprezentálják.
- Az ízlésjelek különböző címek képei között is átvihetők.
- Az öt vászonhoz korábban használt külön modelleket egy egységes modell válthatja fel.
- Az offline értékeléshez feltárási forgalomból származó adatokat és inverz hajlandósági pontozást használnak.
A hidegindítás lassította a személyre szabást
A Netflix felületén minden vizuális elem, például egy címhez tartozó kép vagy az automatikusan lejátszott videóelőnézet, szerepet kap abban, hogy a felhasználó milyen történeteket fedez fel. A vállalat ezeket az elemeket összefoglalóan eszközöknek, angolul asseteknek nevezi, és külön személyre szabási problémaként kezeli a kiválasztásukat.
A korábbi modellek azt tanulták meg, hogy a felhasználók mely képekkel léptek kapcsolatba, magukat az eszközöket azonban átlátszatlan azonosítóként kezelték. Egy új cím képei ezért nem rendelkeztek előzményekkel. A rendszer ilyenkor többféle képet próbált ki adatgyűjtés céljából, vagy népszerűségi szabályokra támaszkodott. A személyre szabás csak akkor léphetett működésbe, amikor elegendő interakció gyűlt össze. Ezt nevezi a Netflix hidegindítási problémának.
A képek tartalma is bekerül a modellbe
A Netflix Technology Blog 2026. augusztus 28-án bemutatott bejegyzése szerint a megoldás a multimodális beágyazások használata. A vállalat az egyes képeket a CLIP nevű, előtanított kép és szöveg beágyazási modellel kódolja. A kapott képbeágyazás 768 dimenziós vektor, amelyet az eszköz tanult azonosítóbeágyazásával kapcsolnak össze. Az így létrejövő reprezentációt egy többrétegű perceptron dolgozza fel, majd a modell ezt veti össze a felhasználóval.
Ennek köszönhetően egy új kép már létrehozásakor hordoz információt arról, mi látható rajta. A Netflix példája szerint ha valaki korábban olyan képekkel lépett kapcsolatba, amelyeken egy adott komikus szerepelt, a modell egy új címnél előnyben részesítheti azt a képet, amelyen ugyanez a személy hangsúlyosan jelenik meg. Ehhez nincs szükség arra, hogy a konkrét képet korábban már megmutatták volna a felhasználónak.
A beágyazások a vállalat szerint lehetővé teszik az ízlésjelek átvitelét különböző címek között. A képekhez kapcsolódó vizuális témák, szereplők és színpaletták így nem kizárólag egyetlen eszközazonosítóhoz kötődnek.
Öt modellből egy, eltérő megjelenési felületekre
Egy cím képe többféle felületen jelenhet meg, például óriásplakátként, függőleges vagy vízszintes panelen, illetve tájképarányú elrendezésben. Korábban a Netflix minden vászonhoz külön modellt tanított, mivel az azonos jelenet eltérően levágott és átméretezett változatai külön azonosítókat kaptak. Emiatt az egyik felületen összegyűjtött jelzések nem segítették a másik felület modelljét.
A Netflix szerint a CLIP-beágyazások a vágásra, az átméretezésre és a képarányra nagyrészt invariánsak. Az egymáshoz közeli képi változatok ezért hasonló vektorokként jelennek meg. Ez lehetővé teszi egyetlen, egységes modell használatát mind az öt vászonhoz. A vállalat szerint a kevés interakciós adattal rendelkező felületek profitálhatnak a legtöbbet abból, hogy a nagyobb forgalmú felületeken tanult jelek is felhasználhatók.
Az adatok összevonása során a Netflix hosszú távú jutalmazási modellre épülő súlyozást alkalmaz. Az interakciók súlya nem pusztán az előfordulásuk számától függ, hanem attól, milyen hosszú távú értéket tulajdonít nekik a rendszer. Így egy nagy forgalmú vászon vagy gyakori művelettípus nem uralja automatikusan a közös tanítást.
A tesztelésnél a feltárási forgalom adatai számítanak
A Netflix minden bemutatott eredményhez először offline mérési értékelést, majd nagy léptékű online A/B tesztet ír elő. A vállalat szerint a hagyományos gyártási naplók torzíthatnak, mert a jelenlegi rendszer egyes eszközöket gyakrabban jelenít meg másoknál. Ezek az adatok elsősorban azt mutatják meg, mit választott a működő szabályzat, nem pedig azt, hogy a felhasználók mit választottak volna a teljes jelöltkészletből.
A Netflix ezért a forgalom egy kis, feltárásra kijelölt részét véletlenszerűsített szabályzattal szolgálja ki. Ebben a szeletben a rendszer ismert eloszlásból választ a címhez tartozó jelöltek közül, és kiszolgáláskor pontosan rögzíti annak valószínűségét, hogy az adott eszköz megjelent. Az inverz hajlandósági pontozás ennek reciprokával súlyozza a megfigyeléseket. A cég szerint ez javítja annak becslését, hogy egy új modell milyen jutalmat érne el éles környezetben, mielőtt A/B tesztbe kerülne.
Netflix Technology Blog: MAPS: Netflix’s Multimodal Asset Personalization at Scale


