Databricks valós idejű ajánlórendszert épített e-kereskedelmi példára

A Databricks olyan referenciaarchitektúrát mutatott be, amely egyetlen platformon kezeli az e-kereskedelmi ajánlások adatbetöltését, modellképzését és kiszolgálását. A rendszer a korábban kiszámított ajánlásokat valós idejű, munkamenet-alapú pontozással egészíti ki.
- A Databricks egyetlen platformon kezeli az ajánlások teljes folyamatát.
- A rendszer hozzávetőlegesen 1000 eseményt dolgoz fel másodpercenként.
- A Lakebase előre kiszámított, felhasználónkénti ajánlási listákat szolgál ki.
- A Path B az aktuális munkamenet jeleivel alakítja a valós idejű ajánlásokat.
- Az AI Search vektoros keresést készlet- és jogosultsági szűrőkkel kombinál.
Egy platformra került az ajánlási folyamat
A Databricks október 2-án közzétett bemutatója szerint az architektúra a kattintási adatok begyűjtésétől a személyre szabott ajánlások megjelenítéséig minden fő lépést a Databricks környezetében futtat, a Unity Catalog irányítása mellett. A cél a széttagolt gépi tanulási infrastruktúra kiváltása, a fejlesztési ciklusok gyorsítása és a nyers eseményektől a kész előrejelzésekig tartó adatvonal biztosítása.
A bemutatott, valós megvalósításon alapuló rendszer egy ázsiai divat-webáruház példáját használja, amely havonta több mint 1 millió aktív felhasználót szolgál ki, katalógusában pedig több mint 100 000 termék szerepel. A platform hozzávetőlegesen 1000 eseményt fogad másodpercenként. Ezek között vannak termékmegtekintések, keresések, kosárba helyezések, vásárlások és munkamenet-adatok.
Az adatokat a Lakeflow Connect Zerobus Ingest közvetlenül Unity Catalog által kezelt Delta-táblákba továbbítja, önállóan üzemeltetett üzenetközvetítő nélkül. A Kafka-infrastruktúrát használó csapatok számára a Structured Streaming és a Declarative Pipelines is alternatívát kínál.
Háromrétegű adatfeldolgozás és közös jellemzőkezelés
A rendszer medallion architektúrát használ. A Bronze rétegben érkeznek a nyers események és a referenciaadatok, köztük a felhasználói viselkedés, a tranzakciók, a preferenciák, a termékjellemzők, a készletre és népszerűségre vonatkozó adatok, valamint a földrajzi, időbeli és munkamenet-környezet.
A Silver réteg megtisztítja és munkamenetekbe rendezi a viselkedési adatokat, egységesíti a termékjellemzőket, továbbá összesített aktivitási mutatókat és felhasználó-termék interakciós mátrixokat készít. A Gold rétegben jönnek létre a modellhez használható felhasználói és termékvektorok, a tanító adathalmazok, illetve az előre kiszámított ajánlási listák.
A viselkedési összesítések naponta frissülnek, a teljes termékkatalógus szinkronizálása hetente történik. A felhasználói és termékbeágyazásokat naponta számítják újra. A Databricks Feature Store ugyanazokat a jellemződefiníciókat biztosítja a modellképzéshez és a kiszolgáláshoz, az online elérést pedig a Lakebase online táblái támogatják.
Két kis késleltetésű kiszolgálási út
Az első út, a Path A, az előre kiszámított ajánlásokat kezeli. Ezt használják többek között a kezdőoldali terméksávok, kategóriaoldali rangsorok, e-mail-kampányok és pushértesítések esetében. A Databricks Workflows által vezérelt éjszakai feldolgozás aktív felhasználónként jelölteket keres az AI Search termékindexében, LightGBM-modellel pontozza őket, majd olyan üzleti szabályokat alkalmaz, mint a készlet, a szállítási távolság, a sokféleség és a promóciós kiemelés.
Az eredmény felhasználónként és felülettípusonként jellemzően 50 és 100 közötti termékből álló rangsor, amelyet a Lakebase tárol. Kiszolgáláskor az alkalmazás egyszerű kulcsérték-lekérdezést indít a felhasználói azonosító és a felület alapján. A Databricks szerint ennek válaszideje két számjegyű ezredmásodperc alatti.
A Path B a munkamenet aktuális állapotától függő helyzetekre készült, például a termékoldal hasonló termékeire, a teljes megjelenéshez illő ajánlatokra és a böngészés közben dinamikusan újrarendezett találatokra. Az alkalmazás közvetlenül a Model Serving végpontnak küldi el a közelmúltban megtekintett termékeket, az aktív kereséseket, a kosár tartalmát és a tartózkodási idő mintázatait. Így az aktuális munkamenet jelei a modellkiszolgálás során nem kerülnek előbb a lakehouse-ba, ami elkerüli az adatbetöltésből eredő késleltetést.
A végpont lekérdezési vektort készít, majd a Databricks AI Search hibrid keresésével jelölteket gyűjt. Ez a vektoros hasonlósági keresést szigorú metaadatszűrőkkel kombinálja, például kategóriajogosultsággal, regionális készlettel és minimális készletszinttel.
Mit jelent ez az e-kereskedelmi csapatoknak?
A bemutatott modell kétféle ajánlási igényt választ szét. A hosszabb távú preferenciákra épülő felületeknél elegendő lehet az éjszakai újraszámítás, míg a termékoldalon vagy aktív böngészés közben a legfrissebb munkamenet-jelek alakítják az eredményt.
A Databricks szerint a közös platform csökkenti az összekötő egyedi kód mennyiségét, egységesíti a modellképzést és a kiszolgálást, valamint a Unity Catalog révén részletes hozzáférés-szabályozást és teljes adatvonalat biztosít. A vállalat azt is kiemeli, hogy a személyre szabás iparági mércékkel 10 és 30 százalék közötti konverziónövekedést eredményezhet, miközben az ajánlórendszer működtetése továbbra is összetett mérnöki feladat marad.


