A Shopify napi tanulási hurkot épített PyTorchszal és vLLM-mel
A Shopify olyan folyamatos tanulási hurkot épített PyTorch és vLLM használatával, amely a termelési hibákat naponta modellfrissítésekké alakítja. A PyTorch esettanulmánya szerint a rendszer a frontier modelleknél jobb minőséget ér el, miközben 96 százalékkal csökkenti a kiszolgálás költségét.
- A Shopify PyTorch és vLLM használatával folyamatos tanulási hurkot épített.
- A rendszer a termelési hibákat és nehéz eseteket modellfrissítésekké alakítja.
- A minőséget rubrika és kalibrált bírómodell alapján értékelik.
- A pipeline felügyelt finomhangolást és GRPO-t is használ.
- A PyTorch szerint a megoldás 96 százalékkal csökkenti a kiszolgálási költséget.
A termelési hibákból tanuló rendszer
A frontier modellek gyors módot adnak egy új AI-termék elindítására, különösen akkor, ha egy kis csapat hamar szeretne használható rendszert a felhasználók elé vinni. A PyTorch szerint azonban a használat növekedésével a sebesség és a költség egyre fontosabbá válik. Az általános célú modellek drágák és lassúak lehetnek nagy mennyiségű kérés kiszolgálásakor, ráadásul önmaguktól nem tanulnak a termelési környezetből.
Egy felhasználói javítás, elutasított válasz vagy ismétlődő hiba így nem teszi automatikusan jobbá a következő választ. A Shopify által épített megoldás ezt a tapasztalatot egy tanulási hurokba szervezi. A termelésből származó hibák és nehéz esetek végül a modell súlyaiba kerülnek, ahelyett hogy kizárólag promptokban, keresési példákban, útválasztási szabályokban vagy vezérlőkódban gyűlnének.
A minőség mérésével kezdődik a folyamat
A rendszer alapja egy minőségi rubrika, amely a termékkövetelményeket néhány pontozható szemponttá alakítja. A Shopify négy területet emel ki: a teljességet, a végrehajtást, a válasz minőségét és a biztonságot. Minden pontszámhoz konkrét értelmezés tartozik, így a rubrika a termékcsapat minőségi szerződéseként és az annotátorok útmutatójaként működik.
A tanító adatoknak véletlenszerűen kiválasztott forgalmat is tartalmazniuk kell, nem csak előre összeállított példákat. A Shopify javaslata szerint a két legjobb annotátor vagy termékszakértő először 25 véletlenszerű mintát értékeljen vakon, majd mérjék az egyezést. Ehhez Cohen-féle kappa mutatót használnak. Ha az érték nagyon alacsony, körülbelül 0,2, a rubrika valószínűleg nem elég egyértelmű.
A rubrika később egy olyan bírómodellt alapoz meg, amely nagy mennyiségű termelési adatot képes értékelni. A Shopify DSPy-t, valamint a GEPA és az Agentic Context Engineering reflexióalapú optimalizálóit használja a kalibráláshoz. A bíró eredményeit korábbi A/B tesztekkel és célzott lerontási tesztekkel is ellenőrzik.
A promptoktól a modell súlyainak frissítéséig
A kezdeti frontier-alapú terméket először a súlyok módosítása nélkül fejlesztik tovább. Egy ügynök változtatásokat javasolhat a promptokban, az eszközleírásokban vagy a vezérlőkódban, majd a minőségi bíró alapján megtartja vagy elveti azokat. A Shopify ezt autoresearch-problémaként kezeli.
Amikor ezek a javítások elérik a korlátaikat, a rendszer anonimizált termelési forgalomból nehéz negatív példákat gyűjt. Ezek között részleges kontextusú beszélgetések, kétértelmű kérések, üzletspecifikus munkafolyamatok és eszközhibák szerepelnek. Frontier reasoning modellekből álló panel elemzi a hibákat, egy döntőbíró pedig egyetlen javítási utasítást készít. A beszélgetést ezután újrajátsszák, és a bíró ismét pontozza.
A sikeres javításokból megerősítéses tanuláshoz használható folyamatok készülnek. A javíthatatlan eseteket emberi annotátorokhoz továbbítják a Toloka szakértői segítségével. A képzés első lépése a sikeres folyamatok kisebb modellbe történő, felügyelt finomhangolása. Ezt GRPO követi, amely a kalibrált bírót használja jutalomjelként. A pipeline naponta új folyamatokkal bővíti a tanítóadatokat, majd a korábbi és az új példákon teljes paraméteres finomhangolást, végül ismét GRPO-t futtat.
A PyTorch esettanulmánya szerint a Shopify GraphQL-ügynöke ennek a huroknak a termelési példája. A folyamat célja, hogy a minőség idővel meghaladja a frontier-alapú kiindulási rendszerét, miközben a kiszolgálási költség 96 százalékkal csökken.
