Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Shopify napi tanulási hurkot épített PyTorchszal és vLLM-mel

2026. szeptember 22.Forrás: PyTorch

A Shopify olyan folyamatos tanulási hurkot épített PyTorch és vLLM használatával, amely a termelési hibákat naponta modellfrissítésekké alakítja. A PyTorch esettanulmánya szerint a rendszer a frontier modelleknél jobb minőséget ér el, miközben 96 százalékkal csökkenti a kiszolgálás költségét.

A lényeg röviden
  • A Shopify PyTorch és vLLM használatával folyamatos tanulási hurkot épített.
  • A rendszer a termelési hibákat és nehéz eseteket modellfrissítésekké alakítja.
  • A minőséget rubrika és kalibrált bírómodell alapján értékelik.
  • A pipeline felügyelt finomhangolást és GRPO-t is használ.
  • A PyTorch szerint a megoldás 96 százalékkal csökkenti a kiszolgálási költséget.

A termelési hibákból tanuló rendszer

A frontier modellek gyors módot adnak egy új AI-termék elindítására, különösen akkor, ha egy kis csapat hamar szeretne használható rendszert a felhasználók elé vinni. A PyTorch szerint azonban a használat növekedésével a sebesség és a költség egyre fontosabbá válik. Az általános célú modellek drágák és lassúak lehetnek nagy mennyiségű kérés kiszolgálásakor, ráadásul önmaguktól nem tanulnak a termelési környezetből.

Egy felhasználói javítás, elutasított válasz vagy ismétlődő hiba így nem teszi automatikusan jobbá a következő választ. A Shopify által épített megoldás ezt a tapasztalatot egy tanulási hurokba szervezi. A termelésből származó hibák és nehéz esetek végül a modell súlyaiba kerülnek, ahelyett hogy kizárólag promptokban, keresési példákban, útválasztási szabályokban vagy vezérlőkódban gyűlnének.

A minőség mérésével kezdődik a folyamat

A rendszer alapja egy minőségi rubrika, amely a termékkövetelményeket néhány pontozható szemponttá alakítja. A Shopify négy területet emel ki: a teljességet, a végrehajtást, a válasz minőségét és a biztonságot. Minden pontszámhoz konkrét értelmezés tartozik, így a rubrika a termékcsapat minőségi szerződéseként és az annotátorok útmutatójaként működik.

A tanító adatoknak véletlenszerűen kiválasztott forgalmat is tartalmazniuk kell, nem csak előre összeállított példákat. A Shopify javaslata szerint a két legjobb annotátor vagy termékszakértő először 25 véletlenszerű mintát értékeljen vakon, majd mérjék az egyezést. Ehhez Cohen-féle kappa mutatót használnak. Ha az érték nagyon alacsony, körülbelül 0,2, a rubrika valószínűleg nem elég egyértelmű.

A rubrika később egy olyan bírómodellt alapoz meg, amely nagy mennyiségű termelési adatot képes értékelni. A Shopify DSPy-t, valamint a GEPA és az Agentic Context Engineering reflexióalapú optimalizálóit használja a kalibráláshoz. A bíró eredményeit korábbi A/B tesztekkel és célzott lerontási tesztekkel is ellenőrzik.

A promptoktól a modell súlyainak frissítéséig

A kezdeti frontier-alapú terméket először a súlyok módosítása nélkül fejlesztik tovább. Egy ügynök változtatásokat javasolhat a promptokban, az eszközleírásokban vagy a vezérlőkódban, majd a minőségi bíró alapján megtartja vagy elveti azokat. A Shopify ezt autoresearch-problémaként kezeli.

Amikor ezek a javítások elérik a korlátaikat, a rendszer anonimizált termelési forgalomból nehéz negatív példákat gyűjt. Ezek között részleges kontextusú beszélgetések, kétértelmű kérések, üzletspecifikus munkafolyamatok és eszközhibák szerepelnek. Frontier reasoning modellekből álló panel elemzi a hibákat, egy döntőbíró pedig egyetlen javítási utasítást készít. A beszélgetést ezután újrajátsszák, és a bíró ismét pontozza.

A sikeres javításokból megerősítéses tanuláshoz használható folyamatok készülnek. A javíthatatlan eseteket emberi annotátorokhoz továbbítják a Toloka szakértői segítségével. A képzés első lépése a sikeres folyamatok kisebb modellbe történő, felügyelt finomhangolása. Ezt GRPO követi, amely a kalibrált bírót használja jutalomjelként. A pipeline naponta új folyamatokkal bővíti a tanítóadatokat, majd a korábbi és az új példákon teljes paraméteres finomhangolást, végül ismét GRPO-t futtat.

A PyTorch esettanulmánya szerint a Shopify GraphQL-ügynöke ennek a huroknak a termelési példája. A folyamat célja, hogy a minőség idővel meghaladja a frontier-alapú kiindulási rendszerét, miközben a kiszolgálási költség 96 százalékkal csökken.

Kapcsolódó hírek

Fejlesztőknek
Fejlesztőknek2026. október 2.

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA…

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása
Kutatás2026. október 2.

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása

A promptok gyorsítótárazása csökkentheti az ismétlődő bemenetek feldolgozásának költségét, de az Arize AI tesztje szerint a magas cache újraolvasási arány önmagában nem…

Modellek
Modellek2026. október 2.

Az OpenAI útmutatót adott ki a GPT-6 modellek használatához

Az OpenAI gyakorlati útmutatóban mutatja be, hogyan érdemes kiválasztani és használni a GPT-6 család modelljeit. A dokumentum a fejlesztési feladatoktól a több napon át…