A CoreWeave a gyártási adatokból fejlesztené tovább az AI-modelleket

A CoreWeave három új képességgel kötné össze a gyártási használat során gyűjtött jeleket a modellek utólagos tanításával. A vállalat szerint a valós forgalom megmutathatja, hol hibázik egy modell, és milyen fejlesztés javíthat rajta a leghatékonyabban.
- A CoreWeave a gyártási forgalmat modellfejlesztési jelként használná.
- A CoreWeave Forge desztillációs, SFT- és RL-munkafolyamatokat kapcsol össze.
- A programozható tanítási API Pythonban teszi lehetővé saját tanítási ciklusok írását.
- A CoreWeave szerint az RL-ellenőrzőpontok betöltése körülbelül 15-ször gyorsabb volt a hagyományos újratelepítésnél.
- A közös Nemotron 3.5 Lightning tesztben a BrowseComp pontossága 36,97 százalékról 45,45 százalékra nőtt.
A modell fejlesztése a bevezetés után is folytatódik
A CoreWeave október 5-i blogbejegyzése szerint egy modell éles üzembe állítása nem feltétlenül jelenti a fejlesztési ciklus végét. A valós felhasználói forgalom olyan hibákat és szélsőséges eseteket tárhat fel, amelyeket a korábbi tesztek nem mutattak meg teljesen. A gyártási adatok azt is jelezhetik, mire van ténylegesen szükségük a felhasználóknak.
A vállalat szerint ezek a jelek a modell minőségét és a működtetés gazdaságosságát is javíthatják. Kiderülhet például, hogy egy kisebb modell képes egy drágább modell viselkedését reprodukálni, vagy hogy további felügyelt tanítás, esetleg megerősítéses tanulás (RL) lenne célszerű. Ha egy modell már rendelkezik az alkalmazáshoz szükséges képességekkel, az adott munkafolyamathoz való finomítása hatékonyabb lehet, mint minden új modellgenerációval teljes migrációt végrehajtani.
Három módszer, háromféle jel
A CoreWeave a Fully Connected 2026 rendezvényen három, a modelléletciklus különböző részeit célzó képességet mutatott be: a CoreWeave Model Distillationt, a CoreWeave Inference-re épülő CoreWeave RL Rolloutsot, valamint egy programozható tanítási API-t. Utóbbi korlátozott előzetes hozzáférésben érhető el, hivatalos indulását a vállalat az idei év későbbi részére tervezi. A munkafolyamatokat a CoreWeave Forge fogja össze.
A cég szerint a fejlesztési módszert a hiba természete alapján kell kiválasztani. A keresési rendszer, a hiányzó kontextus, a promptok, az eszközhibák és a kiszolgálás működése is okozhat olyan problémát, amely modellhibának tűnik. Ilyenkor a modell súlyainak módosítása nem oldja meg a kiváltó okot.
A modell desztillációja akkor lehet megfelelő, ha egy erősebb modell már előállítja a kívánt viselkedést, és ezt kisebb vagy gazdaságosabb modellben szeretnék reprodukálni. A felügyelt finomhangolás (SFT) jó minőségű példák esetén használható egy adott feladat következetesebb megoldására. Az RL akkor lehet hasznos, ha az eredmény megbízhatóan értékelhető, de az ideális válasz előre nehezen írható le.
A gyártási forgalomból új tanítási adatok készülhetnek
A CoreWeave Model Distillation kezelt munkafolyamatként kapcsolja össze a modellkiszolgálást és az utólagos tanítást. Az inference-forgalom a CoreWeave Agent Lensben rögzíthető, majd az alkalmazás működése közben tanítási adattá alakítható. A folyamat része lehet a gyenge kimenetek újracímkézése, különböző alapmodellek és hiperparaméterek kipróbálása, valamint a jelöltek telepítése a Serverless Inference rendszerbe. Ezután az új változat összevethető a gyártásban futó modellel.
A CoreWeave a Method példáját hozza fel. A vállalat szerint a Method 2024-ben az akkori OpenPipe termékkel egy Llama 3.1 8B modellt tanított banki interaktív hangválasz-rendszerek navigálására, GPT-4o-kimenetek felhasználásával. 2026 augusztusában ugyanahhoz a feladathoz új gyártási adatokat használtak, amelyeket GPT-5.6 Sollal címkéztek újra. Az így továbbfejlesztett modell a fej-fej melletti értékelések 57,5 százalékában bizonyult jobbnak a gyártásban futó változatnál. Az alapmodell nem változott, a gyártási jelzés viszont igen.
Az RL-folyamatban a gyors következtetés is kulcsfontosságú
A programozható tanítási API lehetővé teszi, hogy a fejlesztők Pythonban írják meg a tanítási ciklust, miközben a CoreWeave kezeli az ehhez szükséges számítási és tanítási infrastruktúrát. A vállalat szerint ugyanazokra az alapokra építhető SFT, RL és desztilláció is, így a csapatok többféle módszert kombinálhatnak anélkül, hogy maguknak kellene működtetniük az elosztott rendszereket.
Az RL esetében a következtetés maga is a tanítási ciklus része. A CoreWeave Inference most NVIDIA Dynamo és vLLM támogatásával kínál RL-rolloutokat. Az új ellenőrzőpontok élő telepítésre tölthetők be a folyamatban lévő kérések és a végpont elérhetőségének befolyásolása nélkül. A vállalat szerint az ellenőrzőpontok betöltése körülbelül 15-ször gyorsabb volt a hagyományos újratelepítési ciklusoknál.
A CoreWeave, az NVIDIA és a you.com közös tesztjében az NVIDIA Nemotron 3.5 Lightning webes kereséshez való utólagos tanítását vizsgálták. SFT és RL használatával, a you.com keresőeszközeit a tanítási ciklusba építve, a BrowseComp pontossága 36,97 százalékos alapról 45,45 százalékra nőtt, ami 22,94 százalékos javulás. Az átlagos eszközhasználatok száma 30,24 százalékkal csökkent. A CoreWeave szerint ez a megközelítés a modellminőség és a költség szempontjából is javulást hozott.
CoreWeave: Closing the Loop Between Inference and Post-Training


