Az uniopen az Amazon Nova finomhangolásával javította a moderálást

Az uniopen az Amazon Nova 2 Lite modellt saját kiskereskedelmi moderálási szabályaihoz igazította. A finomhangolás és egy későbbi promptmódosítás után mindkét vizsgált mutató átlépte a produkciós célértéket.
- Az uniopen az Amazon Nova 2 Lite modellt saját moderálási szabályaihoz igazította.
- A finomhangolás a Per Behavior Macro F1 értékét 0,5852-ről 0,8364-re emelte.
- A promptoptimalizálás után a két mutató 0,8550 és 0,8491 lett.
- A javításokat embernek kell ellenőriznie, mielőtt tanítási adatként használják.
- A modelljelöltek kötelező és figyelmeztető ellenőrzési kapukon mennek át.
Az uniopen saját moderálási taxonómiát használ
Az AWS október 1-jei beszámolója szerint az uniopen a tajvani Uni-President Enterprises Group digitális kommunikációs és tagsági platformja. A szolgáltatás webes, táblagépes és mobilcsatornákon kapcsolja össze az ügyfeleket az e-kereskedelmi funkciókkal, tagsági előnyökkel és más kiskereskedelmi élményekkel.
A platform minden interakciót két szempont alapján osztályoz. Az első azt jelöli, milyen viselkedés történt, erre kilenc kategóriát használnak. A második azt mutatja meg, mire vonatkozik a viselkedés: a márkára, más témára vagy tiltott tartalomra. Az AWS szerint ez a felosztás kifejezetten az uniopen üzleti szabályaihoz kötődik, ezért egy általános célú modell önmagában nem feltétlenül tudja megfelelően kezelni.
A csapat Amazon SageMaker AI-ban, felügyelt finomhangolással alakította át az Amazon Nova 2 Lite működését. A folyamatot később promptszintű kimeneti optimalizálással egészítették ki.
A finomhangolás hozta a legnagyobb javulást
A három konfigurációt ugyanazon, 737 beszélgetési ablakból álló elkülönített tesztkészleten hasonlították össze. A finomhangolási adatkészlet 3391 tanítási ablakot tartalmazott. A Per Behavior Macro F1 mutató azt mérte, mennyire következetesen azonosítja a modell a kilenc viselkedési kategóriát, míg a Subject Type Macro F1 azt vizsgálta, hogy helyesen ismeri-e fel a tárgytípust, vagyis a márkát, az egyéb témát vagy a tiltott kategóriát.
Az alapmodell Per Behavior Macro F1 értéke 0,5852, Subject Type Macro F1 értéke pedig 0,4162 volt. Az Amazon SageMaker AI-ban, Low-Rank Adaptation, röviden LoRA használatával finomhangolt modellnél ezek az értékek 0,8364-re, illetve 0,8302-re emelkedtek.
A csapat ezután egyszerűsítette a modell kimenetét. A JSON-formátum helyett soralapú formátumot alkalmaztak, és pontosították, hogyan kell visszaadni a több viselkedést tartalmazó eredményeket. Ehhez nem volt szükség újabb tanításra. A Per Behavior Macro F1 0,8550-re, a Subject Type Macro F1 pedig 0,8491-re nőtt. A produkciós célértékek 0,8500, illetve 0,8200 voltak, így a végső konfiguráció mindkettőt meghaladta.
Emberi ellenőrzés és kiadási kapuk védik a folyamatot
Az architektúra különválasztja a produkciós moderálást a javítási, tanítási, értékelési és telepítési lépésektől. Az Amazon Nova 2 Lite kezeli az elsődleges moderálási kéréseket, az Amazon Nova 2 Pro pedig javasolt javításokat készít a jelentett hibákhoz. A javításokat minden esetben emberi ellenőrnek kell jóváhagynia, mielőtt bekerülnek a tanítási adatok közé.
Az ellenőrzött javításokat és a tanítási adatokat Amazon S3 tárolja, az aktív és jelölt modellkonfigurációkat Amazon DynamoDB követi. Az Amazon Elastic Kubernetes Service-en futó Argo Workflows hangolja össze a promptoptimalizálást, az értékelést és a telepítést, az Argo CD pedig az elfogadott konfigurációkat juttatja el az éles környezetbe. Az Amazon SNS és az Amazon CloudWatch értesíti az üzemeltetőket, ha egy kötelező ellenőrzés sikertelen, vagy egy jelölt beavatkozást igényel.
A kötelező kapuk sikere nélkül a munkafolyamat leáll. A figyelmeztető jelek, például az alacsony megbízhatóság vagy egy adott osztály teljesítményének romlása, adminisztrátori jóváhagyást igényelnek. Az AWS szerint a két külön mutató együttes használata megakadályozza, hogy az egyik területen elért javulás elfedje a másik terület romlását. Az uniopen a jövőben is ezeket a mutatókat használja produkciós kapuként, és új határeseteket gyűjt.


