Az uniopen üzleti szabályokra hangolta az Amazon Nova moderációját

Az AWS bemutatta, hogyan szabta testre a tajvani uniopen az Amazon Nova 2 Lite modellt saját tartalommoderációs szabályaihoz. A felügyelt finomhangolás és egy további promptmódosítás után mindkét vizsgált mutató meghaladta a gyártási célértéket.
- Az uniopen az Amazon Nova 2 Lite modellt saját moderációs szabályaihoz igazította.
- A finomhangolás 0,5852-ről 0,8364-re emelte a Per Behavior Macro F1 értékét.
- A promptoptimalizálás után ez a mutató 0,8550, a Subject Type Macro F1 pedig 0,8491 lett.
- Az ellenőrzött javítások és a bizonytalan esetek kezelésében emberi felülvizsgálat maradt szükséges.
Két szempont alapján moderálja a beszélgetéseket az uniopen
Az uniopen a tajvani Uni-President Enterprises Group digitális kommunikációs és tagsági platformja. A szolgáltatás webes, táblagépes és mobilcsatornákon kapcsolja össze az ügyfeleket az elektronikus kereskedelemmel, a tagsági előnyökkel és más kiskereskedelmi élményekkel.
A platform moderációs szabályzata minden interakciót két tengely mentén osztályoz. Az első azt vizsgálja, milyen viselkedés történt, erre kilenc kategóriát használva. A második azt határozza meg, hogy mire vonatkozik a viselkedés: a márkára, másra vagy tiltott tárgyra. Az AWS szerint mindkét besorolásnak pontosnak kell lennie ahhoz, hogy a moderációs döntés használható legyen.
A vállalat 2026. október 1-jén közzétett leírása szerint ezek az üzleti szabályok kifejezetten az uniopen működéséhez kötődnek, ezért egy általános célú modell önmagában nem feltétlenül tanulja meg őket.
Finomhangolás és promptoptimalizálás egy ellenőrzött folyamatban
Az uniopen az Amazon Nova 2 Lite modellt az Amazon SageMaker AI felületén, felügyelt finomhangolással és Low-Rank Adaptation, vagyis LoRA technikával alakította át. A gyártási moderációs kéréseket az Amazon Nova 2 Lite kezeli, míg a jelentett hibákhoz az Amazon Nova 2 Pro készíthet javítási jelöltet. Ezeket a javításokat azonban minden esetben embernek kell ellenőriznie, mielőtt bekerülnek a tanítási adatok közé.
Az ellenőrzött javításokat és a tanítási adatokat Amazon S3 tárolja, az aktív és a lehetséges modellkonfigurációkat pedig Amazon DynamoDB követi. Az Amazon Elastic Kubernetes Service-en futó Argo Workflows szervezi a promptoptimalizálást, az értékelést és a bevezetést, az Argo CD pedig az elfogadott konfigurációkat alkalmazza az éles rendszerben. Az Amazon SNS és az Amazon CloudWatch riasztást küld, ha egy kötelező ellenőrzés sikertelen, vagy egy jelölt további figyelmet igényel.
A rendszerben kötelező és figyelmeztető ellenőrzések egyaránt működnek. A kötelező, úgynevezett hard gate tesztek hibája leállítja a folyamatot. A figyelmeztető, soft gate jelzései, például az alacsony megbízhatóság vagy egy kategória teljesítményének visszaesése, adminisztrátori jóváhagyást igényelnek. Csak figyelmeztetés nélküli jelölt kerülhet automatikusan élesbe.
A két mérőszám mindegyike javult
A három konfigurációt ugyanazon, 737 beszélgetési ablakból álló elkülönített tesztkészleten értékelték. A finomhangolási adatkészlet 3391 tanítási ablakot tartalmazott. A Per Behavior Macro F1 azt méri, mennyire következetesen osztályozza a modell a kilenc viselkedési kategóriát, míg a Subject Type Macro F1 azt mutatja meg, mennyire pontosan azonosítja a tárgy típusát, vagyis a márkát, az egyebet és a tiltott kategóriát.
Az alapmodell Per Behavior Macro F1 értéke 0,5852, Subject Type Macro F1 értéke pedig 0,4162 volt. A SageMaker AI-ban végzett finomhangolás után ezek 0,8364-re, illetve 0,8302-re emelkedtek.
A csapat ezután a modell kimenetét módosító promptot alkalmazott. A JSON-formátum helyett soralapú kimenetet kért, és pontosította, hogyan kell több viselkedést visszaadni. Ehhez nem volt szükség újabb tanításra. A Per Behavior Macro F1 így 0,8550-re, a Subject Type Macro F1 pedig 0,8491-re nőtt. A gyártási célértékek rendre 0,8500 és 0,8200 voltak, így a végső konfiguráció mindkettőt elérte.
Az emberi ellenőrzés az éles működés része marad
Az AWS szerint a két mérőszám együttes használata megakadályozza, hogy az egyik területen elért javulás elfedje a másikon bekövetkező visszaesést. Miután a végső modell mindkét kiadási célértéket teljesítette, az uniopen a rutinmoderációt a testre szabott útvonalra irányíthatta, miközben az emberi ellenőrzést a bizonytalan esetekre összpontosította.
Az emberi felülvizsgálat továbbra is kötelező a kétértelmű eseteknél és a tanításban újra felhasznált javításoknál. A csapat rögzített tesztkészleteket és regressziós ellenőrzéseket használ, amelyek megakadályozzák az automatikus bevezetést minőségromlás esetén. Az AWS leírása szerint a további munka során is a Per Behavior Macro F1 és a Subject Type Macro F1 maradnak a gyártási kapuk.


