A Goodfire valós időben figyeli a Kimi K3 kiberbiztonsági kockázatait

A Goodfire olyan kiberbiztonsági monitorokat fejlesztett Kimi K3-hoz és GLM 5.3-hoz, amelyek a vállalat szerint az LLM-alapú ellenőrzésnél 50-szer alacsonyabb költséggel működnek. A rendszer valós időben szűri a gyanús műveleteket, így a kockázatos lépések még az eszközhívás előtt blokkolhatók.
- A Goodfire Kimi K3-hoz és GLM 5.3-hoz készített kiberbiztonsági monitorokat.
- A probe előszűri a bemeneteket, eszközhívásokat és kimeneteket, majd csak a gyanús eseteket küldi LLM-bírónak.
- A vállalat szerint a megoldás egymillió csere esetén 200 dollár alatti költséggel működik.
- A Goodfire négy munkaterhelésen legfeljebb 2 százalékos teljesítménycsökkenést mért.
- A rendszer célja, hogy a kockázatos műveleteket még az eszköz meghívása előtt lehessen blokkolni.
A teljes munkamenetet kell figyelni
A Goodfire október 8-án közzétett kutatási bejegyzésében azt írja, hogy a kiberbiztonsági feladatok különösen nehézzé teszik a mesterséges intelligenciaügynökök ellenőrzését. Egy kódbázis sérülékenységeinek vizsgálata és azok kihasználása sokszor hasonló műveletekből áll, ezért a jó- és rosszindulatú viselkedés megkülönböztetéséhez az ügynök teljes munkamenetén át kell követni a szándékot.
Egy ilyen munkamenet több százezer vagy akár több millió tokent is tartalmazhat. Elméletben egy másik, hasonló képességű nyelvi modell minden egyes lépést ellenőrizhetne, ez azonban túl lassú és költséges lenne valós idejű használat mellett. A gyakorlatban emiatt az ellenőrzés gyakran aszinkron módon történik, így a káros folyamat felismerésekor az ügynök már végrehajthatta a műveletet.
A Goodfire kétlépcsős szűrést használ
A Goodfire Kimi K3-hoz és GLM 5.3-hoz úgynevezett probe alapú monitorokat készített. A probe a modell belső aktivációit olvassa, és első vonalbeli szűrőként működik. Folyamatosan vizsgálhatja a bemeneteket, az eszközhívásokat és a kimeneteket, majd csak a gyanúsnak ítélt cseréket küldi tovább egy LLM-alapú értékelőnek.
A vállalat szerint ez a monitorlánc pontosabb a minden fordulót ellenőrző bírónál, és a beállított működési ponton 93 százalékos visszahívást ér el 5,5 százalékos téves pozitív arány mellett. A Goodfire állítása szerint a rendszer több mint 50-szer olcsóbb, költsége egymillió csere esetén 200 dollár alatt marad. A monitorozás emellett a kiinduló következtetési tokenátvitelt is fenntartja, és nem ad hozzá késleltetést.
A probe kalibrálását követően a Goodfire zárt tesztkészleten 0 százalékos hamis negatív arányt és 95 százalékos valódi negatív arányt mért. A cég szerint ez lehetővé teszi, hogy az LLM-bírót csak a káros tevékenységek ellenőrzésére használják. Egy független értékelő statikus vörös csapat tesztjein a rendszer a univerzális jailbreakkísérletek arányát 0 százalékra csökkentette.
Éles következtetési környezetbe építették be
A monitorokat a Goodfire éles következtetési infrastruktúrában is telepítette. A vállalat az SGLang kiszolgálót úgy bővítette, hogy a probe pontszámait közvetlenül a kiszolgálómotor számolja ki. Egyedi kerneleket készítettek a probe logikájához, és a pontszámokat a radix fán, a DSpark spekulátoron, valamint az előtöltés és dekódolás szétválasztásán keresztül is fenntartják, hogy ne legyen szükség újraszámításra.
Több Kimi K3-modellpéldány kiszolgálásakor minden worker futtatja a probe-okat, és vezeti az aktív kérések előzményeit. Az SMG router továbbítja a monitorozási beállításokat a kiválasztott workerhez, a monitorozási események pedig a válaszfolyammal együtt érkeznek vissza.
A Goodfire négy különböző következtetési munkaterhelésen a probe-ok engedélyezése mellett a teljesítmény legfeljebb 2 százalékkal csökkent, amit a vállalat a mérési zajon belülinek tekint. A cég szerint a megoldás így lehetővé teszi az ügynöki folyamatok valós idejű monitorozását, miközben az ellenőrzés a nyílt modellekre épülő szolgáltatásokban is beépíthető az infrastruktúrába.
Goodfire Research: Training and Deploying Production Cyber Monitors on Kimi K3 - Goodfire


