A Mistral bemutatta a Shieldstral multimodális biztonsági modellt

A Mistral AI 2026. augusztus 4-én bemutatta a Shieldstral nevű, 3B paraméteres, nyílt súlyú multimodális biztonsági osztályozót. A modell szövegek és képek moderálására készült, és a vállalat szerint egyszerű nyelvi irányelvek alapján, újratanítás nélkül alkalmazkodik különböző szabályokhoz.
- A Shieldstral egy 3B méretű, nyílt súlyú multimodális biztonsági osztályozó.
- A Mistral Apache 2.0 licenc alatt adja ki a modell súlyait.
- A modell természetes nyelvű irányelveket fogad inferencia közben, újratanítás nélkül.
- A vállalat szerint egyetlen 16GB-os NVIDIA GPU-n futtatható.
- A Mistral szöveges, képi és szöveg-kép moderálási feladatokra pozicionálja.
Nyílt súlyú biztonsági osztályozó szövegre és képre
A Mistral AI közlése szerint a Shieldstral egy 3B méretű, nyílt súlyú multimodális biztonsági osztályozó, amelyet Apache 2.0 licenc alatt adnak ki. A modell feladata, hogy megítélje, egy adott tartalom megfelel-e a megadott biztonsági irányelvnek, legyen szó szövegről, képről, vagy szöveg és kép kombinációjáról.
A vállalat állítása szerint a Shieldstral szöveges biztonsági feladatokban olyan nyílt guardrail modellekkel egyezik meg vagy teljesít jobban, amelyek akár 7-szer nagyobbak nála, multimodális moderálásban pedig új csúcseredményt állít fel. A Mistral azt is kiemeli, hogy a modell egyetlen 16GB-os NVIDIA GPU-n futtatható.
A bejelentés szerint a Shieldstral célja, hogy a tartalommoderálást ne előre rögzített kárkategóriákhoz kösse. A Mistral példái szerint ugyanaz a tartalom más megítélés alá eshet egy kiberbiztonsági kutatóeszközben, mint egy mentális egészséggel foglalkozó platformon. A modell ezért a szabályt az inferencia idején, természetes nyelvű kérdésként kapja meg.
A moderálást kérdésként kezeli
A Shieldstral a tartalommoderálást bináris kérdés-válasz feladatként fogalmazza meg. Egy kérés három részből áll: az Instruct rész adja meg az értékelési környezetet, a szigorúságot és opcionálisan azt, mi számít nem biztonságos tartalomnak; a Query egy igen vagy nem kérdés, például hogy a tartalom támogat-e fizikai erőszakot; a Document pedig maga az értékelendő tartalom, amely lehet prompt, válasz, prompt-válasz pár, vagy kép opcionális szöveggel.
Inferencia közben a modell csak az igen és nem logitokat olvassa ki, majd ezeket softmax-normalizálással folytonos biztonsági pontszámmá alakítja. A Mistral szerint ez az egyforma felépítés egyetlen problémává vonja össze a promptosztályozást, a válaszmoderálást, a visszautasítás felismerését és a toxicitásészlelést.
A megközelítés fontos eleme, hogy az irányelvek a promptban élnek. Így ugyanaz a modellcheckpoint új szabályokra is átirányítható telepítéskor, újratanítás nélkül. A Mistral szerint a Shieldstral szabad formájú lekérdezéseket fogad, és egyetlen előrehaladási lépésben kalibrált igen vagy nem valószínűséget ad vissza, amely küszöbölésre vagy bizalom szerinti rangsorolásra használható.
Milyen teljesítményt és képességeket emel ki a Mistral
A vállalat négy területen értékelte a Shieldstralt nyílt guard modellekkel szemben, amelyek akár 7-szer nagyobbak lehetnek nála. Ezek a területek: szöveges biztonság, visszautasítás-felismerés, szabályokhoz való alkalmazkodás és multimodális biztonság. A közlés szerint minden értékelési minta kimaradt a tanításból.
A Mistral fő állításai közé tartozik, hogy a modell erős teljesítményt nyújt szöveges biztonságban, visszautasítás-felismerésben, irányelv-adaptációban és multimodális benchmarkokon. A Shieldstral egyetlen természetes nyelvi felülettel kezeli a szöveges, képi, valamint szöveg-kép tartalmakat, továbbá promptokat, válaszokat és prompt-válasz párokat is.
A modell valós és szintetikus adatokon készült, különböző címkeformátumokkal és taxonómiákkal. A Mistral szerint ezeket egyetlen keretbe konszolidálták. A kimenet nem csak diszkrét címke, hanem kalibrált valószínűségi pontszám, amely azt jelzi, hogy a tartalom a megadott kérdés alapján biztonságosnak vagy problémásnak tekinthető-e.
Hogyan épült a Shieldstral
A Mistral szerint a fejlesztés alapgondolata az volt, hogy egy kisebb modell is felülmúlhat jóval nagyobbakat, ha megfelelő adatokat kap. A vállalat négy fő adatkezelési problémát említ: a heterogén adatok egységesítését, a megkülönböztetési képesség tanítását, a képi biztonság megalapozását és a kiegészítő checkpointok kombinálását.
A nyilvános biztonsági adatkészletek eltérnek taxonómiáikban, címkéikben és annotációs szokásaikban. A Mistral minden adatkészletet ugyanabba az instruction, query, document formátumba alakított át, miközben változtatta az instrukciók, kérdések és elválasztók megfogalmazását, hogy a modell ne egyetlen stílusra illeszkedjen túl. A szigorúságot forrásonként kalibrálták, például adversarial jailbreak adatoknál szigorúbban, válaszminőségi adatoknál megengedőbben.
A cég szerint a fix szabálycímkékre tanított modellek hajlamosak csak az előre megadott irányelveket osztályozni. Ennek kezelésére egymáshoz hasonló, könnyen összetéveszthető szabályokat állítottak össze, majd egy LLM-mel olyan kontrasztív párokat írattak át, amelyek az egyik szabályt sértik, a közeli másikat viszont nem. A képi adatoknál a Mistral korlátozott moderációs adatkészleteket egészített ki általános célú képadatkészletekkel, a kép-kérdés párokat pedig vision-language újrarangsorolóval szűrte.
A modell finomhangolásához LoRA-t használtak, majd SLERP eljárással egyesítettek egy nyilvános adatokon kalibrált checkpointot, egy generált adatokból származó, finomabb szabálymegkülönböztetést adó checkpointot és az alap instruct modellt. A Shieldstralt a Mistral Forge platformján építették, amely a közlés szerint az infrastruktúrát, az adat- és modellshardingot, a metrikákat és a naplózást kezelte.
Mit jelenthet ez a felhasználóknak és a piacnak
A Shieldstral bejelentése a Mistral szerint a kontextushoz alkalmazkodó moderálás felé tett lépés. A megközelítés abból indul ki, hogy különböző termékekben és közönségeknek eltérő biztonsági szabályokra lehet szükség, ezért a modellnek nem egyetlen, befagyasztott taxonómiára kell támaszkodnia.
A fejlesztők számára a legfontosabb ígéret az, hogy a biztonsági szabályok természetes nyelven adhatók meg, és a modell újratanítás nélkül használható új irányelvekhez. Az Apache 2.0 alatti nyílt súlyú kiadás azt is jelenti, hogy a közösség a Mistral által közzétett súlyokra építhet.
A Mistral a következő lépések között a többnyelvű lefedettség, a hosszabb dokumentumokkal szembeni robusztusság és a szélesebb multimodális biztonság fejlesztését említi. A mostani bejelentés alapján a Shieldstral fő célterülete azoknak a rendszereknek a támogatása, amelyeknek szöveges és képi tartalmakat kell a saját szabályaik szerint értékelniük.
Mistral AI: Introducing Shieldstral.


