A Baseten és a Goodfire biztonsági kontrollokat épít nyílt modellekhez

A Baseten és a Goodfire AI közösen indítja el a Project Beacon projektet, amely a modellek generálása közben észlelné a biztonsági kockázatokat. A vállalatok így szabályokat rendelhetnének a promptinjekcióhoz, a jogosulatlan műveletekhez és az érzékeny adatok kitettségéhez.
- A Baseten és a Goodfire AI elindította a Project Beacon projektet.
- A rendszer a modellek belső aktivációit és szöveges jeleit is figyelné.
- A célzott kockázatok között szerepel a promptinjekció és az érzékeny adatok kitettsége.
- Az ügyfelenkénti szabályok jóváhagyást, elutasítást, visszalépést vagy naplózást írhatnak elő.
- A képességeket először kiválasztott modelleken és viselkedéseken tesztelnék.
A biztonságot már a következtetés során figyelnék
A Baseten 2026. október 9-én jelentette be a Project Beacon kezdeményezést a Goodfire AI-jal együttműködésben. A projekt célja, hogy proaktív, a modell következtetési folyamatába beépített biztonsági kontrollokat hozzon a nyílt modellekhez.
A Baseten szerint a mesterséges intelligencia egyre több szervezeti folyamatban jelenik meg. A modellek és az ügynökök belső dokumentumokat olvasnak, eszközöket hívnak meg, éles rendszerekbe küldenek változtatásokat, és több lépésből álló munkafolyamatokat hajtanak végre önállóan. Közben a csapatok gyakran cserélik a használt modelleket, illetve több modellt futtatnak párhuzamosan.
A Project Beacon a modellek generálás közbeni belső aktivációit olvasná. Ezekből olyan jelek nyerhetők, amelyek egy éppen kialakuló nem biztonságos eseményt azonosíthatnak, még azelőtt, hogy a válasz eljutna a felhasználóhoz vagy egy eszközhöz.
Promptinjekciót és jogosulatlan műveleteket is vizsgálnának
A Baseten négy kiemelt kockázati területet sorol fel. Promptinjekció esetén egy dokumentumban vagy egy eszköz válaszában szereplő utasítás próbálhatja eltéríteni az ügynök működését. Egy másik probléma, ha az ügynök olyan változtatást javasol, amelyre a felhasználó vagy a szervezet nem adott engedélyt.
A rendszer az érzékeny adatok nem megfelelő megjelenését és a biztonság szempontjából érzékeny munkafolyamatokban tapasztalható kiberbiztonsági visszaéléseket is figyelné. A vállalat szerint ehhez monitorozás, szöveges ellenőrzés, eszközvezérlés és emberi felülvizsgálat kombinációjára lehet szükség.
A Goodfire meghatározott viselkedésekhez fejleszt monitorokat a támogatott modelleken. A Baseten ezek jelzéseit ahhoz a rendszerhez kapcsolja, amely eldönti, hogyan reagáljon az alkalmazás. Az aktivációalapú és szöveges monitorok párhuzamosan osztályozhatják a kéréseket. A közleményben ismertetett felépítés szerint egy frontier modell csak akkor vesz részt, ha a két monitor eltérő eredményre jut.
Az ügyfelenként beállítható szabályok alapján a rendszer jóváhagyást kérhet, elutasíthatja a műveletet, tartalékmegoldásra válthat, vagy naplózhatja az eseményt az adminisztrátorok számára. A monitorozás a generálással párhuzamosan fut, és a Baseten leírása szerint nem blokkolja a válasz előállítását.
Központi szabályokat és fejlesztői vezérlést ígérnek
A Baseten egy beépített, azonnal használható biztonsági megoldás felé halad. Ennek része lenne a támogatott monitorok és ellenőrzések alapcsomagja, a különböző munkaterhelésekhez kialakított szabályrendszer, a riasztások, valamint annak nyilvántartása, hogy mit jelölt kockázatosnak a rendszer, és hogyan kezelték az eseményt.
A vállalati biztonsági és AI-platformcsapatok központilag alkalmazható alapvédelmet és munkaterhelésenként módosítható szabályokat kaphatnak. A fejlesztők számára a Baseten olyan biztonsági eseményeket és vezérlőket tervez, amelyek ugyanazon API-kon és fejlesztői eszközökön keresztül érhetők el, mint a következtetés.
A cég egy fizetési vitákat kezelő ügynök példáját hozza. Egy ilyen rendszer kereskedői üzeneteket és számlaadatokat olvashat, majd visszatérítést javasolhat. A nem megbízható tartalom eltérítheti a működését, egy hibás művelet pedig adatkitettséghez vagy pénzmozgatáshoz vezethet. A Baseten szerint a fejlesztőknek ezért olyan gyors jelzésekre van szükségük, amelyek alapján folytathatják a folyamatot, vizsgálatot indíthatnak, jóváhagyást kérhetnek vagy tartalékmegoldásra válthatnak.
A következő hónapokban a Baseten először kiválasztott modellekhez és megfigyelt viselkedésekhez tervezi kiadni a képességeket, később pedig vállalati kontrollokkal és fejlesztői funkciókkal bővítené azokat. A Project Beacon megoldásait néhány korai partnerrel közösen vinnék piacra, és a vállalat már most várja az érdeklődőket a korai hozzáféréshez és partnerséghez.


