A Wiz nyilvános vödörszkennerből AI-alapú kontextusmotort épített

A Wiz AI-alapú adatbesorolási rendszert fejlesztett, amely a fájlok tartalmát és környezetét együtt elemzi. A vállalat szerint a nyilvános felhőtárhelyek vizsgálatára indított projekt mára több adatfelületet kiszolgáló kontextusmotorrá vált.
- A Wiz AI-alapú adatbesorolási rendszere a fájlok tartalmát és környezetét együtt vizsgálja.
- A megoldás több specializált AI-ügynököt és eltérő képességű modelleket használ.
- A rendszer egy hét alatt több mint 2700 érzékenyadat-leletet azonosított.
- A kontextusmotor felhőtárhelyeken, meghajtókon, végpontokon és támadásszimulációban is működik.
A hagyományos szkennerek gyakran elveszítik a kontextust
A nyilvános felhős tárolók, köztük a tárhelyvödrök, továbbra is jelentős támadási felületet jelentenek. Nevük globálisan kitalálható, a hibás konfigurációk gyakoriak, az aggregátorok pedig naponta több százezer nyitott vödröt indexelnek. Ha egy vödör hozzáférhetővé válik, a benne lévő adatok egyetlen URL-en keresztül letölthetők.
A Wiz szerint a hagyományos adatkeresők előre megadott reguláris kifejezésekre és szabályokra támaszkodnak. Ezek jól működhetnek például egy ssn nevű oszlopot tartalmazó CSV-fájl vagy egy AWS titkos kulcsot tartalmazó .env fájl esetében, a valós felhős adatok azonban sokféle rendszerből származnak, eltérő néven és formátumban készülnek, ráadásul több nyelven is íródhatnak.
A rendszeres kifejezések a beszkennelt dokumentumoknál is korlátozottak. Az útlevelekről, igazolványokról és kézzel írt űrlapokról készült PDF-fájlok gyakran az optikai karakterfelismerést is megnehezítik. A szabályalapú keresők közben tesztadatokra, helyőrző értékekre és sablonokra is riaszthatnak. Egy fájlról így megállapítható, hogy tartalmaz e-mail-címet, de az már nem feltétlenül, hogy egy éles ügyféladatbázisról van szó.
Több AI-ügynök vizsgálja a fájlokat
A Wiz 2026. augusztus 27-i beszámolója szerint az első prototípus több, külön feladatra szakosodott alügynökből állt. A kisebb modellek a nagy mennyiségű előszűrést és a fájlok kiválasztását végezték, a nagyobb modellek pedig azokat az elemzéseket kapták, amelyekhez összetettebb következtetésre volt szükség.
A folyamat iteratív módon működik. Ha az elemzés például felismeri, hogy az ügyfélazonosítók egy meghatározott formátumot követnek, vagy hogy a vödörben egy bizonyos nyelvű dokumentumok találhatók, ezek az információk visszakerülnek a felfedezési szakaszba. A rendszer így további, hasonló szerkezetű fájlokat kereshet.
A vállalat kezdetben költségkorlát, strukturált kimenet és futásidő-korlát nélkül tesztelte a koncepciót. A megoldás lassú és drága volt, ugyanakkor olyan adatokat is megtalált, amelyeket a korábbi szkennerek nem észleltek. A Wiz példaként személyazonosság-ellenőrzési dokumentumokat, nem egyértelmű nevű ügyféladatbázisokat és egymásba ágyazott könyvtárakban elrejtett hitelesítő adatokat említ.
A gyártási rendszer minden vizsgált fájlról strukturált eredményt készít. Meghatározza a fájl típusát és feltételezett célját, azonosítja az adatfajtákat, például a személyes és pénzügyi adatokat, majd érzékenységi és súlyossági besorolást, valamint anonimizált bizonyítékot ad. A súlyosság értékelésénél a tartalom, a fájl metaadatai, az adatok mennyisége és frissessége mellett a rendszer azt is vizsgálja, hogy szintetikus vagy tesztadatról van-e szó.
Egy hét alatt több mint 2700 érzékeny adatlelet
A Wiz a skálázhatóság érdekében minden feldolgozási szakaszhoz a szükséges minimális modellképességet rendelte, kötegelte a feladatokat, figyelte az erőforrás-felhasználást, és a költségkeret elérésekor szabályosan leállította a feldolgozást. A determinisztikus feladatokat kivette az AI-rétegből. A rendszer elkülönített homokozóban fut, és többek között archívumokat, tömörített fájlokat, virtuális lemezképeket, PDF-eket, eltérő szövegkódolásokat, valamint konfigurálható mélységig beágyazott fájlokat kezel.
A Wiz saját közlése szerint egyhetes teszt során több mint 2700 érzékenyadat-leletet azonosított több száz egyedi, nyilvános vödörben, közel 2000 egyedi fájlt érintve. A találatok között belső üzleti dokumentumok, ügyfél-exportok, hitelesítő adatok, pénzügyi nyilvántartások és személyazonosító dokumentumok szerepeltek.
A rendszer ma nyilvános és privát felhőtárhelyeken, felhőmeghajtókon, megosztott meghajtókon és végpontokon is használható a Wiz szerint. Támadásszimulációban a Red Agent által azonosított adatokat is átadhatja a besorolási motornak. Az eredmények közvetlenül a Wiz Security Graph rendszerébe kerülnek, riasztásokat indíthatnak és irányítópultokat tölthetnek fel, így a felhasználók a fájlok puszta érzékenységi jelzése helyett azok tartalmáról és kockázatáról is részletesebb képet kaphatnak.


