Így ellenőriznék az AI-modelleket hozzáférés nélkül
Több mint 100 kutató és mérnök vizsgálta az AVID Workshopon, hogyan lehet megbízható bizonyítékot szerezni az AI-rendszerek működéséről a modell súlyai és a fejlesztési infrastruktúra korlátlan átadása nélkül. A megbeszélések középpontjában a bizalmas számítástechnika, a zéró tudású bizonyítás, az újraszámítás és a formális ellenőrzés állt.
- Több mint 100 kutató és mérnök vett részt az AVID Workshopon.
- A résztvevők a modell súlyainak átadása nélküli ellenőrzést vizsgálták.
- Kiemelt téma volt a futó modellverzió bizonyítható azonosítása.
- A módszerek között szerepelt a bizalmas számítástechnika és a zéró tudású bizonyítás.
- Az új technológiák külső auditokat és nemzetközi AI-együttműködést támogathatnak.
A nagy teljesítményű modellek ellenőrzése új kihívás
A FAR.AI és a Center for AI Safety május 17-én rendezte meg az Assurance & Verification of AI Development, röviden AVID Workshopot, az IEEE S&P konferenciával közös helyszínen. A résztvevők azt vizsgálták, milyen technikai alapokra van szükség ahhoz, hogy külső szereplők a fejlesztéstől az éles üzemeltetésig bizonyítékot szerezhessenek az AI-rendszerek tulajdonságairól.
A kérdés jelentőségét a szervezők az Anthropic példájával érzékeltették. A vállalat 2026 elején nem tette nyilvánossá legújabb Mythos modelljét, mert aggódott amiatt, hogy az rosszindulatú szereplőknek segíthet kibertámadásokban. Az Anthropic beszámolója szerint a Mythos „több ezer súlyos sebezhetőséget talált, köztük minden jelentős operációs rendszerben és webböngészőben”.
Az AI-rendszerek fejlesztéséről és kiadásáról szóló döntések egyre nagyobb tét mellett születnek. A külső értékelők, köztük a METR, az Apollo és a SecureBio, gyakran korlátozott erőforrásokkal és kevés betekintéssel dolgoznak. A workshop szerint jobb eszközök gyorsabb és automatizáltabb elemzést, illetve mélyebb együttműködést tehetnének lehetővé.
Bizalmas audit és ellenőrizhető következtetés
Koen van der Veen, az OpenMined kutatója olyan bizalmas és ellenőrizhető auditálási megoldásokról beszélt, amelyeknél a fejlesztőknek nem kell átadniuk a modelleket az auditoroknak, az auditoroknak pedig nem kell megosztaniuk érzékeny vagy akár minősített adatokat tartalmazó értékeléseiket a fejlesztőkkel.
A workshop egyik kiemelt témája annak bizonyítása volt, hogy pontosan melyik modellverzió fut. Ez a FAR.AI szerint jelenlegi módszerekkel is megvalósíthatónak tűnik, és üzleti szempontból is hasznos lehet. Egy auditor vagy felhasználó így ellenőrizhetné, hogy ugyanaz a modell működik-e, amelyet korábban külső fél értékelt, vagy egy módosított változat fut, amelyre már nem feltétlenül érvényesek az értékelési eredmények.
Az Anthropic nyilvánosan vállalta, hogy kidolgoz egy, az úgynevezett bizonyítható következtetésre épülő prototípust. Ennek célja a vállalat szerint az AI-modell kimeneteinek megbízható, bizonyítható „aláírása”, hogy azok egy meghatározott modell-súlykészlethez legyenek köthetők.
Négy technikai irány a megbízható bizonyítékhoz
A bizalmas számítástechnika modern processzorok és egyes AI-gyorsítók védelmi képességeire támaszkodik. Ezekkel távolról igazolható lehet, hogy az AI-chipeken futó kódot nem módosították, a várt modell töltődött be, és a folyamat titkosított környezetben zajlik. A megoldás ugyanakkor bizalmat követel a hardver tervezője és gyártója, valamint a titkosításhoz használt kulcsok kezelése iránt. A jelenlegi rendszerek a kifinomult fizikai támadások ellen is korlátozott védelmet nyújtanak, és általában nem alkalmasak a több terabájtnyi memóriát igénylő, legnagyobb modellek gyakorlati méretű tanítására vagy futtatására.
A zéró tudású bizonyítás kriptográfiai bizonyítékokat készít egy-egy következtetési számításhoz. A bizonyítékok előállítása korábban nagyságrendekkel lassabb volt magánál a következtetésnél, de a Kang lab, az UIUC és más kutatócsoportok munkája az elmúlt két évben csökkentette a különbséget. A workshopon a Birminghami Egyetem és a General-Purpose AI Policy Lab azt is vizsgálta, hogyan lehetne ilyen bizonyításokkal a tanítás során felhasznált számítás mennyiségét igazolni.
Az újraszámítás során egy külső szereplő ugyanazokon a bemeneteken újra előállítja a modell kimeneteit, majd összeveti azokat az eredeti válaszokkal. Ezt nehezíti, hogy egyes modellek nem mindig adnak pontosan azonos eredményt, például a szakértői útválasztás vagy a GPU-kon végzett műveletek sorrendje miatt. Roy Rinberg, a Harvard Egyetem kutatója olyan prototípusról beszélt, amely ezeket a nemdeterminisztikus működésből fakadó problémákat kezeli.
Az analóg érzékelők az AI-következtetés és -tanítás energiafogyasztását vagy más fizikai jeleit rögzíthetik. Ezek kevésbé pontos, durvább képet adnak az adatközponti tevékenységről, ugyanakkor ez előny lehet olyan együttműködési helyzetekben, ahol a kereskedelmileg értékes információk kiszivárgása komoly kockázatot jelentene.
Miért fontos ez a felhasználóknak és a piacnak?
A workshopon tárgyalt módszerek közös célja a célzott átláthatóság. A kormányoknak és auditoroknak ellenőrizhető bizonyítékot adhatnak úgy, hogy közben védik a modell súlyait és a nemzetbiztonsági vagy üzleti szempontból érzékeny infrastruktúrát.
Ez különösen fontos lehet a független értékelések, a vállalati bevezetések és az AI-fejlesztés nemzetközi koordinációja során. Az OpenAI korábban felvetette, hogy bizonyos kritikus pontokon előnyös lehet a fejlesztés összehangolt lassítása, hogy legyen idő a technikai összehangolási problémák megoldására és a társadalmi alkalmazkodásra. Az Anthropic és a Google DeepMind vezetői szintén beszéltek a fejlesztés kollektív lassításának kívánatosságáról.
A FAR.AI szerint az ilyen együttműködéshez olyan technikai infrastruktúrára lehet szükség, amellyel a fejlesztők és a kormányok hitelesen igazolhatják egymásnak a magas kockázatú fejlesztési tevékenységek korlátozását. Az AVID Workshopon bemutatott megoldások ennek a bizonyíthatóságnak az alapjait keresik.
FAR.AI: AViD Workshop 2026 | FAR.AI
