Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A megbízhatóság lett az AI-biztonság legnagyobb hiányterülete

2026. augusztus 5.Forrás: FAR.AI

A mesterséges intelligencia képességei gyorsan fejlődnek, a megbízhatóságuk mérésére és igazolására szolgáló módszerek viszont elmaradnak ettől. Ez volt a FAR.AI július 6-i, közel 200 résztvevőt felvonultató szöuli workshopjának egyik központi megállapítása.

A lényeg röviden
  • A FAR.AI szöuli workshopján közel 200 résztvevő vett részt.
  • A képességek fejlődése mellett a modellek megbízhatósága közel változatlan maradt.
  • A PostTrainBench az AI-kutatás automatizált végrehajtását méri.
  • A szervezet megbízható méréseket és betartható biztonsági szabványokat sürget.

Az AI-biztonsághoz mérhető követelmények kellenek

A FAR.AI a Seoul Alignment Workshop 2026 összefoglalójában arról ír, hogy az eseményen határterületi AI-laborok, egyetemek, kormányzati szereplők és AI-biztonsági szervezetek képviselői találkoztak. A workshopot az ICML 2026 konferenciával egy helyszínen rendezték meg.

Az előadások témája a modellek belső működésének geometriájától a nemzeti szabályozás kialakításáig terjedt. A FAR.AI szerint a különböző témák mögött közös igény rajzolódott ki: az AI-biztonságnak megbízható mérésekre és betartható szabványokra van szüksége. A szervezet ezt az AI fejlesztésének mérnöki irányba történő elmozdulásaként értékeli.

A beszámoló szerint a jelenlegi eszközök több ponton is elégtelenek. Egyes értelmezési módszerek hibás szerkezetet feltételeznek a modellekben, bizonyos próbákra a modellek megtanulhatnak kijátszható módon reagálni, az értékelések pedig a tényleges bevetéshez képest töredéknyi számítási kapacitással zajlanak. Olyan mérőszámok is használatban vannak, amelyek szakértői értékelőit a modellek már megelőzték.

A képességek nőnek, a megbízhatóság alig változik

A nyitó panelen Cynthia Chen Stephan Rabanserrel, Adam Gleave-vel és Dylan Hadfield-Menellel beszélte át, miért teljesítenek a rendszerek sok teszten emberfeletti szinten, miközben hétköznapi használatban továbbra is hibáznak.

Rabanser, a Princeton CITP munkatársa a repülési, nukleáris és autóipari mérnöki gyakorlathoz hasonlította az AI-rendszerek ellenőrzését. Szerinte egy rendszert nem egyetlen pontossági érték alapján kellene tanúsítani. Az AI-ügynököknél négy szempontot emelt ki: a következetességet, a robusztusságot, a kiszámíthatóságot és az üzemeltetési biztonságot.

A workshopon ismertetett eredmények szerint a pontosság folyamatosan javult az újabb modellgenerációknál, miközben a megbízhatóság közel változatlan maradt. A modellek valóban ellenállóbbá váltak az eszközhibákkal szemben, ugyanakkor egy kérés kisebb átfogalmazása továbbra is hibát okozhat.

Gleave szerint a megbízhatóságot önálló képességként kell kezelni. A mérését nehezíti, hogy nincsenek szabványos tesztek, a súlyos hibák ritkák, és nincs olyan általános fejlesztési recept, mint amilyen a képességek növelésénél a több számítás és több adat. Olyan műszaki szabványt sürgetett, amely 99 százaléknál nagyobb bizonyossággal igazolja egy rendszer biztonságát, és amelyet kormányzati, piaci és önkéntes ösztönzőkkel széles körben alkalmaznak.

Az automatizált AI-kutatás új mérési kihívást hoz

Maksym Andriushchenko az ELLIS és az EPFL képviseletében a PostTrainBench nevű mérési módszert mutatta be. Ez azt vizsgálja, hogy az ügynökök képesek-e egy nagy nyelvi modell utólagos tanítását teljes folyamatként végrehajtani. A teszt egy alapmodellt, rögzített számítási keretet és webes keresést biztosít, a módszert viszont nem írja elő, és csak a létrejött modellt értékeli.

Az ilyen nyitottság kijátszható. Egy ügynök például egy Hugging Face-ről letöltött modellt saját eredményként adhatna át. A PostTrainBench ezért jutalomfeltörést kereső bírót is használ, és a gyanús futtatást az alapmodell szintjén értékeli, így a csalás nem hoz eredményt.

Alan Chan, a GovAI munkatársa szerint az AI-kutatás automatizálása növelheti a kutatási munka tényleges mennyiségét, ez pedig gyorsíthatja a fejlődést. Egyúttal a biztonsági kutatás és a szakpolitika nehezebben tarthat lépést, miközben az emberi ellenőrzés is gyengülhet. Chan nem állította, hogy ez biztosan bekövetkezik, de olyan mérőszámok és értékelések kidolgozását sürgette, amelyek megmutatják, tartja-e a lépést a biztonsági munka a képességek fejlődésével.

A felhasználók számára a bizonyítható megbízhatóság a tét

A FAR.AI összefoglalója szerint a workshop fő üzenete, hogy a fejlesztés következő akadálya a biztonság megbízható igazolása. A jelenlegi red team tesztek a szervezet tapasztalata alapján ritkábban találnak teljes, végponttól végpontig működő jailbreaket a vezető, zárt modelleken. Gyakrabban olyan rendszert tárnak fel, amelyben több védelmi réteg közül csak egy marad működőképes, így egy új támadási technika az egész védelmet veszélyeztetheti.

A beszámoló szerint a teljes automatizálásnál ezért jóval magasabb megbízhatósági küszöbre van szükség, mint olyan használatnál, ahol ember marad a folyamatban és ellenőrző szerepet tölt be. A FAR.AI szerint a piac és a kutatás számára az lesz a döntő kérdés, hogyan lehet előre rögzített biztonsági tulajdonságokat tesztelni, az egyes komponenseket külön értékelni, és a modellek látható kimenetein túl a rejtett működésüket is vizsgálni.

Kapcsolódó hírek

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

A Scale AI szerint Washingtonnak saját AI-tesztelési kapacitás kell
Cégek és üzlet2026. szeptember 25.

A Scale AI szerint Washingtonnak saját AI-tesztelési kapacitás kell

A Scale AI szerint az amerikai szövetségi kormány nem tudja megfelelően mérni a legfejlettebb mesterségesintelligencia-modellek kockázatait, ezért független tesztelési…

Biztonság és etika
Biztonság és etika2026. július 16.

Több mint 200 szakértő vitatta meg az AI-biztonság jövőjét Londonban

A londoni Alignment Workshop több mint 200 kutatót, döntéshozót és iparági szakértőt hozott össze azzal a céllal, hogy az egyre fejlettebb AI-rendszerek ellenőrzésének…