Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Több mint 200 szakértő vitatta meg az AI-biztonság jövőjét Londonban

2026. július 16.Forrás: FAR.AI

A londoni Alignment Workshop több mint 200 kutatót, döntéshozót és iparági szakértőt hozott össze azzal a céllal, hogy az egyre fejlettebb AI-rendszerek ellenőrzésének gyakorlati kérdéseiről egyeztessenek. A FAR.AI által szervezett, március 2-án és 3-án megtartott esemény középpontjában az értelmezhetőség, a skálázható felügyelet, a modellek értékelése és az AI-irányítás állt.

A lényeg röviden
  • A FAR.AI workshopján több mint 200 szakértő vett részt.
  • A fő témák az értelmezhetőség, a skálázható felügyelet, az értékelés és az AI-irányítás voltak.
  • A résztvevők auditálható biztonsági szabványokat és független ellenőrző szervezeteket sürgettek.
  • Több előadás a modellek megtévesztésének felismerésével és a biztonsági tesztek korlátaival foglalkozott.
  • Az eseményen az EU AI Act gyakorlati végrehajtásáról és a fejlett AI nemzetközi irányításáról is beszéltek.

A képességek gyorsabban fejlődnek, mint a felügyelet

A FAR.AI összefoglalója szerint az AI-rendszerek képességei gyorsabban bővülnek, mint az ellenőrzésükhöz szükséges intézmények és szabványok. A workshop visszatérő kérdése az volt, hogyan lehet ezt a különbséget csökkenteni.

A résztvevők olyan konkrét problémákról tárgyaltak, mint az auditálható biztonsági szabványok kialakítása, a szándékosan megtévesztő környezetben is megbízható értékelések megtervezése, valamint az egyre nagyobb képességű rendszerek felügyeletéhez szükséges intézményi kapacitás kiépítése. A program azt jelezte, hogy az összehangolási kutatás az általános, nyitott kérdésektől egyre inkább a gyakorlati feladatok felé mozdul.

Közös biztonsági mércét sürgetnek

Adam Gleave, a FAR.AI munkatársa szerint az AI-biztonsági együttműködés legnagyobb akadálya nem feltétlenül a megoldások hiánya, hanem a közös szabvány hiánya. Amíg nincs közérthető és megosztott meghatározás arról, mitől biztonságos egy AI-rendszer, a vállalatok és a kormányok nehezen tudják egymást számon kérni.

Gleave a polgári és nukleáris mérnöki területek példájára hivatkozva olyan mérnöki megközelítést javasolt, amely három szempontot kapcsol össze: a biztonság igazolhatóságát, az auditálhatóságot és a hatékonyságot. Példaként rétegzett védelmi folyamatokat, empirikusan ellenőrzött gyakorlati szabályokat, végponttól végpontig tartó tesztelést, ellenséges helyzetekben vizsgált robusztussági összefüggéseket és megtévesztést észlelő módszereket említett.

Gillian Hadfield, a Johns Hopkins University kutatója független ellenőrző szervezetek létrehozását vetette fel. Ezek azt vizsgálhatnák, hogy az AI-rendszerek megfelelnek-e a biztonsági szabványoknak, és külső garanciát adhatnának a szabályozóknak és a nyilvánosságnak. Hadfield szerint ehhez felhasználhatók a felelősségi jog, a biztosítási piacok és a közbeszerzés meglévő intézményei is.

Az értelmezhetőségtől a megtévesztés felismeréséig

A fő előadások között Neel Nanda, a Google DeepMind kutatója a gyakorlati értelmezhetőség módszereiről beszélt. Ezek célja, hogy konkrét értékelési helyzetekben tárják fel a modellek működését, ahelyett hogy a rendszerek belső gondolkodásának tökéletes megértésére törekednének. Zachary Kenton a skálázható felügyelet jelentőségét vizsgálta, amelynek az emberi ellenőrzést kellene lépést tartania a fejlettebb AI-rendszerekkel.

Vincent Conitzer a játékelméletből ismert „tökéletlen emlékezet” keretének alkalmazását javasolta annak érdekében, hogy a biztonsági tesztek ne legyenek megkülönböztethetők a valódi használattól. Így a modellek ne tudjanak kizárólag azért másként viselkedni, mert felismerik, hogy értékelés alatt állnak.

A lightning talkok között Victoria Krakovna egy csapdahelyzetekre épülő módszert mutatott be a modellek megtévesztő viselkedésének felismerésére. Stefan Heimersheim arra figyelmeztetett, hogy az értelmezhetőségen alapuló megtévesztésérzékelők elleni betanítás visszaüthet. Belinda Li olyan keretrendszerről számolt be, amelyben a modellek természetes nyelven írják le saját belső számításaikat. A FAR.AI összefoglalója szerint a korai eredmények ezeknél az önmagyarázatoknál következetességet, a viselkedéssel való ok-okozati kapcsolatot és a külső modellek magyarázatainál nagyobb pontosságot jeleztek.

Szabályozási és társadalmi kérdések is előkerültek

A workshopon az európai AI Act gyakorlati végrehajtásáról is szó esett. Matthieu Delescluse és Simon Möller, az EU AI Office munkatársai a törvény által létrehozott gyakorlati kódex kikényszeríthető követelményeit, valamint a kódex bevezetésének állását ismertették. Stephen Casper, az MIT kutatója arról beszélt, hogyan vehetnek részt a gépi tanulással foglalkozó kutatók közvetlenül a szakpolitika alakításában az általános jogszabályi fogalmak gyakorlati meghatározásával.

Más előadók a biológiai kockázatok, a nemzetközi irányítás, a többügynökös rendszerek és a társadalmi egyenlőtlenségek kérdéseit vizsgálták. James Black szerint a tudományos AI-rendszerek új biológiai kockázatok létrehozásában is szerepet játszhatnak, és a jelenlegi védelmi intézkedések nem elégségesek. Robert Trager a fejlett AI nemzetközi irányítására négyrétegű keretet és alkalmazható tiltóvonalakat vázolt fel.

A rendezvény üzenete a felhasználók és a szabályozók számára az, hogy az AI-biztonság kérdéseihez egyre több mérhető értékelésre, külső ellenőrzésre és működő intézményre van szükség. A FAR.AI összefoglalója alapján a kutatók több olyan eszközt is azonosítottak, amelyek a fejlesztés és a bevezetés előtti ellenőrzést szolgálhatják, miközben számos módszer korlátaira és visszaélési lehetőségére is felhívták a figyelmet.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…

Biztonság és etika
Biztonság és etika2026. augusztus 5.

A megbízhatóság lett az AI-biztonság legnagyobb hiányterülete

A mesterséges intelligencia képességei gyorsan fejlődnek, a megbízhatóságuk mérésére és igazolására szolgáló módszerek viszont elmaradnak ettől. Ez volt a FAR.AI július…