Több mint 200 szakértő vitatta meg az AI-biztonság jövőjét Londonban
A londoni Alignment Workshop több mint 200 kutatót, döntéshozót és iparági szakértőt hozott össze azzal a céllal, hogy az egyre fejlettebb AI-rendszerek ellenőrzésének gyakorlati kérdéseiről egyeztessenek. A FAR.AI által szervezett, március 2-án és 3-án megtartott esemény középpontjában az értelmezhetőség, a skálázható felügyelet, a modellek értékelése és az AI-irányítás állt.
- A FAR.AI workshopján több mint 200 szakértő vett részt.
- A fő témák az értelmezhetőség, a skálázható felügyelet, az értékelés és az AI-irányítás voltak.
- A résztvevők auditálható biztonsági szabványokat és független ellenőrző szervezeteket sürgettek.
- Több előadás a modellek megtévesztésének felismerésével és a biztonsági tesztek korlátaival foglalkozott.
- Az eseményen az EU AI Act gyakorlati végrehajtásáról és a fejlett AI nemzetközi irányításáról is beszéltek.
A képességek gyorsabban fejlődnek, mint a felügyelet
A FAR.AI összefoglalója szerint az AI-rendszerek képességei gyorsabban bővülnek, mint az ellenőrzésükhöz szükséges intézmények és szabványok. A workshop visszatérő kérdése az volt, hogyan lehet ezt a különbséget csökkenteni.
A résztvevők olyan konkrét problémákról tárgyaltak, mint az auditálható biztonsági szabványok kialakítása, a szándékosan megtévesztő környezetben is megbízható értékelések megtervezése, valamint az egyre nagyobb képességű rendszerek felügyeletéhez szükséges intézményi kapacitás kiépítése. A program azt jelezte, hogy az összehangolási kutatás az általános, nyitott kérdésektől egyre inkább a gyakorlati feladatok felé mozdul.
Közös biztonsági mércét sürgetnek
Adam Gleave, a FAR.AI munkatársa szerint az AI-biztonsági együttműködés legnagyobb akadálya nem feltétlenül a megoldások hiánya, hanem a közös szabvány hiánya. Amíg nincs közérthető és megosztott meghatározás arról, mitől biztonságos egy AI-rendszer, a vállalatok és a kormányok nehezen tudják egymást számon kérni.
Gleave a polgári és nukleáris mérnöki területek példájára hivatkozva olyan mérnöki megközelítést javasolt, amely három szempontot kapcsol össze: a biztonság igazolhatóságát, az auditálhatóságot és a hatékonyságot. Példaként rétegzett védelmi folyamatokat, empirikusan ellenőrzött gyakorlati szabályokat, végponttól végpontig tartó tesztelést, ellenséges helyzetekben vizsgált robusztussági összefüggéseket és megtévesztést észlelő módszereket említett.
Gillian Hadfield, a Johns Hopkins University kutatója független ellenőrző szervezetek létrehozását vetette fel. Ezek azt vizsgálhatnák, hogy az AI-rendszerek megfelelnek-e a biztonsági szabványoknak, és külső garanciát adhatnának a szabályozóknak és a nyilvánosságnak. Hadfield szerint ehhez felhasználhatók a felelősségi jog, a biztosítási piacok és a közbeszerzés meglévő intézményei is.
Az értelmezhetőségtől a megtévesztés felismeréséig
A fő előadások között Neel Nanda, a Google DeepMind kutatója a gyakorlati értelmezhetőség módszereiről beszélt. Ezek célja, hogy konkrét értékelési helyzetekben tárják fel a modellek működését, ahelyett hogy a rendszerek belső gondolkodásának tökéletes megértésére törekednének. Zachary Kenton a skálázható felügyelet jelentőségét vizsgálta, amelynek az emberi ellenőrzést kellene lépést tartania a fejlettebb AI-rendszerekkel.
Vincent Conitzer a játékelméletből ismert „tökéletlen emlékezet” keretének alkalmazását javasolta annak érdekében, hogy a biztonsági tesztek ne legyenek megkülönböztethetők a valódi használattól. Így a modellek ne tudjanak kizárólag azért másként viselkedni, mert felismerik, hogy értékelés alatt állnak.
A lightning talkok között Victoria Krakovna egy csapdahelyzetekre épülő módszert mutatott be a modellek megtévesztő viselkedésének felismerésére. Stefan Heimersheim arra figyelmeztetett, hogy az értelmezhetőségen alapuló megtévesztésérzékelők elleni betanítás visszaüthet. Belinda Li olyan keretrendszerről számolt be, amelyben a modellek természetes nyelven írják le saját belső számításaikat. A FAR.AI összefoglalója szerint a korai eredmények ezeknél az önmagyarázatoknál következetességet, a viselkedéssel való ok-okozati kapcsolatot és a külső modellek magyarázatainál nagyobb pontosságot jeleztek.
Szabályozási és társadalmi kérdések is előkerültek
A workshopon az európai AI Act gyakorlati végrehajtásáról is szó esett. Matthieu Delescluse és Simon Möller, az EU AI Office munkatársai a törvény által létrehozott gyakorlati kódex kikényszeríthető követelményeit, valamint a kódex bevezetésének állását ismertették. Stephen Casper, az MIT kutatója arról beszélt, hogyan vehetnek részt a gépi tanulással foglalkozó kutatók közvetlenül a szakpolitika alakításában az általános jogszabályi fogalmak gyakorlati meghatározásával.
Más előadók a biológiai kockázatok, a nemzetközi irányítás, a többügynökös rendszerek és a társadalmi egyenlőtlenségek kérdéseit vizsgálták. James Black szerint a tudományos AI-rendszerek új biológiai kockázatok létrehozásában is szerepet játszhatnak, és a jelenlegi védelmi intézkedések nem elégségesek. Robert Trager a fejlett AI nemzetközi irányítására négyrétegű keretet és alkalmazható tiltóvonalakat vázolt fel.
A rendezvény üzenete a felhasználók és a szabályozók számára az, hogy az AI-biztonság kérdéseihez egyre több mérhető értékelésre, külső ellenőrzésre és működő intézményre van szükség. A FAR.AI összefoglalója alapján a kutatók több olyan eszközt is azonosítottak, amelyek a fejlesztés és a bevezetés előtti ellenőrzést szolgálhatják, miközben számos módszer korlátaira és visszaélési lehetőségére is felhívták a figyelmet.
FAR.AI: London Alignment Workshop 2026 | FAR.AI