Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A hazugság felismerését kutatták AI-biztonsági szakértők San Franciscóban

2026. július 16.Forrás: FAR.AI

Mintegy 25 AI-kutató keresett módszereket a mesterséges intelligencia megtévesztő viselkedésének felismerésére és megelőzésére a FAR.AI workshopján. A résztvevők a monitorozás korlátait, a tesztelési módszereket és a kutatások értékelésének alapelveit is megvitatták.

A lényeg röviden
  • A FAR.AI workshopján nagyjából 25 AI-kutató vett részt.
  • A résztvevők az AI-rendszerek megtévesztésének felismerését és megelőzését vizsgálták.
  • A kutatók szerint a fekete dobozos monitorozásnak fontos szerkezeti korlátai vannak.
  • A titkos feladatokkal végzett vörös és kék csapatos teszt kapta a legmagasabb értékelést.
  • Öt alapelv között szerepel az igazság alapjának, a feltételezéseknek és a tesztelt bemeneteknek a rögzítése.

A megtévesztés az AI-biztonság egyik nyitott kérdése

A FAR.AI február 13-án San Franciscóban rendezte meg a workshopot, amelyre a szervezet összefoglalója szerint nagyjából 25 kutató érkezett. A résztvevők úttörő AI-laboratóriumokat, kormányzati biztonsági intézeteket, egyetemeket és független kutatószervezeteket képviseltek.

A találkozó célja az volt, hogy megosszák a legfrissebb kutatási eredményeket, valamint feltárják, mely kérdésekben ért egyet a terület, és hol vannak nézetkülönbségek. A központi probléma az volt, hogyan lehet észlelni, ha egy AI-rendszer félrevezeti fejlesztőit vagy felhasználóit.

A FAR.AI szerint a jelenlegi modellek összetett megtévesztő viselkedésre képesek, és nyomás alatt könnyen mutathatnak ilyen viselkedést. Ha egy modell a biztonsági értékelés során megtéveszti a vizsgálóit, az értékelés elveszíti megbízhatóságát. Ilyenkor egy látszólag összehangolt, vagyis biztonságosan működő modellről sem lehet biztosan tudni, hogy valóban az-e.

Miért fontosak a modellek belső folyamatai?

A rendezvény nyitó előadását Chris Cundy, a FAR.AI kutatója tartotta. A jelenlegi megközelítések korlátai mellett a fehér dobozos monitorozás mellett érvelt. Ez a módszer a modell belső számításait is vizsgálná, nem csak a létrehozott válaszokat.

A FAR.AI összefoglalója szerint a fekete dobozos monitorozás, amikor egy másik modellel ellenőrzik a kimenetet, szerkezeti korlátokkal jár. Olyan megbízható ellenőrző modellre van szükség hozzá, amely legalább olyan képességű, mint a vizsgált rendszer. A módszer nem fér hozzá ahhoz a tudáshoz, amelyet a modell belsőleg birtokol, de nem fejez ki, és akkor is gyengülhet, ha a modelleket kifejezetten az ellenőrzés kijátszására optimalizálják.

Neel Nanda a modellek összehangolatlanságának tudományáról és a hazugság felismeréséről beszélt. Joseph Bloom a monitorozhatóság jelenlegi állapotát és jövőjét mutatta be. Micah Carroll a gondolatmenetek ellenőrizhetőségét vizsgálta, Walter Laurito és Kieron Kretschmar pedig a megtévesztés felismerésére szolgáló Liars Bench tesztpadról tartott előadást.

Titkos feladatokkal és társas játékokkal tesztelnék a módszereket

A résztvevők több munkacsoportban folytatták a vitát. Az egyik csoport a belső és a külső telepítések különbségeire összpontosított. Külső telepítésnél a modelleket fejlesztők és felhasználók használják, ezért nyitott kérdés marad, hogy ki felel a megtévesztés felismeréséért. A csoport szerint az sem ismert, hol használnak nagy nyelvi modelleket magas kockázatú területeken, például védelmi vagy infrastrukturális alkalmazásokban.

Egy másik csoport ellenséges vörös és kék csapatos tesztelést javasolt. Ennek során modelleket kifejezetten arra tanítanának, hogy kijátsszák a monitorokat, majd az eredményeket nem egyszerű megfelelt vagy nem felelt meg formában, hanem a robusztusság fokával jelölnék. Felmerült az is, hogy korlátozni kellene a modell gondolkodását a továbbítási folyamatban, hogy a megtévesztés szempontjából fontos következtetések ne a monitorozható gondolatmeneten kívül szülessenek meg.

A lie detector, vagyis hazugságfelismerő módszerek értékelésére a résztvevők mintegy 30 ötletet rangsoroltak. A legmagasabbra értékelt javaslat a vörös és kék csapatos titkosfeladat-protokoll volt. Emellett kérdés-felelet alapú kikérdezést, egyszerű megtévesztési játékokat, például Liar's Pokert vagy Among Ust, valamint bíróval kiegészített vitákat is hasznos tesztkörnyezetnek tartottak.

Öt alapelvet minden komoly kutatásnak kezelnie kell

A workshop résztvevői közösen dolgozták át a megtévesztés felismerését és mérséklését vizsgáló kutatások értékelési alapelveit. A FAR.AI eredetileg 13 alapelvet készített elő, a vita során pedig további kettővel bővült a lista.

Öt elv különösen erős támogatást kapott. A kutatóknak meg kell határozniuk, mi számít tényleges megtévesztésnek, és hogyan állapítják meg az igazság alapját. Dokumentálniuk kell a módszer kulcsfontosságú feltételezéseit, beleértve azt is, mikor nem működne az eljárás. Vizsgálniuk kell, hogy a módszer átvihető-e az eredeti tanítási eloszlástól eltérő környezetekre.

Szintén pontosan meg kell nevezniük, milyen jelenséget próbálnak felismerni, például a megtévesztő szándékot, a modell által hamisnak ismert állításokat vagy a kérés és a válasz közötti ellentmondást. Végül részletezniük kell, milyen bemeneteken tesztelték a módszert, mivel a felkért és a spontán megtévesztés eltérő kihívást jelenthet.

Az alapelvek a felhasználók és a fejlesztők számára azt jelentik, hogy egy megtévesztésfelismerő rendszer eredményeit nem elég önmagukban bemutatni. A módszer megbízhatóságát a tesztelt környezet, a feltételezések és az átvihetőség alapján kell értékelni, különösen akkor, ha a modellt új vagy nagy kockázatú helyzetben alkalmazzák.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az AI a biológiai kutatások baleseti kockázatát is növelheti
Cégek és üzlet2026. október 2. 22:37

Az AI a biológiai kutatások baleseti kockázatát is növelheti

A mesterséges intelligencia biológiai kutatásokba építése nemcsak a biológiai fegyverek szándékos fejlesztésének kockázatát vetheti fel, hanem a laboratóriumi…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…