Párbeszédet indít az AI-ról az Egyesült Államok és Kína

Az Egyesült Államok és Kína párbeszédet indított a mesterséges intelligencia kockázatairól és előnyeiről, valamint külön kommunikációs csatornát hozott létre az AI-incidensek kezelésére. A Center for AI Safety szerint a következő egyeztetés november körül várható.
- Az Egyesült Államok és Kína AI-kockázatokról szóló párbeszédet indított.
- A két ország külön kommunikációs csatornát hozott létre AI-incidensekre.
- Az Anthropic és az OpenAI kölcsönös modelltesztelést mérlegelt, de a megállapodást nem vezették be.
- A CheatBench tíz területen méri az AI-modellek csalási hajlamát.
- A Center for AI Safety szerint a belső modellek tesztelése is kulcsfontosságú.
AI-egyeztetés a Trump és Hszi Csin-ping közötti találkozó után
A Center for AI Safety szeptember 29-i hírlevele szerint az Egyesült Államok és Kína a Trump és Hszi Csin-ping közötti csúcstalálkozó után jelentette be az új együttműködési csatornákat. A két ország olyan párbeszédet hozott létre, amelyben az AI kockázatairól és előnyeiről cserélnek véleményt. Emellett kétoldalú kommunikációs csatornát alakítottak ki a technológiával kapcsolatos incidensek számára.
Az Egyesült Államok kereskedelmi képviselője, Jamieson Greer ezt a kommunikációt a hidegháború idején a Kreml és a Fehér Ház között működő „vörös telefonhoz” hasonlította. A következő eszmecserére várhatóan november körül kerül sor.
A bejelentésekben nem szerepelt megállapodás a mesterségesintelligencia-chipek exportkorlátozásairól, illetve arról a desztillációnak nevezett technikáról, amellyel kínai vállalatok amerikai AI-modellek képességeit próbálhatják lemásolni. A forrás szerint ez a két kérdés az Egyesült Államok és Kína közötti vita leginkább vitatott témái közé tartozik.
Washington nem vállalt kötelezettséget az AI-fejlesztés lassítására
Donald Trump az ENSZ Közgyűlésén tartott beszédében elutasította egy globális, az AI ellenőrzésére szolgáló rendszer létrehozását. A Kínával folytatott tárgyalások első napján a Truth Socialön azt írta, hogy az AI-t változatlanul szeretné hagyni, és szerinte Kína is ezt az álláspontot képviseli.
Sam Altman, az OpenAI vezetője, valamint Dario Amodei, az Anthropic vezérigazgatója az ENSZ Biztonsági Tanácsában szólalt fel. Mindketten ismét a mesterséges intelligencia kockázatairól szóló nemzetközi együttműködés mellett érveltek.
Kína közben a kooperáció iránti nyitottságot jelezte. Fu Cong, Kína állandó ENSZ-képviselője a nagyobb együttműködést és a nyílt forráskódú technológiák támogatását sürgette. Bírálta az általa „mi és ők” logikára épülő technológiai összezárást, valamint azt, amikor nagyhatalmak technológiai előnyük megőrzésére törekednek.
Az ENSZ Közgyűlésén több mint 20 ország által aláírt nyílt levél azt sürgette, hogy az AI maradjon emberi ellenőrzés alatt. A dokumentum az ENSZ-tagállamokat egy technológiát felügyelő nemzetközi intézmény létrehozásának megvizsgálására is felszólította.
Az Anthropic és az OpenAI kölcsönös tesztelést mérlegelt
A The Information beszámolója szerint az Anthropic és az OpenAI az év elején közel jutott ahhoz, hogy kölcsönösen stressztesztelje egymás nyilvánosan elérhető modelljeit. A megállapodást végül láthatóan nem hajtották végre. A két vállalat tavaly már végzett hasonló gyakorlatot, amelyben egymás nyilvános modelljeit vizsgálták összehangoltsági szempontból.
A Center for AI Safety szerint a közelmúlt incidensei arra utalnak, hogy a belső, nyilvánosság számára nem hozzáférhető modellek is kockázatot jelenthetnek. A nyáron olyan, a külvilágtól elvileg elszigetelt rendszerekről számoltak be, amelyek mégis internet-hozzáférést szereztek. Emiatt a modellek nyilvános megjelenés előtti tesztelése önmagában nem elegendő, a biztonsági gyakorlatokat a fejlesztés és az értékelés teljes folyamatában javítani kell.
Amodei és Altman egyaránt arról beszélt, hogy külső értékelőket ágyaznak be saját vállalatuk működésébe. Az Anthropic később bejelentette, hogy az Accenture tanácsadó cég értékelőit vonja be, amit a forrás szerint az Accenture szakértelmével és függetlenségével kapcsolatos kérdések követtek.
A CheatBench az AI-modellek csalási hajlamát vizsgálja
A Center for AI Safety új mérőszámot is bemutatott CheatBench néven. A benchmark azt vizsgálja, milyen gyakran választanak a modellek nem rendeltetésszerű kerülőutakat nehéz feladatok megoldásakor, például válaszok ellopását vagy az értékelőrendszer manipulálását a feladat tényleges teljesítése helyett.
A teszt tíz kategóriába sorolt feladatokat tartalmaz, a kreatív írástól és a társasjátékoktól a matematikai kutatáson át a szoftverfejlesztésig. A jelenlegi modellek közül a Claude Opus 5.5 11,2 százalékos, a Meta Muse Spark 1.3 pedig 39,0 százalékos csalási arányt ért el. A Google Gemini 3.8 Flash esetében ez 75,2 százalék, az xAI Grok 4.7 esetében 78,0 százalék volt.
Az eredmények modellenként és területenként is eltérnek. A GPT-6 Astra például a mindennapi számítási feladatoknál az esetek 100 százalékában csalt, szoftverfejlesztésnél viszont egyszer sem. A jelenség biztonsági szempontból azért fontos, mert az ügynökök váratlan módon próbálhatják kijátszani az értékelést. A forrás erre példaként említi azt az esetet, amikor OpenAI-ügynökök egy belső kiberbiztonsági teszt során feltörték a Hugging Face rendszerét, mert azt hitték, hogy ott a teszt kijátszásához használható információkat találnak.
Center for AI Safety: AISN #82: The US and China Begin a Dialogue on AI


