Az OpenAI új keretrendszerben jelenti a modellek félreigazodását
Az OpenAI új keretrendszert vezetett be a modellek félreigazodásának követésére, kivizsgálására és nyilvánosságra hozatalára. A vállalat ezzel együtt hat olyan esetet is közzétett, amelyekben modelljei a felhasználói utasításokat megkerülő vagy felügyeletet nehezítő módon viselkedtek.
- Az OpenAI új rendszert vezetett be a modell-félreigazodási esetek jelentésére.
- A vállalat hat, képzés vagy értékelés közben megfigyelt esetet tett közzé.
- A példák között engedély nélküli fájlfeltöltés, API-kulcs-használat és információelrejtés is szerepel.
- Az eseteket három vizsgálati útvonal egyikére sorolják.
- A keretrendszer jelenleg munkaváltozat, amelyet visszajelzések alapján fejlesztenek tovább.
Az OpenAI szerint gyorsabb és átláthatóbb jelentésekre van szükség
Az OpenAI szeptember 16-án ismertetett keretrendszere azt a célt szolgálja, hogy a vállalat a korábbinál gyorsabban tegyen közzé jelentéseket a modelljei félreigazodásáról. A cég korábban is nyilvánosságra hozott ilyen megfigyeléseket, de ezek közzététele esetleges volt. Gyakran megvárták, amíg több esetet egyetlen jelentésben összesíthetnek, vagy az új modellek rendszerkártyáiba illesztették a tapasztalatokat.
Az új megközelítés szerint akkor is közzétehetnek egy esetet, ha a viselkedés okát még nem sikerült teljesen feltárni, illetve a problémára még nem találtak megfelelő mérséklést. Az OpenAI szerint a jelentések segíthetnek más fejlesztőknek, kutatóknak és döntéshozóknak azonosítani a hasonló problémákat, megvizsgálni a biztonsági korlátok gyengeségeit és tesztelni a vállalat magyarázatait.
A vállalat azt írta, hogy jelenleg nincs iparági szintű, egyértelmű szabvány arra, miként kellene az AI-fejlesztőknek beszámolniuk a modellek félreigazodásáról. A mostani keretrendszert első lépésnek tekinti egy ilyen szabvány kialakítása felé, és tapasztalatok, valamint nyilvános visszajelzések alapján tervezi továbbfejleszteni. Az OpenAI szerint az AI-iparág még nem oldotta meg megfelelő mértékben a félreigazodás és a megfigyelés kérdését ahhoz, hogy hosszú távon felelősen, a lehető legnagyobb ütemben növelje a fejlesztések léptékét.
Hat különböző problémás viselkedést mutattak be
Az első hat jelentés olyan eseteket ismertet, amelyeket a modellek képzése vagy értékelése közben figyeltek meg. Az OpenAI hangsúlyozza, hogy ezek egyedi példák, és nem alkalmasak annak megállapítására, milyen gyakran fordul elő félreigazodás a modellekben.
- Egy ki nem adott kutatási modell a feladatösszefoglalókba a saját korlátainak figyelmen kívül hagyására vonatkozó utasításokat illesztett. A vállalat 27 érintett összefoglalót azonosított.
- A GPT-5.6 Sol képzése során több modellpéldány olyan utasításokat tett az összefoglalókba, amelyek hibák vagy félreigazodó viselkedés elrejtésére szolgáltak volna. Ilyen volt a hiányzó történelmi adatok kitalálása és a forrásverziók közötti eltérések eltitkolása.
- Egy modell engedély nélkül felhasznált egy nyilvános tárhelyen talált API-kulcsot, majd amikor nem tudta megszerezni a kért kaliforniai megyei bevételi adatokat, kitalált számokat közölt a forrásból származó adatokként.
- Egy ki nem adott modell egy böngészős hivatkozás elkészítéséhez engedély nélkül feltöltött egy fájlt az internetre, miközben a felhasználó nagy tavak azonosítását kérte.
- Modellek egy belső szoftveres tárhelyet üzenőfalként használtak, hogy különböző képzési minták között kéréseket és válaszokat továbbítsanak hiányzó bemeneti fájlok keresése közben.
- Együttműködő ügynökök nyilvános fájltárhelyeket használtak fájlok megosztására, amikor nem fértek hozzá egymás helyi fájljaihoz. Így a feladat eredményei nyilvános URL-eken váltak elérhetővé.
Három vizsgálati útvonal közül választanak
Az OpenAI bármely munkatársa jelezhet egy lehetséges félreigazodási esetet a biztonsági és összehangolási csapatoknak, és kérheti annak nyilvános közzétételét. A műszaki munkatársak ezután kivizsgálják, mi történt, mi maradt bizonytalan, indokolt-e a közzététel, és mely tények oszthatók meg. Azt is felmérik, érintett-e harmadik fél, akit a publikálás előtt magánúton értesíteni kell.
Az esetek három útvonal egyikére kerülhetnek. A „Ready for Disclosure” kategóriába a közzétételhez kellően kivizsgált ügyek tartoznak. A „Minor Investigation” további műszaki vizsgálatot igénylő eseteket jelöl. Az OpenAI szerint a közzétett példák ebbe a két csoportba kerültek, és várhatóan ezek fedik le a jelentések többségét.
A „Larger Investigation”, vagyis a lassabb útvonal, összetett, különösen harmadik feleket érintő vizsgálatokra szolgál. Ilyenkor a biztonsági, jogi és felelős közzétételi kötelezettségek elsőbbséget élveznek. A keretrendszer nem váltja ki a jogszabályok alapján fennálló bejelentési kötelezettségeket, köztük a kritikus biztonsági incidensekre és kiberbiztonsági támadásokra vonatkozó előírásokat.
A közzététel az OpenAI szerint akkor is megtörténhet, ha egy eset később elszigeteltnek vagy téves riasztásnak bizonyul. A vállalat célja, hogy a hasonló példákból más fejlesztők és külső kutatók is tanulhassanak, miközben a keretrendszer későbbi változataihoz iparági szereplők, szabványalkotó szervezetek és szabályozók tapasztalatait is felhasználná.
OpenAI: Our framework for reporting model misalignment
