Az Apple térképekkel segítené az LLM-ek viselkedési szabályainak tervezését

Az Apple kutatói Policy Maps néven olyan módszert mutattak be, amely térképszerű ábrázolással segíti a nagy nyelvi modellek viselkedésére vonatkozó szabályok kialakítását. A hozzá kapcsolódó Policy Projector eszköz különböző bemenetek és kimenetek között segít eligazodni, majd feltételes szabályokat alkalmazhat a modell válaszaira.
- A Policy Maps az LLM-ek viselkedési terének feltérképezését támogatja.
- A Policy Projector egyedi régiókat és if-then szabályokat kezel.
- A szabályok a modell kimeneteire is alkalmazhatók, például azok átírásával.
- A rendszert 12 AI-biztonsági szakértő bevonásával értékelték.
- A vizsgálat problémás nemi feltételezésekkel és fizikai biztonsági fenyegetésekkel is foglalkozott.
A teljes viselkedési térkép helyett célzott navigáció
Az AI-szabályzatok meghatározzák, milyen viselkedés fogadható el egy modellnél. A nagy nyelvi modellek esetében azonban nehéz lefedni a lehetséges viselkedések rendkívül széles terét. Az Apple kutatói szerint a hagyományos megközelítés helyett hasznosabb lehet a fizikai térképkészítés logikájából kiindulni.
A Policy Maps módszere nem a teljes viselkedési tér lefedésére törekszik. A cél az, hogy a szabályzat tervezője tudatos döntésekkel meghatározza, mely szempontokat jelenítse meg, és mely részleteket vonja össze vagy hagyja el. Így a szabályok kialakítása a modell bemenetei és kimenetei közötti tér célzott feltérképezésére épül.
A Policy Projector feltételes szabályokat kezel
A kutatók a Policy Projector nevű interaktív eszközt is bemutatták. Ezzel egy AI-szakember felmérheti a modell bemenet-kimenet párosainak terét, majd saját régiókat határozhat meg benne. Ilyen régió lehet például az erőszak témaköre.
Az eszköz ezután if-then, vagyis ha-akkor szabályokkal segít navigálni az egyes területeken. Egy szabály például akkor írhatja át a modell válaszát, ha az erőszakot és részletes leírásokat tartalmaz. Ebben az esetben a rendszer a részletes leírások elhagyásával alakíthatja át a kimenetet.
A Policy Projector az interaktív szabályzatkészítést LLM-alapú osztályozással és irányítással támogatja. A hozzá tartozó térképvizualizáció a szabályzat tervezőjének munkáját jeleníti meg, így a szabályok és a modellek viselkedési területei egy közös felületen követhetők.
Tizenkét AI-biztonsági szakértő vizsgálta a rendszert
Az Apple közlése szerint a rendszert 12 AI-biztonsági szakértő bevonásával értékelték. A vizsgálat alapján a Policy Maps és a Policy Projector segítette a résztvevőket olyan szabályzatok kidolgozásában, amelyek problémás modellviselkedésekkel foglalkoznak.
A példák között szerepelt a helytelen nemi feltételezések kezelése, valamint az azonnali fizikai biztonságot fenyegető helyzetekre adott válaszok szabályozása. Ez azt mutatja, hogy a kutatók az eszközt olyan esetekre is szánják, ahol a modell válaszának megítélése több szempont együttes figyelembevételét igényli.
A tanulmány a Data Science and Annotation, valamint a Human-Computer Interaction kutatási területhez kapcsolódik, és az UIST konferencián jelent meg 2025 novemberében. A szerzők között Michelle S. Lam, Jeffrey P. Bigham, Fred Hohman, Dominik Moritz, Kenneth Holstein és Mary Beth Kery szerepel. A forrás szerint Lam a munkát az Apple-nél töltött időszakában végezte, a szerzők között pedig Stanford Universityhez és Carnegie Mellon Universityhez kötődő kutatók is vannak.


