Az AI-kutatók szemantikai irányokkal keresik a káros tanítóadatokat
A FAR.AI kutatói olyan módszert mutattak be, amely egyes tesztpéldák helyett szemantikai fogalmakhoz köti a modellek viselkedését. A Concept Influence a kutatók szerint pontosabban azonosíthatja a káros viselkedéshez hozzájáruló tanítóadatokat, miközben egyszerűsített változatai több mint hússzor gyorsabbak lehetnek a hagyományos módszereknél.
- A Concept Influence szemantikai irányokhoz rendeli a modell viselkedését.
- A módszer a FAR.AI tesztjeiben jobban különítette el a káros és a megfelelő tanítóadatokat.
- Az egyszerűsített változatok több mint hússzor gyorsabbak lehetnek.
- A Vector Filter az OASST1 adatok 5 százalékával is elérte a teljes készlet képességszintjét.
- A gradiensalapú és próbákra épülő módszerek eltérő körülmények között előnyösek.
A szavak helyett a jelentést keresik
A tanítóadat-attribúció célja annak feltárása, hogy egy modell viselkedéséhez mely képzési példák járultak hozzá. A FAR.AI szerint a hagyományos módszerek, köztük a standard befolyásfüggvények, gyakran felszíni hasonlóságokra támaszkodnak. Egyetlen tesztpélda alapján elsősorban olyan adatokat emelhetnek ki, amelyek ugyanazokat a szavakat tartalmazzák, miközben nem feltétlenül ezek okozzák a vizsgált viselkedést.
Ez különösen problémás lehet olyan elvont kockázatoknál, mint a hízelgő egyetértés, az úgynevezett sycophancy, vagy a finomhangolás után megjelenő káros személyiségjegyek. A Concept Influence ehelyett szemantikai irányokhoz rendeli a modell működését. Ehhez többek között lineáris próbákat, ritka autoenkóderes, SAE-funkciókat, illetve crosscoder-funkciókat használhatnak.
A Concept Influence eredményei
A módszer a standard befolyásfüggvény által használt, egyetlen kimenethez tartozó gradiens helyére egy szemantikai fogalomvektor gradiensét állítja. A kutatók szerint az Anthropic Persona Vectors munkájából származó Projection Difference, valamint a maximálisan aktiválódó adatokat kereső Vector Filter ennek a megközelítésnek az elsőrendű közelítései.
A FAR.AI négy olyan adatkészleten tesztelte az eljárást, amelyeknél a szűk körű finomhangolás széles körű, nem kívánt tulajdonságokat válthat ki: félrevezető véleményeken, rossz orvosi tanácsokon, nem biztonságos kódon és matematikai hibákon. A Qwen2.5-7B modellen a Concept Influence minden vizsgált területen jobb elkülönítést adott az összehangolt és az összehangolatlan példák között, mint a hagyományos befolyásfüggvények.
A kutatók egy figyelemre méltó eredményről is beszámoltak. Több módszer által kiválasztott, leginkább befolyásosnak ítélt adatok felső 10, illetve 20 százalékán végzett tanítás egyes esetekben a teljes adatkészletnél sokkal „gonoszabb” modelleket eredményezett. A nem biztonságos kódot tartalmazó adatoknál a teljes készlettel tanított modellek körülbelül 1 százalékos, a kiválasztott részhalmazzal készültek pedig körülbelül 10 százalékos értéket értek el ezen a mérésen.
Kevesebb adat, alacsonyabb kockázat
A módszert egy valós, nem szintetikus utótréning-adatkészleten, az OpenAssistant Conversations, vagyis az OASST1 adatokon is kipróbálták. A cél az utasításkövetés javítása és a káros „gonosz” viselkedés csökkentése volt minél kevesebb tanítóadattal.
Az OASST1-en végzett felügyelt finomhangolás az MTBench alapján 38 százalékról 67 százalékra javította az utasításkövetést, miközben egy nyelvi modell által értékelt káros kimenetek aránya körülbelül 2 százalékkal nőtt. A Concept Influence és egyszerűsített változatai javították ezt a képesség és biztonság közötti kompromisszumot. A Vector Filter a kutatók szerint az adatok mindössze 5 százalékának felhasználásával elérte a teljes adatkészleten tanított modell képességszintjét, miközben jóval alacsonyabb maradt a „gonoszság” értéke.
A módszerek között ugyanakkor különbség van. A teljes gradienssel működő, gradiensalapú eljárások jelentős eloszláseltolódás esetén teljesítenek jobban, amikor a finomhangolás és az értékelés területe erősen eltér. A próbákra épülő Vector Filter és Projection Difference akkor hatékony, ha a két terület közel áll egymáshoz. Ezek több mint hússzor gyorsabbak, és kizárólag az alapmodellen működve finomhangolás előtt is segíthetnek megbecsülni az adatok várható hatását.
