Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az AI-kutatók szemantikai irányokkal keresik a káros tanítóadatokat

2026. július 16.Forrás: FAR.AI

A FAR.AI kutatói olyan módszert mutattak be, amely egyes tesztpéldák helyett szemantikai fogalmakhoz köti a modellek viselkedését. A Concept Influence a kutatók szerint pontosabban azonosíthatja a káros viselkedéshez hozzájáruló tanítóadatokat, miközben egyszerűsített változatai több mint hússzor gyorsabbak lehetnek a hagyományos módszereknél.

A lényeg röviden
  • A Concept Influence szemantikai irányokhoz rendeli a modell viselkedését.
  • A módszer a FAR.AI tesztjeiben jobban különítette el a káros és a megfelelő tanítóadatokat.
  • Az egyszerűsített változatok több mint hússzor gyorsabbak lehetnek.
  • A Vector Filter az OASST1 adatok 5 százalékával is elérte a teljes készlet képességszintjét.
  • A gradiensalapú és próbákra épülő módszerek eltérő körülmények között előnyösek.

A szavak helyett a jelentést keresik

A tanítóadat-attribúció célja annak feltárása, hogy egy modell viselkedéséhez mely képzési példák járultak hozzá. A FAR.AI szerint a hagyományos módszerek, köztük a standard befolyásfüggvények, gyakran felszíni hasonlóságokra támaszkodnak. Egyetlen tesztpélda alapján elsősorban olyan adatokat emelhetnek ki, amelyek ugyanazokat a szavakat tartalmazzák, miközben nem feltétlenül ezek okozzák a vizsgált viselkedést.

Ez különösen problémás lehet olyan elvont kockázatoknál, mint a hízelgő egyetértés, az úgynevezett sycophancy, vagy a finomhangolás után megjelenő káros személyiségjegyek. A Concept Influence ehelyett szemantikai irányokhoz rendeli a modell működését. Ehhez többek között lineáris próbákat, ritka autoenkóderes, SAE-funkciókat, illetve crosscoder-funkciókat használhatnak.

A Concept Influence eredményei

A módszer a standard befolyásfüggvény által használt, egyetlen kimenethez tartozó gradiens helyére egy szemantikai fogalomvektor gradiensét állítja. A kutatók szerint az Anthropic Persona Vectors munkájából származó Projection Difference, valamint a maximálisan aktiválódó adatokat kereső Vector Filter ennek a megközelítésnek az elsőrendű közelítései.

A FAR.AI négy olyan adatkészleten tesztelte az eljárást, amelyeknél a szűk körű finomhangolás széles körű, nem kívánt tulajdonságokat válthat ki: félrevezető véleményeken, rossz orvosi tanácsokon, nem biztonságos kódon és matematikai hibákon. A Qwen2.5-7B modellen a Concept Influence minden vizsgált területen jobb elkülönítést adott az összehangolt és az összehangolatlan példák között, mint a hagyományos befolyásfüggvények.

A kutatók egy figyelemre méltó eredményről is beszámoltak. Több módszer által kiválasztott, leginkább befolyásosnak ítélt adatok felső 10, illetve 20 százalékán végzett tanítás egyes esetekben a teljes adatkészletnél sokkal „gonoszabb” modelleket eredményezett. A nem biztonságos kódot tartalmazó adatoknál a teljes készlettel tanított modellek körülbelül 1 százalékos, a kiválasztott részhalmazzal készültek pedig körülbelül 10 százalékos értéket értek el ezen a mérésen.

Kevesebb adat, alacsonyabb kockázat

A módszert egy valós, nem szintetikus utótréning-adatkészleten, az OpenAssistant Conversations, vagyis az OASST1 adatokon is kipróbálták. A cél az utasításkövetés javítása és a káros „gonosz” viselkedés csökkentése volt minél kevesebb tanítóadattal.

Az OASST1-en végzett felügyelt finomhangolás az MTBench alapján 38 százalékról 67 százalékra javította az utasításkövetést, miközben egy nyelvi modell által értékelt káros kimenetek aránya körülbelül 2 százalékkal nőtt. A Concept Influence és egyszerűsített változatai javították ezt a képesség és biztonság közötti kompromisszumot. A Vector Filter a kutatók szerint az adatok mindössze 5 százalékának felhasználásával elérte a teljes adatkészleten tanított modell képességszintjét, miközben jóval alacsonyabb maradt a „gonoszság” értéke.

A módszerek között ugyanakkor különbség van. A teljes gradienssel működő, gradiensalapú eljárások jelentős eloszláseltolódás esetén teljesítenek jobban, amikor a finomhangolás és az értékelés területe erősen eltér. A próbákra épülő Vector Filter és Projection Difference akkor hatékony, ha a két terület közel áll egymáshoz. Ezek több mint hússzor gyorsabbak, és kizárólag az alapmodellen működve finomhangolás előtt is segíthetnek megbecsülni az adatok várható hatását.

FAR.AIConcept InfluenceAnthropicPersona VectorsAI-biztonságkutatási eredmény

Kapcsolódó hírek

Az AI a biológiai kutatások baleseti kockázatát is növelheti
Cégek és üzlet2026. október 2. 22:37

Az AI a biológiai kutatások baleseti kockázatát is növelheti

A mesterséges intelligencia biológiai kutatásokba építése nemcsak a biológiai fegyverek szándékos fejlesztésének kockázatát vetheti fel, hanem a laboratóriumi…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…