Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple ritka jellemzőkkel védené a nyelvi modelleket a jailbreaktől

2026. szeptember 18.Forrás: Apple
Az Apple ritka jellemzőkkel védené a nyelvi modelleket a jailbreaktől
Kép: Apple

Az Apple kutatói olyan, ritka autoenkóderekre épülő védelmi módszert mutattak be, amely a nyelvi modellek jailbreak-támadásait hivatott mérsékelni. A Context-Conditioned Delta Steering a káros kérések és a jailbreak-környezettel kiegészített változataik reprezentációit hasonlítja össze.

A lényeg röviden
  • Az Apple kutatói bemutatták a CC-Delta nevű jailbreak-védelmi módszert.
  • A módszer a káros kérések páros reprezentációiból választ ki ritka SAE-jellemzőket.
  • Négy utasításokra finomhangolt modellen és tizenkét támadáson tesztelték.
  • A CC-Delta mind a négy modellen felülmúlta a sűrű átlageltolásos irányítást.
  • A kutatók szerint kész, értelmezhetőségre tanított SAE-k is felhasználhatók erre a célra.

A káros kérések változásait keresik

A jailbreak-támadások továbbra is tartós biztonsági fenyegetést jelentenek a nagy nyelvi modellek számára. Ezek a támadások olyan utasítási környezeteket használnak, amelyek megpróbálják rávenni a modellt a biztonsági korlátozások megkerülésére.

Az Apple kutatói a Context-Conditioned Delta Steering, röviden CC-Delta nevű módszert javasolják. Az eljárás ritka autoenkóderekre, angolul sparse autoencoders, röviden SAE-kre épül. A kutatók ugyanannak a káros kérésnek két változatát vizsgálják, az egyiket jailbreak-környezet nélkül, a másikat azzal együtt. Ezután tokenenként hasonlítják össze a modell belső reprezentációit.

A cél azoknak a ritka jellemzőknek az azonosítása, amelyek a jailbreakhez kapcsolódnak. A CC-Delta statisztikai teszteléssel választja ki ezeket a jellemzőket, majd a modell használata közben, következtetési időben, átlageltolásos beavatkozást alkalmaz az SAE rejtett terében.

Négy modellen és tizenkét támadáson tesztelték

A tanulmány szerint a módszert négy, egymással összehangolt, utasításokra finomhangolt modellen és tizenkét jailbreak-támadáson vizsgálták. A CC-Delta a biztonság és a használhatóság közötti egyensúly tekintetében a sűrű rejtett térben működő kiindulási védelmekhez hasonló vagy azoknál jobb eredményt ért el.

Az Apple közleménye szerint a CC-Delta mind a négy modellen egyértelműen felülmúlta a sűrű térben végzett átlageltolásos irányítást. Az előny különösen a modellen kívüli, angolul out-of-distribution támadásokkal szemben volt látható. Ez arra utal a kutatók eredményei alapján, hogy a ritka SAE-jellemzők terében végzett irányítás előnyösebb lehet a sűrű aktivációs térben végzett beavatkozásnál a jailbreak-ek mérséklésére.

A meglévő értelmezhetőségi eszközöket is felhasználhatják

A kutatók szerint a kísérletek azt mutatják, hogy az értelmezhetőséghez betanított, kész SAE-k gyakorlati jailbreak-védelmekként is újrahasznosíthatók. A módszerhez a tanulmány leírása alapján nem szükséges feladatspecifikus tanítás.

A tanulmány szerzői Yannick Assogba, Jacopo Cortellazzi, Javier Abad, Pau Rodriguez, Xavier Suau és Arno Blaas. A munka az ETH Zürichhez és az Apple-höz kapcsolódik, Javier Abad pedig a tanulmány szerint az Apple-nél végzett munkája idején vett részt a kutatásban.

A tanulmány 2026 júliusában jelent meg az ICML Speech and Natural Language Processing Workshopján. Az eredmény a nyelvi modellek üzemeltetői számára olyan védelmi irányt vázol fel, amely a modell belső, ritka jellemzőire támaszkodva próbálja megőrizni a hasznos működést a jailbreak-kísérletek visszaszorítása mellett.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói képzés nélküli, ABX-alapú feladatokat mutattak be a többnyelvű nyelvi modellek vizsgálatára. Az XLM-R elemzése szerint a nyelvazonosításhoz kapcsolódó…

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…