Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az LLM-ek irányítása gyakran a szöveg folyékonyságának rovására megy

2026. szeptember 30.Forrás: Apple
Az LLM-ek irányítása gyakran a szöveg folyékonyságának rovására megy
Kép: Apple

Az Apple kutatói szisztematikusan vizsgálták, hogyan hatnak a nagy nyelvi modellek irányítási módszerei a célfogalmak beültetésére, eltávolítására és a szövegek minőségére. Eredményeik szerint a hatékony vezérlés gyakran jelentős árat kér a folyékonyságért, miközben az aktivációs irányítás az utasításkövető modelleken jóval gyengébben működik.

A lényeg röviden
  • A hatékony LLM-irányítás gyakran rontja a szöveg folyékonyságát.
  • Az aktivációs irányítás kevésbé hatékony az utasításkövető modelleken.
  • Promptolással és felügyelt finomhangolással beültethetők célfogalmak.
  • A vizsgált módszerek kevésbé alkalmasak fogalmak eltávolítására.
  • Az olcsó szöveges mérőszámok erősen korrelálnak az LLM-es értékelésekkel.

A célfogalmak irányítása minőségi kompromisszumokkal jár

Az Apple Machine Learning oldalán 2026 szeptemberében közzétett, EMNLP-konferenciához kapcsolódó tanulmány a nagy nyelvi modellek, vagyis az LLM-ek kimenetének szabályozását vizsgálja. A kutatók szerint a modellek megbízható alkalmazásához központi kérdés, hogy miként lehet egy kívánt fogalmat beültetni a válaszokba, illetve egy nem kívánt fogalmat eltávolítani.

A szerzők, Iuri Macocco, Pau Rodríguez Lopez, Arno Blaas, Luca Zappella, Marco Baroni és Xavier Suau Cuadros több irányítási módszert hasonlítottak össze mindkét helyzetben. Azt vizsgálták, hogy ezek az eljárások mennyire eredményesek a célfogalom módosításában, és közben milyen hatással vannak a generált szöveg folyékonyságára.

Az Apple kutatása szerint az irányításra hatékony módszerek gyakran jelentősen rontják a szöveg folyékonyságát. A kutatók úgy látják, hogy a módszerek értékelésekor ezért nem elég kizárólag azt mérni, sikerült-e beültetni vagy eltávolítani a célfogalmat.

Másképp teljesítenek az alap- és az utasításkövető modellek

A tanulmány egyik kiemelt megállapítása az aktivációs irányításhoz kapcsolódik. Ez a megközelítés a modell belső aktivációinak módosításával próbálja a kívánt viselkedés felé terelni a rendszert. A kutatók szerint az ilyen módszerek az utasításkövető modelleken jóval kevésbé hatékonyak, mint az alapmodelleken.

Az eredmény a kutatás szerint egy korábban figyelmen kívül hagyott kapcsolatot mutat az irányítás és a modell tanítási paradigmája között. Ugyanaz a beavatkozási stratégia ezért eltérő eredményt adhat attól függően, hogy alapmodellről vagy utasításkövető modellről van szó.

A kutatók a fogalmak beültetésére két másik lehetőséget is életképesnek találtak: az egyszerű promptolást és a teljes körű, felügyelt finomhangolást. Ezek azonban a tanulmány eredményei szerint kevésbé alkalmasak a fogalmak eltávolítására.

Olcsóbb mérőszámokkal is jelezhető a modellek viselkedése

A kutatás a kiértékelés költségére is kitér. A kutatók szerint az olcsón kiszámítható szöveges mérőszámok erősen korrelálnak a költségesebb, nagy nyelvi modellel végzett bírói értékelések eredményeivel.

Ez azt jelenti, hogy a szöveges mutatók a vizsgált módszerek viselkedéséről is hasznos információt adhatnak, miközben kisebb számítási ráfordítással használhatók. A tanulmány így az irányítási technikák kiválasztását és összehasonlítását is segítheti.

Az eredmények a felhasználók és a fejlesztők számára azt mutatják, hogy egy modell célzott vezérlésekor egyszerre kell figyelni a kívánt fogalom módosítására és a válaszok minőségére. A választás attól is függhet, hogy beültetésről vagy eltávolításról van szó, illetve milyen tanítási eljárással készült a modell.

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói képzés nélküli, ABX-alapú feladatokat mutattak be a többnyelvű nyelvi modellek vizsgálatára. Az XLM-R elemzése szerint a nyelvazonosításhoz kapcsolódó…

Az LLM-ek irányítása gyakran a gördülékenység rovására megy
Kutatás2026. szeptember 30.

Az LLM-ek irányítása gyakran a gördülékenység rovására megy

Az Apple kutatása szerint a nagy nyelvi modellek célzott irányítására használt hatékony módszerek gyakran jelentősen rontják a generált szöveg gördülékenységét. A…