Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az LLM-ek egyetértése félrevezető lehet, ha ugyanazt a hibát követik el

2026. augusztus 26. 19:10Forrás: Amazon Science
Az LLM-ek egyetértése félrevezető lehet, ha ugyanazt a hibát követik el
Kép: Amazon Science

Az Amazon kutatói szerint tíz LLM-bíró egybehangzó döntése sem feltétlenül jelent tíz független bizonyítékot. Ising-modellekre épülő módszerük a bírók közötti hasonlóságokat is figyelembe veszi, és a tesztekben 9, illetve 14 százalékpont közötti pontosságjavulást ért el.

A lényeg röviden
  • Az LLM-bírók egyetértése közös hibából is fakadhat.
  • Az Amazon módszere a bírók megbízhatóságát és egymáshoz való hasonlóságát is modellezi.
  • A tesztekben három bináris feladaton javult a pontosság.
  • A tíz korreláló szavazat nem feltétlenül ér annyit, mint tíz független döntés.

A többségi szavazás elrejtheti a közös hibákat

Az LLM-as-a-judge rendszerekben több modell értékelheti ugyanazt a választ vagy dokumentumot. Például egy visszakeresésre épülő generatív rendszer esetében a bírók arról dönthetnek, hogy a lekért szövegrész releváns-e. Ha tíz bíróból nyolc relevánsnak, kettő pedig irrelevánsnak ítéli, a többségi döntés első látásra meggyőzőnek tűnik.

Az Amazon Science cikke szerint azonban az egyetértő bírók nem feltétlenül szolgáltatnak nyolc különálló bizonyítékot. Ha azonos promptot, hasonló modellcsaládot vagy közös tanítási hátteret használnak, ugyanazt a hibát is elkövethetik. A modellek egy közös vakfoltot örökölhetnek, ezért a szavazatok száma erősebbnek mutathatja a bizonyítékot a valóságosnál.

A hagyományos többségi szavazás minden bírónak azonos súlyt ad. A súlyozott változat nagyobb befolyást biztosít a korábban pontosabbnak bizonyult bíróknak, de mindkét módszer abból indul ki, hogy a hibák nagyjából függetlenül keletkeznek. Az Amazon kutatói szerint ez az LLM-alapú értékeléseknél gyakran túl optimista feltételezés.

A bírókat hálózatként modellezték

Krishna Balasubramanian és Sasha Podkopaev, Shiva Kasiviswanathan társszerzőségével, a „Dependence-aware label aggregation for LLM-as-a-judge via Ising models” című tanulmányban olyan aggregálási módszert mutat be, amely az egyes bírók megbízhatósága mellett a bírók páronkénti függőségét is tanulja. A tanulmányt az idei International Conference on Machine Learning konferencián mutatták be.

A módszer a bírói panelt hálózatként kezeli. Egyes bírók az egyéni megbízhatóságuk alapján kapnak súlyt, miközben a rendszer azt is vizsgálja, hogy bizonyos párok a vártnál gyakrabban értenek-e egyet, akár közös hibák esetén is. A kapcsolatokat Ising-modellel írják le, amely bináris változók közötti páronkénti függőségek modellezésére alkalmas.

A megközelítés felügyelet nélküli beállításban működik, vagyis a tanuláshoz nem használ emberi referencia-címkéket. A rendszer az értékelt elemek valódi címkéit rejtett változóként becsüli, majd felváltva frissíti ezeket a becsléseket, valamint a bírók megbízhatóságára és függőségére vonatkozó paramétereket.

A kutatók kétféle függőségmodellezést ismertetnek. Az egyszerűbb változat a címkétől nagyjából független kapcsolatokat feltételez, így a döntés továbbra is súlyozott szavazásként értelmezhető, csak a redundáns egyetértést csökkentett súllyal kezeli. A részletesebb, osztályfüggő modell megengedi, hogy a bírók kapcsolatai a címkétől függően változzanak. Ez több adatot igényel a megbízható becsléshez.

Három feladaton javult a pontosság

A módszert három bináris feladaton tesztelték: a visszakeresett információ relevanciájának osztályozásán, a káros tartalom felismerésén és az összefoglalók értékelésén. A panel tíz bírói modellből állt, amelyeket nulla hőmérsékleten futtattak, így ugyanarra a bemenetre mindig ugyanazt a kimenetet adták.

A teljes, tízmodellből álló panellel és az egyes feladatokhoz rendelkezésre álló legnagyobb tanítási adathalmazzal a legerősebb függőségérzékeny modell 0,912-es pontosságot ért el a relevanciaosztályozásban. A súlyozott többségi szavazás 0,820-at, az egyenletes többségi szavazás 0,804-et ért el.

A káros tartalom felismerésénél az eredmények 0,792, 0,694 és 0,695 voltak ebben a sorrendben. Az összefoglalók értékelésénél a függőségérzékeny módszer 0,806-os pontosságot ért el, szemben a súlyozott többségi szavazás 0,737-es, valamint az egyenletes változat 0,561-es eredményével.

A felhasználóknak a bírói panelt is vizsgálniuk kell

Az Amazon kutatói szerint az LLM-alapú értékelési rendszereket működtető csapatoknak nem elég az egyes bírók pontosságát mérniük. A panel egészét is vizsgálni kell, mert több erős modell is redundáns lehet, ha ugyanúgy hibázik.

A modellcsaládok vagy architektúrák keverése csak akkor növeli a változatosságot, ha a bírók hibamintái ténylegesen eltérnek. Az egyetértési klaszterek vizsgálata feltárhatja a közös értékelési szabályokat, a hasonló modellviselkedést vagy az adott feladathoz kapcsolódó kétértelműséget.

A kutatók ezért azt javasolják, hogy a bizonytalanságot a bírók közötti függőséget figyelembe véve jelentsék. Tíz egymással korreláló szavazat nem feltétlenül jelent akkora bizonyosságot, mint tíz független döntés. Az értékelési naplókban található egyetértési és eltérési minták azt is megmutathatják, hogy egy új bíró valóban új bizonyítékot ad-e, vagy csak egy meglévő torzítást erősít.

Amazon ScienceIsing modelsInternational Conference on Machine LearningShiva Kasiviswanathankutatási eredménybenchmarkAI-biztonság
Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Digitális ikerrel keresné a hálózati hibák gyökerét az Amazon
Kutatás2026. október 1. 14:54

Digitális ikerrel keresné a hálózati hibák gyökerét az Amazon

Az Amazon Science gráfokra épülő digitális ikert és ügynöki mesterséges intelligenciát kombináló módszert mutatott be a hálózati hibák gyökerének azonosítására. A…

Kutatás: az AI-s gyűlöletbeszéd-felismerés maga is keretek közé szorít
Kutatás2026. szeptember 30. 12:34

Kutatás: az AI-s gyűlöletbeszéd-felismerés maga is keretek közé szorít

A gyűlöletbeszéd mesterséges intelligenciával végzett felismerését alapvetően meghatározza, hogyan írják le magát a nyelvet. A Minderoo Centre for Technology & Democracy…

A gyűlöletbeszéd technikai definíciója meghatározza, mit lát az AI
Kutatás2026. szeptember 30. 12:34

A gyűlöletbeszéd technikai definíciója meghatározza, mit lát az AI

A gyűlöletbeszéd automatikus felismerését kutató tudományterületek eltérően értelmezik a nyelvet és a károkat. Stefanie Ullmann tanulmánya szerint ezek a kiindulópontok…