Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Apple-kutatás: kilenc LLM-bíró csak két független szavazatot ér

2026. augusztus 19.Forrás: Apple
Apple-kutatás: kilenc LLM-bíró csak két független szavazatot ér
Kép: Apple

A több nagy nyelvi modellből álló értékelőpanelek megbízhatóságát kérdőjelezi meg egy Apple-kutatás: a vizsgált kilenc LLM-bíró információtartalma nagyjából két független szavazatnak felelt meg. A tanulmány szerint a gondot az okozza, hogy a modellek gyakran ugyanazokon a feladatokon követik el ugyanazokat a hibákat.

A lényeg röviden
  • Az Apple-kutatás egy 9 frontier LLM-ből álló értékelőpanelt vizsgált.
  • A 9 bíró információtartalma nagyjából 2 független szavazatnak felelt meg.
  • A névleges függetlenség körülbelül háromnegyede elveszett a közös hibák miatt.
  • A panel pontossága 8 és 22 százalékponttal maradt el az ideális független szavazástól.
  • A kutatás szerint a panelek növelése nem helyettesíti a valóban független értékelést.

Kilenc modell, mégis kevés független információ

Az Apple gépi tanulási kutatási oldalán megjelent, Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels című, 2026 júniusában publikált tanulmány az úgynevezett LLM-as-a-judge paneleket vizsgálja. Ezekben több modell szavazatait összesítik azzal a várakozással, hogy a különböző modellek együtt megbízhatóbb értékelést adnak.

Guneet Kohli munkája egy keretrendszert mutat be annak mérésére, mennyi valódi információt adnak ezek a panelek, és mennyire maradnak el attól az eszményi esettől, amelyben a bíróként használt modellek egymástól függetlenül szavaznak.

A kutatás egy 9 frontier LLM-ből álló panelt tesztelt, 7 modellcsaládból. A vizsgálat három természetesnyelvi következtetési adatkészleten zajlott, amelyekben elemenként 100 emberi annotáció szerepelt. Az eredmény szerint a 9 bíró ténylegesen csak körülbelül 2 független szavazatnyi információt szolgáltatott.

A közös hibák rontják a panel pontosságát

A tanulmány szerint a panel névleges függetlenségének nagyjából háromnegyede elveszett, mert a modellek ugyanazokon az elemeken hibáztak. Ennek mérhető következménye volt: a panel tényleges pontossága 8 és 22 százalékpont közötti mértékben maradt el attól, amit független szavazás mellett el lehetett volna érni.

Az Apple kutatása azt is állítja, hogy a legjobb egyedi bíró minden vizsgált feltétel mellett elérte vagy meghaladta a teljes panel teljesítményét. A szerző szerint sem több bíró hozzáadása, sem okosabb összesítési algoritmusok alkalmazása nem oldotta meg a problémát.

A közlemény alapján a bevett módszerek a különbség legfeljebb 11 százalékát zárták, még akkor is, ha hozzáfértek a helyes válaszokhoz. A kutatás a Kish-féle effektív mintaméretet, n_eff, és egy Condorcet nullmodellt használt a jelenség számszerűsítésére.

Mit jelent ez az LLM-ek értékelésében?

A tanulmány szerint az eredmények több beállítás mellett is stabilak voltak: promptváltozatok, hőmérsékleti értékek, láncolt gondolkodás, valamint egy páros preferenciafeladat, a RewardBench esetében is fennmaradt a hiány.

Ez a következtetés közvetlenül érinti azokat a fejlesztési és kutatási folyamatokat, amelyek több modell szavazatával próbálják kiváltani vagy kiegészíteni az értékelést. Az Apple kutatása alapján a szűk keresztmetszet a korrelált bírók jelenléte, nem az összesítő algoritmus.

A gyakorlati üzenet az, hogy a panelek puszta növelése nem helyettesíti a valóban független értékelést. Ha a modellek hasonló hibamintákat követnek, a több szavazat látszólagos biztonságot adhat, miközben a tényleges információtöbblet korlátozott marad.

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple szerint a nyelvi modellek kommunikációja veszteséges
Kutatás2026. szeptember 29.

Az Apple szerint a nyelvi modellek kommunikációja veszteséges

Az Apple kutatása szerint a nyelvi modellek természetes nyelven folytatott kommunikációja jelentős információveszteséggel jár, amikor fa struktúrájú adatokat kell…

Az Apple szerint a nyelvi modellek kommunikációja veszteséges
Kutatás2026. szeptember 29.

Az Apple szerint a nyelvi modellek kommunikációja veszteséges

Az Apple kutatói azt vizsgálták, mennyire marad meg a fastruktúrájú információ, amikor a nyelvi modellek természetes nyelven adják tovább egymásnak. Eredményeik szerint…