Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az AI21 szerint az ügynöki kereséshez fontosabb a hitelesítő, mint a nagy modell

2026. augusztus 19.Forrás: AI21 Labs
Az AI21 szerint az ügynöki kereséshez fontosabb a hitelesítő, mint a nagy modell
Kép: AI21 Labs

Az ügynöki keresőrendszerekben gyakran már szerepel a helyes válasz a modell által előállított jelöltek között, a rendszer mégsem azt választja ki. Az AI21 Labs szerint ezt egy külön hitelesítő modell oldhatja meg hatékonyabban és olcsóbban, mint egy nagyobb, úgynevezett frontier modell használata.

A lényeg röviden
  • Az AI21 szerint az ügynöki keresés fő korlátja gyakran a kiválasztás, nem a válasz előállítása.
  • Claude Opus hitelesítővel a FACTS-Search eredménye 83,3-ról 93,4 pontra nőtt.
  • A saját 8B hitelesítő 92,9 pontot ért el 1,34 dolláros kérdésenkénti költséggel.
  • A teljesen nyílt forrású rendszer képzett hitelesítővel 77,0 pontot szerzett 0,017 dollárért kérdésenként.
  • A hitelesítő másik benchmarkon is javított, de kezdetben a helyes jelöltek 27 százalékát elutasította.

A hiba sokszor a kiválasztásnál történik

Az AI21 augusztus 19-én közzétett elemzése szerint az agentic search, vagyis az önállóan kereső és több lépésben dolgozó AI-rendszerek egyik fő korlátja nem a válaszok előállítása, hanem a megfelelő jelölt kiválasztása. Ugyanaz a modell és ugyanaz a kérdés különböző futtatásokban eltérő eredményt adhat, ezért több próbálkozásból gyakran előkerül a helyes válasz, csak a rendszer nem ezt választja.

A vállalat szerint a jelöltek egyszerű többségi szavazása sem oldja meg a problémát. Ha több modell ugyanazt a hibás entitást ismétli, a szavazás megerősíti a tévedést. Ez különösen a kisebb modellekből álló rendszereknél jelent gondot, ahol a helyes válasz ritkábban kerül többségbe.

Az AI21 ezért egy háromlépcsős folyamatot javasol. A generátorok több válaszjelöltet készítenek, egy külön hitelesítő mindegyiket önállóan újrakutatja, majd az összesítő már csak az ellenőrzött jelöltek között szavaz.

A hitelesítő nagy javulást hozott a FACTS-Search teszten

A kísérleteket a Google DeepMind FACTS-Search benchmarkján végezték. Ez nehéz, több lépésből álló, webes keresést igénylő ténykérdéseket tartalmaz. A generátorok és a hitelesítők ugyanazt a Brave Search API-t használták, így az AI21 szerint a különbségeket elsősorban a modellek képességei okozták.

Egy zárt és nyílt forrású modellekből álló együttes, amely Claude Haiku, Sonnet és Opus, valamint Qwen3-Coder-30B-A3B modelleket használt, többségi szavazással 83,3 pontot ért el. Claude Opus hitelesítővel ugyanez 93,4 pontra javult, miközben a közzétett 89,4 pontos állapotot is meghaladta.

A teljesen nyílt forrású, Qwen3-14B és Qwen3-Coder-30B-A3B modellekből álló rendszer többségi szavazással 60,1 pontot szerzett. Claude Opus hitelesítővel ez 80,4 pontra nőtt, kérdésenként 1,76 dolláros költség mellett. Egy képzés nélküli Qwen3-8B hitelesítő ugyanebben a beállításban csak 2,4 ponttal javított.

A saját, 8 milliárd paraméteres hitelesítő olcsóbban dolgozik

Az AI21 saját, 8 milliárd paraméteres hitelesítőt képzett. A modell egy kérdés és egy válaszjelölt alapján saját Brave-kereséses ReAct-folyamatot futtat, majd VALID vagy NOT_VALID ítéletet ad. A tanításhoz nagyjából 6 ezer, generátorfuttatásokból származó, kiegyensúlyozott és deduplikált kérdés, válasz és címke hármast használtak.

A képzés felügyelt finomhangolásból, majd megerősítéses tanulásból állt. Az AI21 szerint a két módszer külön-külön problémákat okozott: a csak megerősítéses tanulás gyorsan kihasználta az osztályok egyensúlytalanságát, a csak felügyelt finomhangolás pedig felhígította az ítélet jelentőségét a hosszú keresési folyamatban. A kombinált eljárás mellett a modell eszközhasználata magas maradt, és a döntési pontosság is javult.

A képzett hitelesítővel a Claude Opus hitelesítőjét lecserélő rendszer 92,9 pontot ért el 1,34 dolláros kérdésenkénti költséggel. Ez az AI21 közlése szerint fél ponttal alacsonyabb minőség mellett 3,2-szer kisebb költséget jelent. A teljesen nyílt forrású összeállítás a képzett hitelesítővel 77,0 pontot hozott, kérdésenként 0,017 dollárért.

Másik benchmarkon is javított, de a visszahívás gyengébb volt

Az AI21 a hitelesítőt szándékosan egy benchmarkon és egy eszközzel tanította, majd egy másik teszten is kipróbálta. A BrowseComp-Plus eltérő környezetet használ, ahol a rendszer nyílt web helyett rögzített korpuszból keres. A FACTS-Searchen tanított hitelesítő további képzés nélkül 39 százalékról 51 százalékra emelte az utólagos szavazás eredményét.

A vállalat szerint a pontosság átvihető volt, a visszahívás, vagyis a helyes jelöltek megtartása azonban romlott. A megoldás a megoldható kérdések 27 százalékánál minden helyes jelöltet elutasított. Egy körülbelül 85, a korábbi tartományon kívüli kérdésen végzett, nagyjából 15 optimalizálási lépésből álló finomhangolás ezt a rést 4 százalékra csökkentette, az eredményt pedig 69 százalékra emelte.

Az AI21 eredményei alapján a rendszer teljesítményét jelentősen befolyásolhatja, hogyan választja ki és ellenőrzi a modellek által előállított válaszokat. A vállalat szerint ez lehetővé teszi, hogy kisebb, olcsóbb generátorokkal is versenyképesebb keresőrendszert építsenek, feltéve, hogy a hitelesítő képes megfelelően ellenőrizni a jelölteket.

Kapcsolódó hírek

A forrás címe szerint az ügynök elkészült, az adatbázis mást mutatott
Kutatás2026. október 3.

A forrás címe szerint az ügynök elkészült, az adatbázis mást mutatott

A Hugging Face oldalának címe szerint egy ügynök késznek jelentett egy feladatot, az adatbázis azonban ellentmondott ennek. A megadott forrásrészlet a történet részletes…

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…

Az Apple kutatása szerint kevésbé számít az ügynökök körítése
Kutatás2026. október 1.

Az Apple kutatása szerint kevésbé számít az ügynökök körítése

Az Apple kutatói szerint a gépi tanulási feladatokra fejlesztett ügynököknél az alapul szolgáló nagy nyelvi modell teljesítménye fontosabb lehet az ügynök köré épített…