Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Cohere új mérőszámmal értékelné pontosabban a vállalati keresőket

2026. szeptember 30.Forrás: Cohere
A Cohere új mérőszámmal értékelné pontosabban a vállalati keresőket
Kép: Cohere

A Cohere bemutatta az RCP-nDCG@10 nevű értékelési módszert, amely mesterséges intelligenciával vizsgálja a kereső által visszaadott dokumentumok relevanciáját. A vállalat szerint az új mérőszám pontosabban tükrözi a vállalati keresőrendszerek minőségét, mint a hagyományos nDCG.

A lényeg röviden
  • A Cohere bemutatta az RCP-nDCG@10 keresési értékelési módszert.
  • A rendszer minden visszaadott dokumentum relevanciáját kalibrált AI-bíróval vizsgálja.
  • A vállalat emberi értékelésben 77 százalékos egyezést mért az új módszernél.
  • A hagyományos nDCG ugyanebben az összevetésben 52 százalékban egyezett az értékelőkkel.
  • A Cohere következő generációs keresőmodelljeit az új mérőszám alapján optimalizálta.

A hagyományos mérőszámok hiányos címkékre támaszkodnak

A keresőrendszerek teljesítményét gyakran a Recall@10, a Mean Reciprocal Rank, röviden MRR, illetve a Normalized Discounted Cumulative Gain, vagyis az nDCG segítségével hasonlítják össze. A Recall@10 azt méri, mennyi releváns tartalom kerül a legjobb tíz találat közé, de nem veszi figyelembe a sorrendet. Az MRR azt vizsgálja, milyen magasan jelenik meg az első releváns találat, a többi eredményt viszont figyelmen kívül hagyja.

Az nDCG azért terjedt el széles körben, mert egyszerre számol a relevancia mértékével és a találatok sorrendjével. A felül elhelyezkedő, relevánsabb dokumentumok nagyobb súlyt kapnak. A módszer azonban nem maga állapítja meg, hogy egy dokumentum releváns-e. Egy előre elkészített, emberi értékeléseken alapuló címkekészlettel veti össze a kereső eredményeit.

A Cohere szerint ez a megközelítés lefedettségi problémát okozhat. Ha egy új rendszer olyan releváns dokumentumot talál meg, amelyet a korábbi értékelés során nem vizsgáltak, a hagyományos nDCG nem feltétlenül ad érte pontot. A vállalat 46 résztvevővel végzett emberi annotációs vizsgálatában a qrels, vagyis a relevanciaértékelések, csak 0,65-ös AUC-értéket értek el a vak emberi értékelések előrejelzésében. A Cohere szerint ugyanez a kalibrált nyelvi modell által adott relevanciaértékkel 0,91-re nőtt.

Öt kérdésből és dokumentum-összehasonlításból áll össze a pontszám

Az RCP-nDCG@10, vagyis a Rubric-Calibrated Preferences nDCG@10 célja, hogy megőrizze az nDCG sorrendre vonatkozó elvárását, miközben a korábban nem címkézett releváns dokumentumokat is értékelje. A módszer egy kalibrált AI-bírót használ, amely minden visszaadott dokumentumot ugyanazon, előre meghatározott relevanciakritériumok alapján vizsgál.

A pontszám két jelből épül fel. A bíró öt, eltérő nehézségű igen-nem kérdésre válaszol minden dokumentum esetében. Emellett csoportokban összehasonlítja a dokumentumokat, és megbecsüli, melyik milyen valószínűséggel teljesít jobban a többinél. A kalibrálás egyesíti a két eredményt: az összehasonlítás alakítja ki a sorrendet, a rubrika pedig olyan skálára helyezi az eredményt, amely a különböző lekérdezések között is azonos jelentésű.

A Cohere példája szerint a hagyományos nDCG azt értékeli, amit korábban relevánsnak jelöltek, az RCP-nDCG@10 pedig minden visszaadott találat tényleges relevanciáját próbálja pontozni.

A vak emberi vizsgálatban gyakrabban választotta a nyertes rendszert

A módszert a Cohere vak emberi vizsgálatban tesztelte. A 46 szerződtetett annotátor mindegyike legalább releváns szakterületen szerzett BSc-végzettséggel rendelkezett. A résztvevők a NanoBEIR, a BRIGHT és a ViDoRe v3 lekérdezéseire adott legjobb öt találatot értékelték úgy, hogy nem látták a rendszerek nevét, a rangsort vagy a válaszkulcsot.

Összesen 289, 273 lekérdezéshez tartozó rendszer-összevetés jutott döntésre. Amikor az RCP-nDCG@10 és a hagyományos nDCG eltérő győztest nevezett meg, az értékelők az esetek 70 százalékában az RCP-nDCG@10 által kiválasztott rendszert tartották jobbnak. Az összes összevetésben az új mérőszám 77 százalékban egyezett az értékelők preferenciájával, míg a hagyományos nDCG 52 százalékban. Azokban az esetekben, amikor a két mérőszám ugyanazt a rendszert választotta, mindkettő 87 százalékban egyezett az emberi értékeléssel.

A Cohere adatai szerint az új módszer előnye főként abból származott, hogy pontot adott a válaszkulcsból kimaradt releváns dokumentumokért. Ez 19 százalékpontos javulást jelentett, a dokumentumok relevanciaszintjének értékelése pedig további 6 százalékponttal növelte az eredményt.

A Cohere a következő keresőmodelljeit is erre optimalizálja

A vállalat közlése szerint az RCP-nDCG@10 eredményei alapján ezt a mérőszámot használta következő generációs kereső- és információ-visszakereső modelljeinek optimalizálásához. A Cohere azt állítja, hogy a módszer nagyobb felbontásban különböztetheti meg egymástól azokat a modelleket, amelyeket a korábbi mérőszámok már nehezebben választottak szét.

Kenneth Enevoldsen, az Aarhusi Egyetem adjunktusa és a Massive Text Embedding Benchmark, vagyis az MTEB elsődleges karbantartója szerint az embeddingmodellek erősödésével a hagyományos benchmarkok egyre kevésbé tudják elkülöníteni a legjobb rendszereket. Enevoldsen a Cohere közleménye szerint úgy látja, hogy a rubrikához kötött nyelvi modellértékelés javíthatja a meglévő adathalmazok értékelési jelét, csökkentheti a futtatási költséget, és több nyelven teheti lehetővé a jó minőségű keresési benchmarkokat.

Kapcsolódó hírek

A Cohere bemutatta az Embed 5 vállalati keresésre szánt modellcsaládot
Modellek2026. szeptember 30.

A Cohere bemutatta az Embed 5 vállalati keresésre szánt modellcsaládot

A Cohere új embeddingmodell-családot mutatott be Embed 5 néven. A Pro és Fast változatok vállalati kereséshez, RAG-rendszerekhez és ügynöki munkafolyamatokhoz készültek…

A Cohere bemutatta az Embed 5 vállalati keresési modellcsaládot
Modellek2026. szeptember 30.

A Cohere bemutatta az Embed 5 vállalati keresési modellcsaládot

A Cohere elérhetővé tette az Embed 5 modellcsaládot, amely vállalati kereséshez, RAG-rendszerekhez és ügynökalapú munkafolyamatokhoz készült. A Pro a maximális…

Új mérőszámot mutatott be a Cohere az enterprise kereséshez
Kutatás2026. szeptember 30.

Új mérőszámot mutatott be a Cohere az enterprise kereséshez

A Cohere bemutatta az RCP-nDCG@10 nevű értékelési módszert, amely mesterséges intelligenciával vizsgálja a keresőrendszerek által visszaadott dokumentumok relevanciáját.…