A Cohere új mérőszámmal értékelné pontosabban a vállalati keresőket

A Cohere bemutatta az RCP-nDCG@10 nevű értékelési módszert, amely mesterséges intelligenciával vizsgálja a kereső által visszaadott dokumentumok relevanciáját. A vállalat szerint az új mérőszám pontosabban tükrözi a vállalati keresőrendszerek minőségét, mint a hagyományos nDCG.
- A Cohere bemutatta az RCP-nDCG@10 keresési értékelési módszert.
- A rendszer minden visszaadott dokumentum relevanciáját kalibrált AI-bíróval vizsgálja.
- A vállalat emberi értékelésben 77 százalékos egyezést mért az új módszernél.
- A hagyományos nDCG ugyanebben az összevetésben 52 százalékban egyezett az értékelőkkel.
- A Cohere következő generációs keresőmodelljeit az új mérőszám alapján optimalizálta.
A hagyományos mérőszámok hiányos címkékre támaszkodnak
A keresőrendszerek teljesítményét gyakran a Recall@10, a Mean Reciprocal Rank, röviden MRR, illetve a Normalized Discounted Cumulative Gain, vagyis az nDCG segítségével hasonlítják össze. A Recall@10 azt méri, mennyi releváns tartalom kerül a legjobb tíz találat közé, de nem veszi figyelembe a sorrendet. Az MRR azt vizsgálja, milyen magasan jelenik meg az első releváns találat, a többi eredményt viszont figyelmen kívül hagyja.
Az nDCG azért terjedt el széles körben, mert egyszerre számol a relevancia mértékével és a találatok sorrendjével. A felül elhelyezkedő, relevánsabb dokumentumok nagyobb súlyt kapnak. A módszer azonban nem maga állapítja meg, hogy egy dokumentum releváns-e. Egy előre elkészített, emberi értékeléseken alapuló címkekészlettel veti össze a kereső eredményeit.
A Cohere szerint ez a megközelítés lefedettségi problémát okozhat. Ha egy új rendszer olyan releváns dokumentumot talál meg, amelyet a korábbi értékelés során nem vizsgáltak, a hagyományos nDCG nem feltétlenül ad érte pontot. A vállalat 46 résztvevővel végzett emberi annotációs vizsgálatában a qrels, vagyis a relevanciaértékelések, csak 0,65-ös AUC-értéket értek el a vak emberi értékelések előrejelzésében. A Cohere szerint ugyanez a kalibrált nyelvi modell által adott relevanciaértékkel 0,91-re nőtt.
Öt kérdésből és dokumentum-összehasonlításból áll össze a pontszám
Az RCP-nDCG@10, vagyis a Rubric-Calibrated Preferences nDCG@10 célja, hogy megőrizze az nDCG sorrendre vonatkozó elvárását, miközben a korábban nem címkézett releváns dokumentumokat is értékelje. A módszer egy kalibrált AI-bírót használ, amely minden visszaadott dokumentumot ugyanazon, előre meghatározott relevanciakritériumok alapján vizsgál.
A pontszám két jelből épül fel. A bíró öt, eltérő nehézségű igen-nem kérdésre válaszol minden dokumentum esetében. Emellett csoportokban összehasonlítja a dokumentumokat, és megbecsüli, melyik milyen valószínűséggel teljesít jobban a többinél. A kalibrálás egyesíti a két eredményt: az összehasonlítás alakítja ki a sorrendet, a rubrika pedig olyan skálára helyezi az eredményt, amely a különböző lekérdezések között is azonos jelentésű.
A Cohere példája szerint a hagyományos nDCG azt értékeli, amit korábban relevánsnak jelöltek, az RCP-nDCG@10 pedig minden visszaadott találat tényleges relevanciáját próbálja pontozni.
A vak emberi vizsgálatban gyakrabban választotta a nyertes rendszert
A módszert a Cohere vak emberi vizsgálatban tesztelte. A 46 szerződtetett annotátor mindegyike legalább releváns szakterületen szerzett BSc-végzettséggel rendelkezett. A résztvevők a NanoBEIR, a BRIGHT és a ViDoRe v3 lekérdezéseire adott legjobb öt találatot értékelték úgy, hogy nem látták a rendszerek nevét, a rangsort vagy a válaszkulcsot.
Összesen 289, 273 lekérdezéshez tartozó rendszer-összevetés jutott döntésre. Amikor az RCP-nDCG@10 és a hagyományos nDCG eltérő győztest nevezett meg, az értékelők az esetek 70 százalékában az RCP-nDCG@10 által kiválasztott rendszert tartották jobbnak. Az összes összevetésben az új mérőszám 77 százalékban egyezett az értékelők preferenciájával, míg a hagyományos nDCG 52 százalékban. Azokban az esetekben, amikor a két mérőszám ugyanazt a rendszert választotta, mindkettő 87 százalékban egyezett az emberi értékeléssel.
A Cohere adatai szerint az új módszer előnye főként abból származott, hogy pontot adott a válaszkulcsból kimaradt releváns dokumentumokért. Ez 19 százalékpontos javulást jelentett, a dokumentumok relevanciaszintjének értékelése pedig további 6 százalékponttal növelte az eredményt.
A Cohere a következő keresőmodelljeit is erre optimalizálja
A vállalat közlése szerint az RCP-nDCG@10 eredményei alapján ezt a mérőszámot használta következő generációs kereső- és információ-visszakereső modelljeinek optimalizálásához. A Cohere azt állítja, hogy a módszer nagyobb felbontásban különböztetheti meg egymástól azokat a modelleket, amelyeket a korábbi mérőszámok már nehezebben választottak szét.
Kenneth Enevoldsen, az Aarhusi Egyetem adjunktusa és a Massive Text Embedding Benchmark, vagyis az MTEB elsődleges karbantartója szerint az embeddingmodellek erősödésével a hagyományos benchmarkok egyre kevésbé tudják elkülöníteni a legjobb rendszereket. Enevoldsen a Cohere közleménye szerint úgy látja, hogy a rubrikához kötött nyelvi modellértékelés javíthatja a meglévő adathalmazok értékelési jelét, csökkentheti a futtatási költséget, és több nyelven teheti lehetővé a jó minőségű keresési benchmarkokat.


