Új mérőszámot mutatott be a Cohere az enterprise kereséshez

A Cohere bemutatta az RCP-nDCG@10 nevű értékelési módszert, amely mesterséges intelligenciával vizsgálja a keresőrendszerek által visszaadott dokumentumok relevanciáját. A vállalat szerint az új mérőszám pontosabban tükrözi a valós vállalati keresési minőséget, mint a hiányos címkézésre épülő hagyományos nDCG.
- A Cohere bemutatta az RCP-nDCG@10 értékelési módszert.
- Az eljárás kalibrált AI-értékelővel vizsgálja minden visszaadott dokumentum relevanciáját.
- A vállalat vizsgálatában az RCP-nDCG@10 77 százalékban egyezett az emberi értékelők által előnyben részesített rendszerrel.
- A hagyományos nDCG ugyanezen összevetésekben 52 százalékos arányt ért el.
- A Cohere az új mérőszám alapján optimalizálta következő generációs keresőmodelljeit.
A hagyományos nDCG korlátai
A keresőrendszerek teljesítményének egyik bevett mérőszáma a Normalized Discounted Cumulative Gain, röviden nDCG. Ezt többek között az MTEB és a BEIR benchmarkokban is használják, mivel egyszerre veszi figyelembe a találatok relevanciáját és sorrendjét. A magasabban megjelenő, hasznos dokumentumok nagyobb súllyal számítanak az értékelésben.
A módszer azonban előre elkészített relevanciacímkékre támaszkodik. Ezeket jellemzően emberi értékelők hozzák létre a korábbi keresőrendszerek által előállított dokumentumok egy részének vizsgálatával. A teljes dokumentumgyűjtemény minden lehetséges lekérdezéshez kapcsolódó elemének értékelése túl költséges lenne, ezért a benchmarkok csak egy szűkebb jelölthalmazt használnak.
A Cohere szerint emiatt egy új modell hiába talál meg egy valóban releváns dokumentumot, ha az nem szerepelt az eredeti értékelési halmazban, a hagyományos nDCG nem feltétlenül ad érte pontot. A vállalat 46 résztvevővel végzett emberi annotációs vizsgálatában a qrels, vagyis a relevanciaítéletek, csak 0,65-ös AUC-értéket értek el a vak emberi értékelések előrejelzésében. A kalibrált nyelvimodell-alapú relevanciapontszám ugyanez alapján 0,91-et ért el.
Így működik az RCP-nDCG@10
Az új módszer teljes neve Rubric-Calibrated Preferences nDCG@10. A Cohere megközelítése megtartja a találati sorrend értékelését, de nem kizárólag egy rögzített, ember által címkézett válaszkulcsra támaszkodik. Egy kalibrált AI-értékelő minden visszaadott dokumentumot ugyanazon, előre meghatározott relevanciakritériumok alapján vizsgál.
Az értékelés két jelből áll. Az AI-értékelő minden dokumentummal kapcsolatban öt, igen vagy nem választ igénylő kérdésre válaszol. Emellett csoportokban összehasonlítja a dokumentumokat, és megbecsüli, melyik mennyire valószínű, hogy felülmúlja a többit. A kalibrálás ezt a két információt egyesíti: az összehasonlítások határozzák meg a sorrendet, a rubrika pedig olyan skálára helyezi az eredményt, amely minden lekérdezésnél azonos jelentésű.
A Cohere által ismertetett vizsgálatban a benchmarkok a dokumentumok 29 százalékát jelölték relevánsnak, miközben az emberi értékelők 60 százalékot találtak hasznosnak. A benchmark szerint irreleváns dokumentumok 28 százalékát az emberek hasznosnak ítélték, míg a relevánsnak címkézettek 15 százaléka még az alapvető témabeli megfelelésnek sem felelt meg.
Az emberi értékeléshez közelebb került
A Cohere 46, a vizsgált területhez kapcsolódó szakterületen legalább BSc-végzettséggel rendelkező annotátort vont be a vak vizsgálatba. A résztvevők a NanoBEIR, a BRIGHT és a ViDoRe v3 lekérdezéseiből származó rendszerek legjobb öt találatát értékelték úgy, hogy nem látták a rendszer nevét, a rangsort vagy a válaszkulcsot. Összesen 289, 273 lekérdezéshez kapcsolódó összevetés jutott döntésre.
Amikor az RCP-nDCG@10 és a hagyományos nDCG eltérő rendszert hozott ki győztesként, az értékelők az esetek 70 százalékában az új mérőszám döntését támasztották alá. Az összes összevetésben az RCP-nDCG@10 az esetek 77 százalékában választotta azt a rendszert, amelyet az értékelők előnyben részesítettek, szemben a hagyományos nDCG 52 százalékával.
A Cohere szerint az előny főként abból származott, hogy az új módszer pontot adott az answer key által kihagyott releváns dokumentumokra. Ez 19 százalékpontos javulást jelentett, a dokumentumok relevancia szerinti osztályozása pedig további 6 százalékponttal járult hozzá. A vállalat az RCP-nDCG@10 alapján optimalizálta következő generációs keresőmodelljeit. A módszer bevezetését Kenneth Enevoldsen, az Aarhusi Egyetem adjunktusa és az MTEB elsődleges karbantartója is támogatta. Szerinte az eljárás segíthet megkülönböztetni azokat a modelleket, amelyeket a korábbi mérőszámok már nem tudtak megfelelően elválasztani.


