Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Új mérőszámot mutatott be a Cohere az enterprise kereséshez

2026. szeptember 30.Forrás: Cohere
Új mérőszámot mutatott be a Cohere az enterprise kereséshez
Kép: Cohere

A Cohere bemutatta az RCP-nDCG@10 nevű értékelési módszert, amely mesterséges intelligenciával vizsgálja a keresőrendszerek által visszaadott dokumentumok relevanciáját. A vállalat szerint az új mérőszám pontosabban tükrözi a valós vállalati keresési minőséget, mint a hiányos címkézésre épülő hagyományos nDCG.

A lényeg röviden
  • A Cohere bemutatta az RCP-nDCG@10 értékelési módszert.
  • Az eljárás kalibrált AI-értékelővel vizsgálja minden visszaadott dokumentum relevanciáját.
  • A vállalat vizsgálatában az RCP-nDCG@10 77 százalékban egyezett az emberi értékelők által előnyben részesített rendszerrel.
  • A hagyományos nDCG ugyanezen összevetésekben 52 százalékos arányt ért el.
  • A Cohere az új mérőszám alapján optimalizálta következő generációs keresőmodelljeit.

A hagyományos nDCG korlátai

A keresőrendszerek teljesítményének egyik bevett mérőszáma a Normalized Discounted Cumulative Gain, röviden nDCG. Ezt többek között az MTEB és a BEIR benchmarkokban is használják, mivel egyszerre veszi figyelembe a találatok relevanciáját és sorrendjét. A magasabban megjelenő, hasznos dokumentumok nagyobb súllyal számítanak az értékelésben.

A módszer azonban előre elkészített relevanciacímkékre támaszkodik. Ezeket jellemzően emberi értékelők hozzák létre a korábbi keresőrendszerek által előállított dokumentumok egy részének vizsgálatával. A teljes dokumentumgyűjtemény minden lehetséges lekérdezéshez kapcsolódó elemének értékelése túl költséges lenne, ezért a benchmarkok csak egy szűkebb jelölthalmazt használnak.

A Cohere szerint emiatt egy új modell hiába talál meg egy valóban releváns dokumentumot, ha az nem szerepelt az eredeti értékelési halmazban, a hagyományos nDCG nem feltétlenül ad érte pontot. A vállalat 46 résztvevővel végzett emberi annotációs vizsgálatában a qrels, vagyis a relevanciaítéletek, csak 0,65-ös AUC-értéket értek el a vak emberi értékelések előrejelzésében. A kalibrált nyelvimodell-alapú relevanciapontszám ugyanez alapján 0,91-et ért el.

Így működik az RCP-nDCG@10

Az új módszer teljes neve Rubric-Calibrated Preferences nDCG@10. A Cohere megközelítése megtartja a találati sorrend értékelését, de nem kizárólag egy rögzített, ember által címkézett válaszkulcsra támaszkodik. Egy kalibrált AI-értékelő minden visszaadott dokumentumot ugyanazon, előre meghatározott relevanciakritériumok alapján vizsgál.

Az értékelés két jelből áll. Az AI-értékelő minden dokumentummal kapcsolatban öt, igen vagy nem választ igénylő kérdésre válaszol. Emellett csoportokban összehasonlítja a dokumentumokat, és megbecsüli, melyik mennyire valószínű, hogy felülmúlja a többit. A kalibrálás ezt a két információt egyesíti: az összehasonlítások határozzák meg a sorrendet, a rubrika pedig olyan skálára helyezi az eredményt, amely minden lekérdezésnél azonos jelentésű.

A Cohere által ismertetett vizsgálatban a benchmarkok a dokumentumok 29 százalékát jelölték relevánsnak, miközben az emberi értékelők 60 százalékot találtak hasznosnak. A benchmark szerint irreleváns dokumentumok 28 százalékát az emberek hasznosnak ítélték, míg a relevánsnak címkézettek 15 százaléka még az alapvető témabeli megfelelésnek sem felelt meg.

Az emberi értékeléshez közelebb került

A Cohere 46, a vizsgált területhez kapcsolódó szakterületen legalább BSc-végzettséggel rendelkező annotátort vont be a vak vizsgálatba. A résztvevők a NanoBEIR, a BRIGHT és a ViDoRe v3 lekérdezéseiből származó rendszerek legjobb öt találatát értékelték úgy, hogy nem látták a rendszer nevét, a rangsort vagy a válaszkulcsot. Összesen 289, 273 lekérdezéshez kapcsolódó összevetés jutott döntésre.

Amikor az RCP-nDCG@10 és a hagyományos nDCG eltérő rendszert hozott ki győztesként, az értékelők az esetek 70 százalékában az új mérőszám döntését támasztották alá. Az összes összevetésben az RCP-nDCG@10 az esetek 77 százalékában választotta azt a rendszert, amelyet az értékelők előnyben részesítettek, szemben a hagyományos nDCG 52 százalékával.

A Cohere szerint az előny főként abból származott, hogy az új módszer pontot adott az answer key által kihagyott releváns dokumentumokra. Ez 19 százalékpontos javulást jelentett, a dokumentumok relevancia szerinti osztályozása pedig további 6 százalékponttal járult hozzá. A vállalat az RCP-nDCG@10 alapján optimalizálta következő generációs keresőmodelljeit. A módszer bevezetését Kenneth Enevoldsen, az Aarhusi Egyetem adjunktusa és az MTEB elsődleges karbantartója is támogatta. Szerinte az eljárás segíthet megkülönböztetni azokat a modelleket, amelyeket a korábbi mérőszámok már nem tudtak megfelelően elválasztani.

Kapcsolódó hírek

A Cohere bemutatta az Embed 5 vállalati keresésre szánt modellcsaládot
Modellek2026. szeptember 30.

A Cohere bemutatta az Embed 5 vállalati keresésre szánt modellcsaládot

A Cohere új embeddingmodell-családot mutatott be Embed 5 néven. A Pro és Fast változatok vállalati kereséshez, RAG-rendszerekhez és ügynöki munkafolyamatokhoz készültek…

A Cohere új mérőszámmal értékelné pontosabban a vállalati keresőket
Kutatás2026. szeptember 30.

A Cohere új mérőszámmal értékelné pontosabban a vállalati keresőket

A Cohere bemutatta az RCP-nDCG@10 nevű értékelési módszert, amely mesterséges intelligenciával vizsgálja a kereső által visszaadott dokumentumok relevanciáját. A…

A Cohere bemutatta az Embed 5 vállalati keresési modellcsaládot
Modellek2026. szeptember 30.

A Cohere bemutatta az Embed 5 vállalati keresési modellcsaládot

A Cohere elérhetővé tette az Embed 5 modellcsaládot, amely vállalati kereséshez, RAG-rendszerekhez és ügynökalapú munkafolyamatokhoz készült. A Pro a maximális…