A Yext LLM-ekkel tesztelte, kiváltható-e egy emberi annotátor

A Yext 12 745 közösségimédia-bejegyzésen vizsgálta, hogy a GPT-5 és a GPT-5 Mini mennyire képes emberi annotátorok mellett marketingtartalmakat osztályozni. A Label Studio Enterprise-ben futtatott benchmark szerint a modellek néhány feladatban megközelítették az emberi annotátorok közötti egyezési szintet.
- A benchmark 12 745 közösségimédia-bejegyzést vizsgált.
- A GPT-5 few-shot több feladatban megközelítette az emberi egyezési szintet.
- Az LLM második annotátorként vagy minőségellenőrként is használható.
- A Yext becslése szerint a második annotátor kiváltása 16 000 dollár megtakarítást hozott.
- A projektet a Label Studio Enterprise közös értékelési környezetében futtatták.
Több mint 12 ezer bejegyzést vizsgáltak
A Yext digitális jelenléti platformot működtet, amely többek között azt segíti a márkáknak, hogy kezeljék és elemezzék megjelenésüket a hagyományos és a mesterséges intelligenciára épülő keresőkben, a közösségi médiában, a térképszolgáltatásokban és az online címtárakban. Ehhez jó minőségű, címkézett adatokra és értékelési folyamatokra van szüksége.
A vállalat a Label Studio Enterprise segítségével olyan, mesterséges intelligenciát is bevonó annotációs benchmarkot épített, amelyben az emberi annotáció, a döntőbíráskodás, az eltérések elemzése és az LLM-ek értékelése egy közös rendszerben kapott helyet. A vizsgálat 12 745, hat iparági területhez kapcsolódó, márkázott közösségimédia-bejegyzésre terjedt ki. Az adatok 1414 vállalkozást és 3055 különálló helyszínt érintettek.
A bejegyzéseket két taxonómia szerint osztályozták. A Funnel Stage kategóriái a láthatóság, a mérlegelés, a konverzió és a lojalitás voltak. Az Intent kategóriái az oktató, a promóciós, a bevonó és az inspiráló tartalmakat különítették el.
Az emberi annotátorok közötti eltérés lett a viszonyítási alap
A Yext korábbi folyamata két emberi annotátor egymástól független címkézésére épült. Ha eltérés alakult ki, egy harmadik annotátor vizsgálta meg a feladatot, összegezte a címkéket, majd az ellenőrzött eredmény bekerült az úgynevezett aranyadatkészletbe.
A csapat arra kereste a választ, hogy egy LLM képes-e részben átvenni a második annotátor szerepét. A GPT-5 és a GPT-5 Mini teljesítményét nulla példás és néhány példás promptolással is vizsgálták. A few-shot megközelítés mindkét taxonómiában következetesen jobb egyezést eredményezett, mint a zero-shot beállítás.
A két képzett emberi annotátor közötti eltérés aránya 50,5 százalék volt. A GPT-5 few-shot eredményeinél a Funnel Stage feladatban az ember és ember közötti eltérés 41,1 százalék, az ember és LLM közötti 36,3 százalék, az aranycímke és az LLM közötti pedig 32,3 százalék lett. Az Intent feladatnál ugyanezek az értékek 21,5, 23,6 és 21,1 százalékot tettek ki. A két feladatot együtt vizsgálva 50,5, 48,2 és 43,6 százalékos értékeket mértek.
A Yext szerint ezek az adatok arra is rámutatnak, hogy az emberi egyezés önmagában sem tökéletes igazságmérce. Az eltérések mintázatai további információt adtak: az emberek gyakran a láthatóságot és a konverziót választották a mérlegelés helyett, míg az LLM-ek hajlamosak voltak a konverziót túl gyakran hozzárendelni.
Kétféle szerepet kaphatnak az LLM-ek
A kvalitatív elemzésben egy vezető annotációs menedzser azt vizsgálta, hogy az eltérések emberi címkézési hibára mutatnak-e, egy kétértelmű tartalom elfogadható alternatív értelmezését jelentik-e, vagy a modell félreértéséből adódnak. A vizsgált eltérések több mint 50 százaléka értelmesnek bizonyult, vagy hibás emberi címkére mutatott.
A vállalat két gyakorlati munkafolyamatot vázolt fel. Az elsőben az LLM a második emberi annotátor helyére lép az elsődleges címkézés során. A Yext projektjében ez hozzávetőleg 150 dollárnyi LLM-inferencia-költséggel járt, miközben a becsült emberi annotációs költség 16 000 dollárral csökkent, a teljes projekt időtartama pedig körülbelül 15 százalékkal rövidült.
A második megközelítésben megmarad a két emberi annotátorra épülő folyamat, az LLM pedig az egyeztetett eredményeket ellenőrzi, különösen azokat a feladatokat, amelyeknél kezdetben eltérés volt. Ez a megoldás nem csökkenti a költségeket, mivel további LLM-inferencia- és eltérésfeloldási ráfordítással jár, viszont javíthatja az aranyadatkészletbe vetett bizalmat és a címkék minőségét.
A becslések egy nagyjából két hónapos projektre, négy részmunkaidős annotátorra, valamint amerikai és európai középhaladó adattudósok átlagos óradíjára és nagyságrendi erőforrásbecslésekre épültek. A Label Studio Enterprise a Yext szerint közös környezetet biztosított az emberi címkézés, a döntőbíráskodás, az LLM-es értékelés és az eltérések nyomon követéséhez. A felhasználók így közvetlenül hasonlíthatták össze az emberi címkéket, az aranycímkéket és a modell előrejelzéseit.
HumanSignal (Label Studio): How Yext Built an AI-in-the-Loop Benchmark with Label Studio Enterprise


