A nehéz adatbázis-kérdéseknél vált el igazán az AI-elemzők teljesítménye

A ThoughtSpot nyilvános benchmarkon hasonlította össze saját Spotter AI-elemzőjét és négy másik rendszert. A 1533 kérdéses BIRD teszten Spotter összesítésben 82,8 százalékos pontosságot ért el, a legnehezebb kérdéscsoportban pedig 70,6 százalékot.
- Spotter 82,8 százalékot ért el a 1533 kérdéses BIRD benchmarkon.
- A legnehezebb 231 kérdésnél Spotter pontossága 70,6 százalék volt.
- A coding agent ugyanezen a szinten 46,8 százalékot ért el.
- A Claude Opus 4.8-ról Claude Opus 5-re váltás 3,4 ponttal javította az összesített eredményt.
- A ThoughtSpot szerint a nehéz kérdéseknél a szemantikai modell jelentős szerepet kap.
Az összesített eredmény nem mutatja meg a teljes képet
A ThoughtSpot 2026. szeptember 15-én közzétett beszámolója szerint a tesztet a BIRD nyilvános benchmarkon végezték el. A benchmark természetes nyelven feltett kérdéseket vizsgál valósághű adatbázisokon, összesen 1533 kérdéssel és 11 adatbázissal. Mind az öt rendszer ugyanazokat a kérdéseket kapta, azonos pontozási módszer mellett, kérdésenként egy próbálkozással.
Spotter 82,8 százalékos pontosságot ért el. A ThoughtSpot által „frontier LLM”-ként jelölt rendszer 78,4 százalékot, a kódoló ügynök 72,5 százalékot teljesített. A vállalat szerint az összesített eredmény önmagában félrevezető lehet, mivel a könnyű kérdéseken minden vizsgált rendszer 80 százalék feletti eredményt ért el.
A nehéz kérdéseknél nőtt meg a különbség
A BIRD három nehézségi szintet használ: 859 egyszerű, 443 közepes és 231 kihívást jelentő kérdést. A kategóriák a szükséges SQL-szerkezetet írják le, nem a kérdések hosszát.
A kihívást jelentő csoportban Spotter 70,6 százalékos pontosságot ért el. A warehouse-native assistant 66,7 százalékot, a lakehouse AI/BI agent 58,4 százalékot, a frontier LLM SQL-lel 56,7 százalékot, a coding agent SQL-lel pedig 46,8 százalékot produkált.
A ThoughtSpot által közölt adatok szerint Spotter az egyszerű kérdésektől a nehéz kérdésekig 16,4 százalékpontot veszített a pontosságából. Ugyanez a visszaesés 20,2 pont volt a warehouse-native assistant, 23 pont a lakehouse AI/BI agent, 26,8 pont a frontier LLM, illetve 33,5 pont a coding agent esetében. A vállalat szerint a nehéz kérdések több táblát érintő összekapcsolásokat, összetett feltételeket és olyan üzleti definíciókat igényelnek, amelyek nem feltétlenül szerepelnek közvetlenül az adatbázis oszlopneveiben.
A szemantikai modell lehetett a különbség egyik oka
A tesztben szereplő rendszerek ugyanazokat a forrásadatokat kapták, de eltérő módon tájékozódtak az adatmodellben. A coding agent és a frontier LLM a kérdés feltevésekor fedezte fel a sémát, a táblákat, az oszlopneveket és a lehetséges összekapcsolásokat. A warehouse-native assistant a saját platformjának nyers sémáját használta, a lakehouse AI/BI agent pedig a katalógusára támaszkodott.
Spotter egy előzetesen kialakított, irányított szemantikai modellen dolgozott. Ebben a kapcsolatok, a mérőszámok definíciói és az üzleti szókincs már a kérdések feltevése előtt rögzítve volt. A ThoughtSpot szerint ez a különbség az egyszerű feladatoknál alig látható, a nehéz kérdéseknél viszont meghatározóvá válhat.
A BIRD minden kérdéshez egy rövid bizonyítékjelzést is mellékel, amely egy-egy üzleti definíciót tisztáz. A forrás szerint ezt mindegyik rendszer megkapta, a gyártó szerint azonban a valódi vállalati környezetben az ilyen definíciók tartós helye a szemantikai modell.
Mit hozott a modellcsere?
A ThoughtSpot két Spotter-futtatást is összehasonlított. A vállalat szerint egyetlen változó módosult: a Claude Opus 4.8 modellt Claude Opus 5 váltotta, miközben a szemantikai modellek, a promptok és a tesztprotokoll változatlan maradt.
Az újabb modell 3,4 százalékponttal javította az összesített pontosságot, a kihívást jelentő kérdéseknél pedig 4,8 százalékpontos növekedést hozott. A ThoughtSpot szerint mind a 11 adatbázison javulást mértek, a legnagyobb nyereséget a legtöbb összekapcsolást igénylő sémákon. A vállalat azt is közölte, hogy nem mértek visszaesést, a kérdésenkénti eszközhívások száma pedig 2,1 maradt.
ThoughtSpot: Which AI Analyst Holds Up Best for Your Hard Questions?
