Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A nehéz adatbázis-kérdéseknél vált el igazán az AI-elemzők teljesítménye

2026. szeptember 16. 02:18Forrás: ThoughtSpot
A nehéz adatbázis-kérdéseknél vált el igazán az AI-elemzők teljesítménye
Kép: ThoughtSpot

A ThoughtSpot nyilvános benchmarkon hasonlította össze saját Spotter AI-elemzőjét és négy másik rendszert. A 1533 kérdéses BIRD teszten Spotter összesítésben 82,8 százalékos pontosságot ért el, a legnehezebb kérdéscsoportban pedig 70,6 százalékot.

A lényeg röviden
  • Spotter 82,8 százalékot ért el a 1533 kérdéses BIRD benchmarkon.
  • A legnehezebb 231 kérdésnél Spotter pontossága 70,6 százalék volt.
  • A coding agent ugyanezen a szinten 46,8 százalékot ért el.
  • A Claude Opus 4.8-ról Claude Opus 5-re váltás 3,4 ponttal javította az összesített eredményt.
  • A ThoughtSpot szerint a nehéz kérdéseknél a szemantikai modell jelentős szerepet kap.

Az összesített eredmény nem mutatja meg a teljes képet

A ThoughtSpot 2026. szeptember 15-én közzétett beszámolója szerint a tesztet a BIRD nyilvános benchmarkon végezték el. A benchmark természetes nyelven feltett kérdéseket vizsgál valósághű adatbázisokon, összesen 1533 kérdéssel és 11 adatbázissal. Mind az öt rendszer ugyanazokat a kérdéseket kapta, azonos pontozási módszer mellett, kérdésenként egy próbálkozással.

Spotter 82,8 százalékos pontosságot ért el. A ThoughtSpot által „frontier LLM”-ként jelölt rendszer 78,4 százalékot, a kódoló ügynök 72,5 százalékot teljesített. A vállalat szerint az összesített eredmény önmagában félrevezető lehet, mivel a könnyű kérdéseken minden vizsgált rendszer 80 százalék feletti eredményt ért el.

A nehéz kérdéseknél nőtt meg a különbség

A BIRD három nehézségi szintet használ: 859 egyszerű, 443 közepes és 231 kihívást jelentő kérdést. A kategóriák a szükséges SQL-szerkezetet írják le, nem a kérdések hosszát.

A kihívást jelentő csoportban Spotter 70,6 százalékos pontosságot ért el. A warehouse-native assistant 66,7 százalékot, a lakehouse AI/BI agent 58,4 százalékot, a frontier LLM SQL-lel 56,7 százalékot, a coding agent SQL-lel pedig 46,8 százalékot produkált.

A ThoughtSpot által közölt adatok szerint Spotter az egyszerű kérdésektől a nehéz kérdésekig 16,4 százalékpontot veszített a pontosságából. Ugyanez a visszaesés 20,2 pont volt a warehouse-native assistant, 23 pont a lakehouse AI/BI agent, 26,8 pont a frontier LLM, illetve 33,5 pont a coding agent esetében. A vállalat szerint a nehéz kérdések több táblát érintő összekapcsolásokat, összetett feltételeket és olyan üzleti definíciókat igényelnek, amelyek nem feltétlenül szerepelnek közvetlenül az adatbázis oszlopneveiben.

A szemantikai modell lehetett a különbség egyik oka

A tesztben szereplő rendszerek ugyanazokat a forrásadatokat kapták, de eltérő módon tájékozódtak az adatmodellben. A coding agent és a frontier LLM a kérdés feltevésekor fedezte fel a sémát, a táblákat, az oszlopneveket és a lehetséges összekapcsolásokat. A warehouse-native assistant a saját platformjának nyers sémáját használta, a lakehouse AI/BI agent pedig a katalógusára támaszkodott.

Spotter egy előzetesen kialakított, irányított szemantikai modellen dolgozott. Ebben a kapcsolatok, a mérőszámok definíciói és az üzleti szókincs már a kérdések feltevése előtt rögzítve volt. A ThoughtSpot szerint ez a különbség az egyszerű feladatoknál alig látható, a nehéz kérdéseknél viszont meghatározóvá válhat.

A BIRD minden kérdéshez egy rövid bizonyítékjelzést is mellékel, amely egy-egy üzleti definíciót tisztáz. A forrás szerint ezt mindegyik rendszer megkapta, a gyártó szerint azonban a valódi vállalati környezetben az ilyen definíciók tartós helye a szemantikai modell.

Mit hozott a modellcsere?

A ThoughtSpot két Spotter-futtatást is összehasonlított. A vállalat szerint egyetlen változó módosult: a Claude Opus 4.8 modellt Claude Opus 5 váltotta, miközben a szemantikai modellek, a promptok és a tesztprotokoll változatlan maradt.

Az újabb modell 3,4 százalékponttal javította az összesített pontosságot, a kihívást jelentő kérdéseknél pedig 4,8 százalékpontos növekedést hozott. A ThoughtSpot szerint mind a 11 adatbázison javulást mértek, a legnagyobb nyereséget a legtöbb összekapcsolást igénylő sémákon. A vállalat azt is közölte, hogy nem mértek visszaesést, a kérdésenkénti eszközhívások száma pedig 2,1 maradt.

Kapcsolódó hírek

Kutatás
Kutatás2026. október 2. 00:26

A PyTorch szerint a TLX gyorsabb lett a Blackwell Jagged Flash Attentionjénél

A PyTorch csapata olyan Jagged Flash Attention kernelt mutatott be NVIDIA Blackwell B200 GPU-kra, amely a vállalat mérései szerint a GEM munkaterhelésén gyorsabb volt a…

Kutatás
Kutatás2026. október 2. 00:26

A PyTorch TLX-kernellel gyorsította a Meta hirdetési modelljének figyelmét

A PyTorch olyan Jagged Flash Attention-kernelt mutatott be, amely az NVIDIA Blackwell B200 gyorsítón a Meta Generative Ads Model modelljéhez fontos alakzatokon…

A ThoughtSpot Spotter Memory mostantól megőrzi az üzleti kontextust
Termékek és eszközök2026. szeptember 18. 17:09

A ThoughtSpot Spotter Memory mostantól megőrzi az üzleti kontextust

Általánosan elérhetővé vált a ThoughtSpot Spotter Memory, amely megőrzi az üzleti definíciókat és a visszatérő kérdések megválaszolásának módját. A vállalat szerint így…