Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A dbt Semantic Layer megbízhatóbb válaszokat adott az AI-ügynököknek

2026. szeptember 24. 19:38Forrás: Fivetran
A dbt Semantic Layer megbízhatóbb válaszokat adott az AI-ügynököknek
Kép: Fivetran

A dbt Semantic Layer bizonyult a legmegbízhatóbb és legolcsóbb interfésznek egy Fivetran által végzett tesztben, amelyben két AI-modell ugyanazokra az üzleti kérdésekre válaszolt. A vizsgálat szerint az adatok szabályozott elérése legalább olyan fontos lehet, mint maga a választott modell.

A lényeg röviden
  • A Fivetran öt dbt-interfészt hasonlított össze két Claude-modellel.
  • A dokumentáció kötelező elolvasása megszüntette a Haiku szemcseméretből eredő hibáját.
  • A Semantic Layer mindkét modellnél nulla hibás választ adott a join kérdésekre.
  • A Haiku Semantic Layerrel körülbelül 0,02 dollárból és 3,4 fordulóból válaszolt.
  • A Semantic Layer nem javította ki a Haiku okozati következtetési hibáit.

Ugyanaz a kérdés, két eltérő válasz

A Fivetran 2026. szeptember 24-én közzétett elemzésében két AI-ügynököt tett próbára ugyanazon a négy demó kiskereskedelmi táblán. A kérdés az volt, mekkora a teljes bevétel. A Haiku a tételsorokat adta össze, az Opus viszont előbb az orders táblát vizsgálta, és kihagyta a törölt rendeléseket. Utóbbi ezt meg is indokolta.

A probléma az volt, hogy egyik ügynök sem kérdezett vissza arra, számítanak-e a törölt rendelések. Így ugyanarra az egyszerű, természetes nyelvű kérdésre két magabiztos válasz született, miközben a felület nem jelezte, melyik üzleti szabályt kell alkalmazni.

A Fivetran ezt követően öt különböző interfészt hasonlított össze ugyanabból a dbt-projektből. A tesztben Claude Haiku 4.5 és Claude Opus 5 futott minden kérdésen háromszor DuckDB-n, a Semantic Layert pedig Snowflake-en is kipróbálták.

A dokumentáció kijavított egy számítási hibát

A vizsgálat 25, több táblát érintő join kérdést tartalmazott az orders, line items, customers és products adataival. Ezek között szerepeltek szemcsemérettel és többszöröződő sorokkal kapcsolatos csapdák, valamint két olyan kérdés, amelyre az adatok alapján nem lehetett válaszolni. Mind az öt interfész helyesen utasította el ezt a két kérdést.

A Haiku nyers SQL használatakor négyszer hibázott. Az egyik hibában az átlagos rendelési értéket az egyes tételsorokból számolta ki, ezért 255,33 dollárt adott a helyes, 512,03 dolláros rendelési szintű átlag helyett. A hibát mindhárom ismétlésben elkövette, és nem jelezte a bizonytalanságát.

Amikor az ügynöknek kötelezően el kellett olvasnia a dbt dokumentációját az Agents Schema vagy a manifest eszközein keresztül, a hiba eltűnt. Ezeken az interfészeken 150 futás alatt egyetlen rossz válasz sem született. A dokumentáció puszta elérhetővé tétele viszont nem volt elég: a Haiku átlagosan mindössze 0,09 alkalommal olvasta el futásonként, és a hibát csak az esetek egyikében javította.

A Semantic Layer az üzleti szabályokat is rögzítette

Az Opus más okból hibázott. A nyers SQL-es tesztekben 11 alkalommal hagyta ki a törölt rendeléseket a teljes bevétel, az elektronikai bevétel vagy az átlagos rendelési érték számításából. Bár ezt jelezte, a válaszok nem egyeztek a tesztben meghatározott metrikával.

Az Agents Schema kötelező használata sem oldotta meg teljesen a problémát. Az Opus a teljes bevételnél és az elektronikai bevételnél is a futások kétharmadában kihagyta a törléseket. A Semantic Layer ezzel szemben egyszer, a total_revenue nevű szabályozott metrikában rögzítette a definíciót. Ezen az interfészen az Opus 75 futásból egyszer sem adott rossz választ.

A Fivetran szerint a Semantic Layer mindkét modellnél nulla hibás választ eredményezett a join kérdésekben, és mindkettőnél ez volt a legalacsonyabb költségű megoldás a megbízható válaszokra. A „miért” típusú kérdéseknél azonban nem szüntette meg a Haiku következtetési hibáit. A modell gyakran azt a tényezőt választotta, amelyik látványosabban változott, nem pedig azt, amely ténylegesen mozgatta a metrikát.

A Semantic Layer ugyanakkor az adatok lekérésének költségét csökkentette. A Haiku átlagosan 3,4 fordulóban jutott válaszhoz, futásonként körülbelül 0,02 dollárért. A többi interfészen 13 és 17 közötti fordulót használt, futásonként legfeljebb 0,20 dolláros költséggel. A Fivetran következtetése szerint az AI-ügynököknek szánt adathozzáférésnél a szabályok kikényszerítése és a metrikák egységes definíciója a modellválasztással egyenrangú szempont lehet.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A jogi szakmában már minden második szakember használ generatív AI-t
Kutatás2026. október 3. 10:27

A jogi szakmában már minden második szakember használ generatív AI-t

A jogi szakemberek 49 százaléka már aktívan használ generatív AI-t a munkájában, derül ki az Everlaw, az ACEDS és az ILTA közös jelentéséből. A technológia egyre…

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása
Kutatás2026. október 2. 20:01

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása

A promptok gyorsítótárazása csökkentheti az ismétlődő bemenetek feldolgozásának költségét, de az Arize AI tesztje szerint a magas cache újraolvasási arány önmagában nem…

A CoreWeave bemutatta az ARIA kutatási és iterációs ügynököt
Termékek és eszközök2026. október 2. 19:23

A CoreWeave bemutatta az ARIA kutatási és iterációs ügynököt

Általánosan elérhetővé vált a CoreWeave ARIA, egy kutatási és iterációs AI-ügynök, amely a CoreWeave Forge részeként segít modellek és AI-ügynökök fejlesztésében. Az…