A VAST natív lekérdezőmotorja már statisztikai elemzést is végez

A VAST AI OS 5.5 általános elérhetőségével a VAST Native Query Engine a vektorkeresés mellett natív aggregációs és statisztikai elemzést is támogat. A vállalat szerint az adatokat így közvetlenül azon a tárolási rétegen lehet elemezni, ahol már megtalálhatók.
- A VAST AI OS 5.5 több mint 50 új aggregációs és statisztikai függvényt hoz.
- A motor a vektorkeresést, a szűrést és az elemzést egy végrehajtási útvonalon kezeli.
- Az elemzés közvetlenül a VAST-ban tárolt adatokon futhat.
- A GROUP BY, a JOIN és több fejlettebb aggregáció még nem támogatott.
A vektorkereséstől az elemzésig
A VAST 2026. augusztus 6-i közlése szerint a VAST Native Query Engine eredetileg a VAST AI Operating System hyperscale vektortárolójában működő vektorkeresés végrehajtására szolgált. A motor egyetlen végrehajtási útvonalon egyesíti a hasonlósági keresést, a szűrést és a hozzáférés-vezérlést, miközben közvetlenül a VAST-ban tárolt adatokon dolgozik.
A VAST AI OS 5.5-tel ez a keretrendszer több mint 50 aggregációs és statisztikai függvénnyel bővült. A támogatott alapműveletek között szerepel a SUM, a MIN, a MAX, az AVG és a COUNT. Emellett elérhető többek között a variancia, a szórás, a ferdeség, a csúcsosság, a kovariancia és a korreláció számítása is.
A motor regressziós függvényeket, például a regr_slope és a regr_intercept műveletet, kvantilisbecslést, valamint olyan rendezett statisztikai műveleteket is kezel, mint a percentile_cont és a percentile_disc. Támogatja a logikai, feltételes és bitenkénti aggregációkat, továbbá a numerikai pontosság javítását célzó kompenzált összegzést, az fsum és favg függvényeket. Az SQL FILTER záradék segítségével feltételes aggregációk is megfogalmazhatók további feldolgozási lépések nélkül.
Elemzés adatmozgatás nélkül
A VAST szerint a modern adatarchitektúrákban az elemzés gyakran elkülönül a tárolástól. Az adatokat betöltik, átalakítják, majd olyan külső feldolgozómotorokkal kérdezik le, mint a Spark vagy a Trino. Ez adatmozgatással, munkafolyamatok összehangolásával, párhuzamos tárolással és az adatbetöltés, valamint az elemzés közötti késleltetéssel járhat.
A VAST Native Query Engine ezzel szemben közvetlenül azon a platformon hajtja végre az elemzési logikát, ahol az adatok találhatók. A vállalat DASE, vagyis Disaggregated Shared-Everything architektúrájára épülő motor a VAST állítása szerint globálisan fér hozzá az adatokhoz, azok átrendezése, újraparticionálása vagy másolása nélkül.
A kiadás fókusza az egyszeri bejárásra épülő aggregáció és statisztikai elemzés. A VAST nem teljes adattárházi SQL-kompatibilitást ígér, hanem a szűrésre, a vetítésre és az in-place adatokon végzett, egyetlen feldolgozási menetben végrehajtott aggregációra helyezi a hangsúlyt.
Közös útvonal a vektoros és strukturált adatoknak
Az új képességek egy végrehajtási folyamatban kapcsolják össze a vektoros hasonlósági keresést, a strukturált adatok elérését, valamint az aggregációt és a statisztikai elemzést. A VAST szerint ezek a műveletek hibrid keresésben is kombinálhatók.
Ennek gyakorlati példája, hogy a hasonlósági keresés eredményei közvetlenül szűrhetők és összesíthetők, így nincs szükség az adatok másik rendszerbe exportálására. Az elemzők egyetlen lekérdezési útvonalon kapcsolhatják össze a beágyazásokat, a metaadatokat és a mérőszámokat.
A vállalat a megoldást többféle munkaterületre szánja: folyamatosan érkező adatok valós idejű elemzésére, nagy adathalmazok metaadat- és katalóguslekérdezéseire, vektorkeresést strukturált mérőszámokkal kombináló AI-alapú vizsgálatokra, valamint élő adatokból működő operatív irányítópultokra.
A teljes SQL-lefedettség még nincs meg
A VAST Native Query Engine jelenlegi kiadásában még nem támogatott a GROUP BY, a DISTINCT és az ORDER BY aggregációkon belüli használata. Több aggregációs család, köztük a közelítő, hisztogram-alapú, súlyozott és listát előállító függvények szintén hiányzik.
A VAST szerint a GROUP BY, a DISTINCT, a JOIN és az aggregációkon belüli ORDER BY később érkezik, ahogy a közelítő függvények, a hisztogram-alapú aggregációk és a szélesebb SQL-lefedettség is. A mostani kiadás így azoknak a felhasználóknak lehet fontos, akik élő, helyben tárolt adatokon szeretnének vektorkeresést és célzott elemzést végezni külső feldolgozómotor vagy köztes adatpipeline nélkül.
VAST Data: Expanding the VAST Native Query Engine

