Gyorsabb vektorkeresést és új AI-adatkezelési fejlesztéseket jelentett be a LanceDB

A LanceDB több, mesterséges intelligenciához kapcsolódó adatkezelési fejlesztést ismertetett: gyorsabb vektorkeresést, ByteDance-alapú infrastruktúrát és robotikai adatfolyamok kezelésére szolgáló megoldásokat. A vállalat szerint az új képességek a keresési késleltetést, az indexépítést és a multimodális adatok feldolgozását is javítják.
- A Multi-bit IVF_RQ 5 bites kódokkal 96,2 százalékos recall@10 értéket ér el.
- A LanceDB szerint a ByteDance hét napos modelltréning-folyamata egy napra rövidült.
- Az ArkClaw több mint 100 ezer lekérdezést kezel másodpercenként.
- A robotikai adatfolyamoknál 1,7 és 6,0-szor közötti véletlenszerű olvasási gyorsulást mértek.
- A Lance új kiadásai több indexelési, megfigyelési és adatkezelési funkciót hoznak.
Gyorsabb vektorkeresés finomítás nélkül
A LanceDB Multi-bit IVF_RQ megoldása a közlemény szerint 5 bites kódokkal 96,2 százalékos recall@10 értéket ér el, miközben a p99 késleltetés 2,6-szer alacsonyabb a finomítás nélküli IVF_PQ-hoz képest. A módszerhez nincs szükség a nyers, teljes pontosságú vektorok tárolására.
A vállalat új SIMD-kerneljei és gyors rotációs lépése a magonkénti átviteli teljesítményt 3,3-szorosára növeli. Az approx_mode paraméterrel a felhasználók lekérdezésenként állíthatják be a pontosság és a késleltetés egyensúlyát. A rendszer gyors, normál és pontos módot kínál ugyanazon index használata mellett.
A ByteDance infrastruktúrája Lance-re épül
A LanceDB esettanulmánya szerint a ByteDance Volcano Engine elosztott indexépítésre cserélte az egyetlen csomóponton futó IVFPQ-tréninget. A korábbi folyamat több mint 500 GB memóriát és több napot igényelt, az új megközelítés pedig a Lance-fragmentumok között osztja szét a munkát.
A vállalat állítása szerint a modelltréninghez kapcsolódó, hét napos folyamat egy napra rövidült, miközben a GPU-k kihasználtsága elérte a 95 százalékot. A bináris másolásos tömörítés elkerüli a dekódolást és az újrakódolást is, így 5 millió soros táblák esetében a tömörítési idő 418 másodpercről 15 másodpercre csökkent.
Az ArkClaw, a Volcano Engine által kezelt OpenClaw-telepítés, a LanceDB szerint a memory-lancedb-ultra rendszert használja. Ez 100 ezernél több lekérdezést kezel másodpercenként, teljes szöveges és vektoros keresést kombinál, a GitforMemory pedig a Lance natív elágazási API-jára épülő ügynökmemória-elágazást biztosít.
Robotikai adatok, videók és új vállalati funkciók
A China Merchants Lion Rock AI Lab a Lance-re építette át robotikai adatfolyamát. Egyetlen táblasorban kezeli a 100 Hz-es robotkar-állapotokat, a többkamerás videófolyamokat és a képkockánkénti annotációkat. A hosszú videókat GOP-méretű blokkokra vágják, így megmarad a videószintű tömörítés, miközben a képkockák véletlenszerű elérése a teljes videó dekódolása nélkül is lehetséges.
Az eredmény a közlemény szerint a LeRobothoz képest 1,7 és 6,0-szor közötti gyorsulás a véletlenszerű olvasásoknál, valamint körülbelül 42 százalékos tárhelymegtakarítás. A gyűjtés, a feldolgozás és a tréning ugyanarról az S3-másolatról olvas és arra ír, így elmarad a csomagolás, feltöltés, letöltés és újrafeltöltés láncolata.
A vállalati kiadások között szerepel a háttérfeladatok egységes kezelése, a táblaverziók előzménynézete, valamint a saját felhőtárhely használatának lehetősége. A Lance v8.0.0 és v9.0.0 kiadásai többek között alapértelmezetté teszik az FTS v2 indexformátumot, támogatják a nagy adathalmazok streaming IVF k-means tréningjét, és a LanceDB 0.34.0 és 0.36.0 közötti verziói OAuth-hitelesítést is bevezetnek a LanceDB Cloudhoz.


