A LanceDB robotokat és tízmilliárdos vektorkeresést mutatott be

A LeRobot mostantól natívan képes Lance-adatkészleteket olvasni, így a robotok tanítása közvetlenül az objektumtárolóból töltheti be a képkockákat. A LanceDB szeptemberi hírlevelében a fizikai mesterséges intelligencia adatbányászatáról és a tízmilliárd vektoros keresés teljesítményéről is közölt eredményeket.
- A LeRobot natívan olvassa a Lance-adatkészleteket.
- A DROID tesztjén 10 ezer SmolVLA-lépés 1 óra 27 percig tartott 8 H100 GPU-val.
- A RaBitQ 96,2 százalékos visszakeresést ért el 10 millió vektoron.
- 10 milliárd vektornál az elosztott keresés p50 késleltetése 18,05 ezredmásodperc volt.
- Megjelent a Lance 12.0.0 és a LanceDB 0.39.0.
Gyorsabb robottréning közvetlenül az objektumtárolóból
A LanceDB október 8-án közzétett hírlevele szerint a LeRobot már natívan olvassa a Lance-adatkészleteket. A tréning így közvetlenül az objektumtárolóból húzhatja be a képkockákat, valódi globális keveréssel, letöltés nélkül.
A DROID teljes, 27,6 millió képkockát és 369 GB adatot tartalmazó készletén 8 H100 grafikus processzorral 10 ezer SmolVLA-lépés 1 óra 27 percig tartott. A standard olvasó, helyi NVMe-másolaton használva, ugyanezt 2 óra alatt végezte el, azonos veszteségérték mellett. A grafikus processzorok az adatokra várakozva az idő 1,7 százalékát töltötték, szemben a standard megoldás 37,4 százalékával.
A ritka hibák keresése a flották adataiban
A LanceDB egy fizikai mesterséges intelligenciával kapcsolatos adatbányászati példát is bemutatott. A vállalat szerint a flottanaplók ritka hibái gyakran az adatok hosszú eloszlási farkában rejtőznek, a megtalálásukhoz szükséges jel pedig sokszor nem eleve meglévő oszlopként szerepel.
Lei Xu példájában egyetlen LanceDB-táblán vezetik le az is_left_turn értéket az elfordulási sebességből és a sebességből, majd Faster R-CNN detektorral megszámolják a gyalogosokat az egyes klipekben. Ezután klipbeágyazásokon futtatnak vektorkeresést, amelyet város, óra, kanyarodás és a gyalogosok száma szerint szűrnek.
A módszer a forrás szerint arra szolgál, hogy a fizikai rendszerek adataiban olyan ritka esetek is kereshetővé váljanak, amelyekhez nem tartozik közvetlenül használható, előre rögzített címke.
Tízmilliárd vektoron is skálázódik a keresés
A LanceDB a vektorkeresés skálázásáról is közölt mérési adatokat. Ötmارت bites RaBitQ-val 10 millió, egyenként 768 dimenziós vektoron 96,2 százalékos visszakeresési arányt és 1614 lekérdezést ért el másodpercenként. A PQ384 ugyanezen a teszten 91,5 százalékos visszakeresést és 1047 lekérdezést adott.
A 10 milliárd vektort tartalmazó tesztnél az elosztott keresés p50 késleltetése 18,05 ezredmásodperc volt, 256 párhuzamos kérés mellett pedig 1066 lekérdezést kezelt másodpercenként. Az egypites távolságkorlát a teljes pontozás előtt a jelöltek több mint 99 százalékát kiszűrte.
A lekérdezés közben a gyors és a normál mód közötti váltás index-újraépítés nélkül 75,0 százalékról 93,1 százalékra emelte a visszakeresési arányt. A LanceDB emellett közölte, hogy megjelent a Lance 12.0.0 és a LanceDB 0.39.0 verziója, többek között vektorkeresési, teljes szöveges keresési, munkakezelési és Python API-fejlesztésekkel.
Mit kapnak a felhasználók az új kiadásokkal?
A frissítések a LanceDB közlése alapján a robotikai tréninghez, a flottadatok elemzéséhez és a nagy méretű vektorindexek kereséséhez adnak új lehetőségeket. Az Enterprise-változatban többek között szüneteltethető és folytatható a hosszú indexépítés vagy tömörítés, a függvények titkos kulcsokat köthetnek környezeti változókhoz, és SQL-ből is elérhetővé vált a vektorok közeli duplikátumainak keresése.
A közlemény szerint a LeRobot támogatása a közvetlen objektumtárolós adateléréssel csökkentheti az adatbetöltés miatti várakozást a bemutatott tréningen. A nagy léptékű keresési mérések pedig azt szemléltetik, hogy a vállalat saját tesztjeiben a vektorkeresés 10 milliárd elemig elosztott környezetben is működött.
LanceDB: 🤖 LeRobot Trains on Lance, ⛏️ Mining Physical AI's Long Tail, 🔍 Vector Search at 10B Scale


