LanceDB: új AI-adatkezelési útmutató és fejlesztések érkeztek

A LanceDB új AI-adatkezelési útmutatót és több vállalati fejlesztést tett közzé, miközben bemutatta a november 5-i Reverie szakmai csúcstalálkozó programját. A vállalat a CrewAI memória-rendszerének LanceDB-re épített átalakításáról is beszámolt.
- A Reverie AI-csúcstalálkozót november 5-én rendezik meg San Franciscóban.
- A CrewAI egyetlen LanceDB-táblára építette át ügynökmemória-rendszerét.
- A CrewAI megoldása 12 millió havi letöltést és több mint 2 milliárd ügynökfuttatást támogat.
- Új SQL-funkciók, materializált nézetek és számított oszlopok érkeztek a vállalati kiadásba.
- A Lance és LanceDB nyílt forráskódú kiadásai keresési, adatbetöltési és indexelési fejlesztéseket kaptak.
Novemberben rendezik meg a Reverie konferenciát
A LanceDB által szervezett Reverie egynapos technikai csúcstalálkozó lesz november 5-én San Franciscóban. A rendezvény azokat a kutatókat és mérnököket célozza, akik világmodellek, generatív videó, fizikai mesterséges intelligencia, multimodális keresés és ügynökalapú kutatás adatkezelési rendszerein dolgoznak.
A programban az NVIDIA, a Runway, a Luma, az Applied Intuition, a Cruise, az Adobe és az Exa előadói is szerepelnek. A LanceDB szerint a résztvevők a nagy teljesítményű generatív modellek és más fejlett AI-rendszerek mögött álló adatrendszerekről beszélnek majd. A konferenciára jelentkezni lehet.
A CrewAI egyetlen LanceDB-táblára építette át az ügynökmemóriát
A CrewAI korábban két rendszerből álló memóriaarchitektúrát használt, ezt egyetlen LanceDB-táblára cserélte. A tábla vektorokat, metaadatokat és multimodális adatokat is együtt tárol. A rendszer az emlékeket hasonlóság, frissesség és fontosság alapján rangsorolja, így a régebbi, de kritikus döntések is előrébb kerülhetnek a kevésbé fontos, újabb információknál.
A LanceDB hírlevele szerint a megoldás jelenleg a CrewAI alapértelmezett vektoros háttérrendszere. A CrewAI havonta 12 millió letöltést kezel, a rendszer pedig több mint 2 milliárd ügynökfuttatást támogatott.
A LanceDB egy adatbetöltési útmutatót is közzétett gépi tanulási és mesterségesintelligencia-rendszerekhez. Az anyag szerint a GPU-s tanítási teljesítményét gyakran nem a bemeneti és kimeneti műveletek korlátozzák, hanem a CPU-s feldolgozási szakasz. Ilyen feladat a JPEG-képek dekódolása és a tokenizálás, amelyek egy nagy teljesítményű adatfeldolgozási folyamatban is torlódást okozhatnak. Az útmutató egy háromlépcsős modellt, PyTorch- és LanceDB-gyakorlati tanácsokat, valamint konkrét mérési adatokat ismertet, köztük 16 ezer token/másodpercet egy L40S GPU esetében és magonként 1 GB/másodperces értéket.
Vállalati kiadás: gyorsabb műveletek és új SQL-funkciók
A LanceDB vállalati frissítései között szerepel a feladatonkénti ideiglenes tárhely használata a takarítási folyamatokban. Egy 604 rekordos mérésben a korábbi vizsgálat körülbelül 600 szekvenciális tárhelyolvasást igényelt, és 15,2 másodpercet tett ki a teljes 26,3 másodpercből. Ez az idő 58 százaléknak felelt meg.
A WAL-csomópontoknál a saját manifeszt-gyorsítótár újrahasználata 132-ről 12-re csökkentette egy kiürítési művelet tárhelyigényeit. A WAL-tömörítésben az SSTable-fájlok párhuzamos lekérése egy nyolcfájlos menet idejét 1,6 másodpercről 0,4 másodpercre, egy 32 fájlos menetét pedig 6,4 másodpercről 1,6 másodpercre mérsékelte az alapértelmezett párhuzamosság mellett.
Az SQL most már támogatja a materializált nézetek létrehozását, frissítését és megjelenítését, továbbá a Python-függvényként regisztrált számított oszlopokat. A felhasználók SQL-ből táblát is klónozhatnak legfrissebb verzió, konkrét verzió, címke vagy időbélyeg alapján, az alapul szolgáló adatok másolása nélkül. Új lineage nézet mutatja az oszlopok eredetét és a kapcsolódó Feature Engineering-feladatokat, a TABLESAMPLE pedig sor- és teljes fragmentumszintű mintavételt tesz lehetővé.
Nyílt forráskódú kiadások és közösségi hozzájárulások
A Lance 3.0.2 és 11.0.0 közötti kiadásaiban az ACORN-1 bejárás bizonyos szűrt HNSW-kereséseknél a legrosszabb esetben 10 és 250 közötti gyorsulást hozhat, legfeljebb 4 pontnyi visszakeresési pontosság mellett. Az új MAXSCORE algoritmus tisztán SHOULD feltételekből álló teljes szöveges kereséseknél a jelöltek vizsgálatát a tesztekben akár 53,6-szorosára csökkentette.
A LanceDB 0.37.1 és 0.38.0 közötti klienskiadásai materializált nézeteket, SQL-ben definiált számított oszlopokat és új függvénykeretrendszert kaptak. A streaming adathalmazoknál megjelent a visszaterhelés kezelése, az adatbetöltő pedig távoli táblákat is tud olvasni rögzített alaptábla-verzió mellett.
A fejlesztésekhez a Netflix, a ByteDance, az Adobe, az Intel, a Microsoft, a Pinterest és a Huawei közreműködői is hozzájárultak. A LanceDB ezek között Java SDK-s gyorsítótár-bővítést, tömörítési korlátokat, Arrow-kompatibilis adatfolyam-exportot és biztonsági javítást sorolt fel.


