Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

LanceDB új világmodell-platformot és multimodális SQL-eszközt mutatott be

2026. szeptember 23. 23:38Forrás: LanceDB
LanceDB új világmodell-platformot és multimodális SQL-eszközt mutatott be
Kép: LanceDB

A LanceDB három új fejlesztést emelt ki legutóbbi hírlevelében: egy Lance-alapú, reprodukálható világmodell-kutatási platformot, a DuckDB multimodális SQL-integrációját és a vektorkeresés infrastruktúraköltségeinek összehasonlítását.

A lényeg röviden
  • A stable-worldmodel Lance-alapú, nyílt forráskódú platform világmodellek kutatásához.
  • A DuckDB-kiterjesztés egy táblában kezeli a képeket, embeddingeket és strukturált adatokat.
  • A LanceDB szerint 100 millió dokumentumnál a teljes havi költség körülbelül 779 dollár.
  • A tesztben 0,95 feletti recall@10 mellett 50 ezredmásodperc alatti p95 késleltetést mértek.
  • A vállalati frissítések elosztott keresést, indexelést és két szintű gyorsítótárat is érintenek.

Platform a világmodellek kutatásához

A stable-worldmodel nyílt forráskódú platform a világmodellek képzését és értékelését támogatja. A LanceDB szerint az ilyen rendszereknek nagy szekvenciapufferekből kell kis kötegekben, véletlenszerűen adatokat elérniük. Ez a munkaminta a HDF5- és videóformátumokkal, különösen hálózaton keresztül, gyengén teljesít.

A platform Lance-alapú adatrétege közvetlenül az Amazon S3-ból továbbítja az adatokat. A LanceDB állítása szerint ez az alternatíváknál többször gyorsabb, és lehetővé teszi az ideiglenes GPU-s tanítást helyi adatszinkronizálás nélkül.

A stable-worldmodel referencia-megvalósításokat tartalmaz a DINO-WM, a LeWorldModel, a PLDM és a TD-MPC2 módszerekhez. Emellett mintegy 150 környezetet kínál szabályozható vizuális és fizikai tényezőkkel. Ezek szabványosított, nulla előzetes tanulással végzett általánosítási teszteket tesznek lehetővé. A részletes módszertant és a mérési eredményeket a projekthez kapcsolódó tanulmány ismerteti.

Képek, vektorok és metaadatok egy SQL-táblában

A LanceDB DuckDB-hez készült Lance core kiterjesztése a multimodális adatok kezelését célozza. A LanceDB leírása szerint a rendszer egyesíti az embeddingek adatbázisát, a metaadatok SQL-raktárát és a képfájlok tárolását.

Az egyetlen táblában a képek bájtként, BLOB-oszlopban szerepelhetnek az embeddingek és a strukturált mezők mellett. A lance_vector_search() SQL-táblafüggvény rangsorolt találatokat ad vissza, a nyers JPEG-bájtokkal együtt. A további műveletekhez szabványos SQL használható, így a lekérdezésekben összekapcsolások, szűrések és aggregációk is alkalmazhatók.

A hírlevélhez kapcsolódó bemutató beállítási és lekérdezési példákat is ismertet.

Költségadatok a vektorkereséshez

A LanceDB az OpenSearch és saját rendszere vektorkeresési költségeit is összevetette. A vállalat szerint azoknál a megoldásoknál, amelyek memóriában tartják az indexet, a költség a RAM mennyiségével nő, ezért nagyobb adathalmazhoz nagyobb példány szükséges.

A LanceDB az indexet S3-ban tárolja, majd memóriatérképezéssel éri el. A cég szerint ebben a felállásban a memóriaigény a lekérdezések másodpercenkénti számához, vagyis a QPS-hez igazodik, nem közvetlenül az adathalmaz méretéhez.

A megadott példák alapján 100 millió, 1152 dimenziós, SQ8 formátumú dokumentumnál a teljes havi költség körülbelül 779 dollár, 10 milliónál 148 dollár, 1 milliónál pedig 65 dollár. A teljesítménymérést 287 ezer COCO-képen, SigLIP 2 embeddingekkel és IVF_HNSW_SQ indexszel végezték. A LanceDB közlése szerint 0,95 feletti recall@10 érték mellett egyetlen csomóponton 50 ezredmásodperc alatti p95 késleltetést mértek.

Vállalati és nyílt forráskódú fejlesztések

A LanceDB vállalati frissítései között szerepel a lap-határokhoz igazított olvasás-összevonás, amely csökkenti a gyorsítótárazott hozzáférések olvasási szórását. A szűrt lekérdezések KNN-végrehajtása közelebb kerülhet az adatokhoz, az IVF_RQ index pedig bekerült az elosztott indexelőbe.

A rendszer már támogatja az elosztott teljes szöveges keresést, a szegmentált indexépítést és a két szintű indexgyorsítótárat, amely memóriát és NVMe-lemezt használ. Új írás előtti napló, materializált nézetek, felhasználói táblafüggvény-nézetek, valamint sémamódosító API-k is megjelentek.

A Lance 6.0.0 és 7.0.0 közötti kiadásai többek között MemWAL-rendszert, szegmentált és elosztott indexépítést, SIMD-alapú távolságkernelokat és Java-kötéseket tartalmaznak. A LanceDB 0.32.0 és 0.33.0 verziók új vektortípusokat, natív teljes szöveges keresést és PyTorch DataLoader-kompatibilitást hoztak.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A LanceDB szerint gyors és versenyképes a Jev újrarangsoroló
Kutatás2026. október 1. 05:58

A LanceDB szerint gyors és versenyképes a Jev újrarangsoroló

A LanceDB öt adathalmazon hasonlította össze a Jev újrarangsorolót 19 konfigurációval. A vállalat szerint a Jev gyors és versenyképes, miközben a találatok relevanciáját…

A LanceDB szerint a Jev gyors és versenyképes reranker
Kutatás2026. október 1. 05:58

A LanceDB szerint a Jev gyors és versenyképes reranker

A LanceDB öt adathalmazon és 19, előre elkészített reranker-konfigurációval vetette össze a TypeSafe Jev modelljét. A vállalat szerint a Jev gyors és versenyképes…

A LanceDB DuckDB-integrációval és 1,5 millió IOPS-szal erősít
Fejlesztőknek2026. szeptember 23. 23:38

A LanceDB DuckDB-integrációval és 1,5 millió IOPS-szal erősít

A LanceDB DuckDB-kiterjesztése SQL-alapú vektoros, teljes szöveges és hibrid keresést tesz lehetővé Lance-adathalmazokon. A vállalat emellett több S3-bucketet átfogó…