Az Ironclad 60 százalékkal csökkentette lakehouse-rendszerének számítási költségét

Az Ironclad olyan élesben működő lakehouse-rendszert épített Apache Iceberg és Snowflake Horizon Catalog használatával, amely egyetlen, szabályozott adatpéldányból szolgálja ki az ügyfeleket, a külső eszközöket és a belső elemzéseket. A vállalat szerint célzott optimalizálásokkal 60 százalékkal csökkentették a számítási költséget, miközben a frissesség és a megbízhatóság változatlan maradt.
- Az Ironclad egyetlen, szabályozott Iceberg-adatpéldányt használ több fogyasztói csoport kiszolgálására.
- A vállalat szerint 60 százalékkal csökkentette a számítási költséget.
- A Snowflake Horizon Catalog központi hozzáférés-szabályozást és adatszármazás-követést biztosít.
- Az ügyfelek élő, olvasási hozzáférést kapnak saját Snowflake-fiókjukból.
- A rendszer külső motorok, köztük Spark, Flink, Trino és DuckDB számára is elérhető.
Egy közös adatpéldány több felhasználási módhoz
Az Ironclad szeptember 15-én közzétett mérnöki beszámolója szerint a rendszer a korábban elkülönülő, ügyfelenkénti adatfolyamok helyett egyetlen egységes platformra épül. Az ügyfelek közvetlenül, élő vagy közel valós idejű adatokhoz férnek hozzá, a külső eszközök a Horizon nyílt Iceberg REST-végpontján keresztül olvashatnak és írhatnak, a belső elemzések pedig közvetlenül a lakehouse Silver tábláit használják.
Az ügyfelek Snowflake Secure Data Sharing segítségével kérdezhetik le saját Ironclad-adataikat a saját Snowflake-fiókjukból. A megosztás olvasási műveletként, közvetlenül történik, ezért nincs szükség ügyfelenkénti exportokra, frissítési feladatokra vagy külön kinyert példányokra. A hozzáférési elkülönítést lekérdezési időben érvényesítik, az ügyfél felvétele pedig egy jogosultsági változtatásra korlátozódik.
Apache Iceberg és Horizon Catalog
A rendszer adatútja PostgreSQL-változáskövetéssel indul. A Datastream a módosításokat Avro formátumban, felhős objektumtárolóba, a Google Cloud Storage-be írja. A Bronze réteg Iceberg-tábláit a Snowpipe automatikus betöltése tölti fel, a Silver rétegben pedig Snowflake-feladatok futtatják a MERGE műveleteket, hogy az üzleti logikának megfelelő aktuális állapot álljon elő.
Az Ironclad a később tervezett Gold rétegben összesítéseket, mérőszámokat és gépi tanulási, illetve mesterségesintelligencia-funkciókhoz használható adatkészleteket alakítana ki. Ezeket nem feltétlenül kell Snowflake-ben létrehozni, mivel a Silver táblák az Iceberg nyílt REST-protokollján keresztül más feldolgozó motorok számára is elérhetők.
Az Iceberg a nyílt táblaszabványt biztosítja, a Horizon Catalog pedig az egységes metaadatréteget. A katalógus kezeli többek között a táblaverziókat és pillanatképeket, az egyidejű írások összehangolását, a hozzáférési szabályokat és az adatszármazást. A Horizon ideiglenes, korlátozott hatókörű tárolási hitelesítő adatokat ad ki a Snowflake-szerepkörök alapján.
Mit jelent ez a felhasználóknak és az üzemeltetésnek?
Az ügyfelek a saját adataikat folyamatosan frissülő állapotban érhetik el, ütemezett exportok és ügyfelenkénti frissítési feladatok nélkül. A nem Snowflake-alapú felhasználók menedzselt hozzáférési tokennel csatlakozhatnak bármely olyan eszközből, amely támogatja a nyílt Iceberg REST Catalog protokollt.
A Horizon Catalogon keresztül más motorok, köztük a Spark, a Flink, a Trino és a DuckDB is olvashatják és írhatják ugyanazokat a táblákat. Az Ironclad a BigQuery BigLake-en keresztüli használatát jelenleg vizsgálja. A beszámoló szerint a nyitott formátum több motor választását teszi lehetővé, miközben a szabályozás és az adatszármazás központi marad.
A megoldásnak üzemeltetési ára is van: az Iceberg verzió- és pillanatkép-kezelést, a kis fájlok tömörítését, valamint külön metaadatkatalógust igényel. Az Ironclad szerint ezeket automatizálással és monitorozással kezelhetővé tették, miközben az optimalizálások révén a számítási költség 60 százalékkal mérséklődött.


