Az OpenAI tárhelyplatformja már másodpercenként 70 millió kérést kezel
Az OpenAI Habitat nevű online tárhelyplatformja másodpercenként több mint 70 millió kérést kezel, és több mint 500 petabájtnyi adatot szolgál ki. A rendszer a vállalat termékeit használó, hetente több mint egymilliárd ember kiszolgálását támogatja közel 40 földrajzi régióban.
- A Habitat másodpercenként több mint 70 millió kérést kezel.
- A platform több mint 500 petabájtnyi adatot szolgál ki.
- A rendszer hetente több mint egymilliárd ember által használt OpenAI-termékeket támogat.
- A Habitat 2025 közepére klienskönyvtárból önálló szolgáltatássá alakult.
- Az OpenAI a Python használatát rövid távú technikai kompromisszumként kezelte.
Egy egyszerű Python-könyvtárból elosztott rendszer lett
Az OpenAI szerint minden terméke gyors és megbízható adatelérést igényel. Egy felhasználói bejelentkezés, a Codex beállításainak ellenőrzése vagy egy új ChatGPT-beszélgetés indítása is számos különálló adatlekéréssel járhat. Ha ezek lassúak, a termék is lassabbnak érződik, ha pedig meghiúsulnak, a szolgáltatás működése is leállhat.
A Habitatot azért építették, hogy az OpenAI termékei gyorsan és megbízhatóan férjenek hozzá a szükséges információkhoz. A platform 2023-ban, a DevDay rendezvényen indult a GPT-k támogatására. Kezdetben egy egyszerű Python-klienskönyvtár volt, amely a ChatGPT fő szerveréhez és egy adatbázishoz kapcsolódott.
A Habitat ma már összetett, elosztott rendszer. Hetente több mint egymilliárd ember által használt termékeket támogat, közel 40 régióban működik, és több mint 500 petabájtnyi adatot szolgál ki. Az OpenAI közlése szerint az elmúlt három évben a rendszer évente több mint tízszeresére nőtt.
A platformot központi szolgáltatássá alakították
A Habitat eredeti célja az volt, hogy a termékfejlesztőknek ne kelljen adatbázis-kezeléssel foglalkozniuk. A könyvtár kezelte többek között a séma felderítését, az útválasztást, a jogosultságokat, a titkosítást, a szerializálást, a kérések előkészítését és a kapcsolatkezelést. A fejlesztőknek azt sem kellett tudniuk, hogy az adat Azure Cosmos DB-ből, gyorsítótárból vagy más tárolórendszerből érkezik.
2025 közepére azonban a kliensoldali megoldás elérte a korlátait. A Habitat összetettebbé vált, miközben az OpenAI szolgáltatásainak száma is nőtt. Egy-egy módosítás telepítését több tucat szolgáltatással és fejlesztőcsapattal kellett összehangolni, ami napokig tartott, és működési hibákhoz vezethetett.
Az OpenAI ezért önálló szolgáltatássá alakította a Habitate-et. Így a telepítések, a megfigyelhetőség és a platform fejlesztései egyetlen központi helyről kezelhetők. A vállalat szerint ez lehetővé teszi, hogy a módosítások az összes OpenAI-termékhez központilag eljussanak. A szolgáltatás központi ellenőrzési pontként hozzáférési szabályokat, naplózást és az alapul szolgáló tárolókhoz való hozzáférést is kezelhet.
A Python használata kompromisszumot jelentett
Az OpenAI a szolgáltatássá alakításkor nem váltott le azonnal a Pythonról, annak ellenére sem, hogy a nyelv használata hálózati késleltetést és magasabb processzor-, illetve memóriaigényt okozott a helyi könyvtárfuttatáshoz képest. A vállalat úgy ítélte meg, hogy rövid távon fontosabb a termékfejlesztők akadályainak elhárítása és a platform stabilizálása, mint az erőforrás-hatékonyság optimalizálása.
Az OpenAI ezt tudatos technikai adósságként kezelte. A vállalat arra számított, hogy később a Codex és a GPT modellek megkönnyítik a Pythonról való átállást, és közlése szerint ez a várakozás beigazolódott.
A nagy terhelés mellett a legfontosabb kihívás a késleltetés szélsőértékeinek kezelése lett. Egy átlagos felhasználói kérés több száz adatbázis-hívást is eredményezhet, ezért a leglassabb hívás határozhatja meg a felhasználó által érzékelt sebességet. Az asyncio lehetővé teszi az I/O-műveletek párhuzamos kezelését, de nem biztosít CPU-párhuzamosságot a Python GIL-je miatt. A Habitat közben útválasztást, tömörítést, titkosítást, ellenőrzőösszegek számítását, háttérfeladatokat és egyéb CPU-igényes műveleteket is végez, amelyek növelhetik a késleltetést.
