A Google Cloud új eszközökkel skálázza az agentikus AI-infrastruktúrát

A Google Cloud szeptemberben több új infrastruktúra- és vezérlési funkciót mutatott be az agentikus AI-munkafolyamatok skálázására. A fejlesztések a Google Kubernetes Engine-t, a tárolást, az adatbázisokat és a több régiót átfogó következtetési feladatokat is érintik.
- A GKE Agent Substrate a Google szerint tízszer nagyobb sűrűséget kínál a hagyományos konténeres futtatókörnyezeteknél.
- A GKE Pod snapshots belső tesztekben akár 89 százalékkal csökkentette az AI-következtetés indítási idejét.
- Az M4N gépek akár 25 000 MiB/s tárhelyteljesítményt és 1 millió IOPS-ot kínálnak.
- A GKE agentic migration AWS EKS-ről GKE-re támogatja az AI-asszisztált átállást.
- A SeaVerse a Google szerint 60 százalékkal csökkentette infrastruktúraköltségeit a GKE Agent Sandbox használatával.
Nagyobb sűrűség és gyorsabb skálázás a GKE-ben
A Google Cloud szeptember 30-i összefoglalója szerint a GKE Agent Substrate nevű, nyílt forráskódú futtatási környezetet agentikus munkaterhelésekhez tervezték. A vállalat állítása alapján a rendszer a hagyományos konténeres futtatókörnyezetekhez képest tízszer nagyobb sűrűséggel képes több millió sandbox futtatására.
Az Agent Substrate 500 ezredmásodperc alatti felfüggesztésből való visszatérést kínál, másodpercenként több mint 500 aktiválás mellett. A megoldás natív, zéró bizalmi kernelt és hálózati elkülönítést is tartalmaz.
A GKE beépített, nullára skálázási képességet is kapott. A Google szerint a Horizontal Pod Autoscaler, az Autoscaling Metric és a KEP-2021 támogatása automatikusan segíti a munkaterhelések leállítását, amikor nincs szükség kapacitásra. A skálázás immár egyedi PromQL-metrikák alapján is vezérelhető.
A GKE Pod snapshots funkció a futó munkaterhelések állapotát, a CPU- és GPU-memóriát is beleértve, menti és igény szerint visszaállítja. A Google belső tesztjei szerint ez akár 89 százalékkal csökkentheti az AI-következtetés indítási idejét.
Migráció AWS-ről és eszközök megerősítéses tanuláshoz
A Google Cloud elindította a GKE agentic migration eszközt is. Ez egy célzott ügynökbővítmény, amely AI-alapú migrációs folyamatban fordítja le az AWS EKS infrastruktúrakódját és Kubernetes-manifesztjeit GKE-környezetekre. A folyamatot determinisztikus védőkorlátokkal egészítették ki.
A megerősítéses tanulási feladatokhoz a GKE Agent Sandbox, az Agent Sandbox RL orchestration SDK, valamint több népszerű RL-környezethez és vezérlőeszközhöz készült natív integráció vált általánosan elérhetővé. A Google szerint ezek a megoldások olyan helyzetekre készültek, amikor tízezres nagyságrendben futnak párhuzamos próbálkozások, és az infrastruktúra szűk keresztmetszetei, például a kihasználatlan gyorsítók vagy a túlterhelt vezérlősík, problémát okoznak.
Új tárolási és számítási lehetőségek AI-munkafolyamatokhoz
A Filestore agent volumes nagy teljesítményű, rugalmas és tartós fájltárolót kínál agentikus munkaterhelésekhez. A GKE Agent Substrate és a GKE Agent Sandbox integrációjának köszönhetően a szolgáltatás a Google szerint ezredmásodpercek alatt automatikusan elkülönített fájl-munkaterületet oszt ki és csatol a sandboxokhoz.
Általánosan elérhetővé vált az M4N virtuálisgép-család is, amelyet a Google generatív AI- és RAG-adatrétegekhez, többek között Milvus, Pinecone, Qdrant, Vespa és Redis használatához ajánl. Hyperdisk Extreme meghajtókkal az M4N akár 25 000 MiB/s, vagyis 25 GiB/s összesített tárhelyteljesítményt és akár 1 millió IOPS-ot kínál.
A Compute Engine Z4D szintén általánosan elérhető. Bare metal konfigurációban a géptípus helyi SSD-kapacitást és alacsony késleltetést biztosít az agentikus mikrovirtuális gépekhez, így a Google szerint gépenként több ezer elkülönített sandbox futtatható.
Az AlloyDB for PostgreSQL új változata a Colossus elosztott fájlrendszert és a Jupiter hálózatot használja egy új adatbázis-architektúrában. A Storage Intelligence advisor új verziója közben a tárolókészletek áttekintését, a kötegelt műveletek pedig a tárolási osztályok, metaadatok, címkék, megőrzési szabályok és titkosítás tömeges módosítását támogatják.
Globális következtetés és felhasználói hatás
A többklaszteres GKE Inference Gateway a Google bemutatója szerint több régió között osztja el a forgalmat, és magas rendelkezésre állást céloz. Az alatta működő LLM-d router memóriaérzékeny ütemezési algoritmusokat használ. A Google tesztjeiben ez az architektúra a forgalomirányítás miatt 1 százaléknál kisebb többletterhelést okozott.
A fejlesztések a Google Cloud ügyfelei számára elsősorban az agentikus munkaterhelések elkülönítését, gyorsabb indítását és rugalmasabb skálázását célozzák. A vállalat példaként a SeaVerse játékstartupot említi, amely GKE Agent Sandboxra támaszkodik több bérlős munkaterheléseihez, és a Google szerint 60 százalékkal csökkentette infrastruktúraköltségeit.
Google Cloud: What’s new in AI infrastructure and orchestration in September


