Saját AI-inferenciafürt indítható a Vultron a Modelplane-nel

A Modelplane v0.3 verziója támogatja a Vultr Kubernetes Engine-t, így a felhasználók rövid YAML-manifesztből hozhatnak létre GPU-s inferenciafürtöt. A nyílt forráskódú vezérlősík az Anthropic Messages API-t is kiszolgálja, ezért Claude Code is használható saját Vultr-fürtön futó modellel.
- A Modelplane v0.3 támogatja a Vultr Kubernetes Engine-t.
- GPU-s inferenciafürt hozható létre YAML-manifesztből.
- A rendszer felépíti a VPC-t, a vezérlősíkot és a GPU-node poolt.
- A modelltelepítési manifeszt több szolgáltatónál is használható.
- A Claude Code Anthropic Messages API-n keresztül saját Vultr-fürtön futó modellhez kapcsolható.
YAML-manifesztből épül fel a teljes fürt
A Vultr szeptember 3-i közleménye szerint a Vultr Kubernetes Engine, röviden VKE, a Modelplane támogatott inferenciaszolgáltatói közé került. A Modelplane nyílt forráskódú vezérlősík AI-modellekhez, amely a modelleket, a futtatómotorokat, a felhőszolgáltatókat és a gyorsítókat egy közösen üzemeltethető rendszerként kezeli.
A Modelplane v0.3 kiadásában egy rövid YAML-manifesztben adható meg a Vultron létrehozandó GPU-fürt. A konfiguráció tartalmazza a régiót, a node poolt, a példányosztályt, valamint a minimális és maximális csomópontszámot, amelyek között a rendszer skálázhat.
A platform ezt követően felépíti a kiszolgálási környezetet. Ide tartozik a virtuális privát felhő, a vezérlősík, a rendszer- és GPU-node pool, valamint az ezekre épülő inferenciaréteg. A modell telepítéséhez újabb manifeszt szükséges, amely a Vultr mellett más támogatott szolgáltatóknál is használható.
A modelltelepítés elválik az infrastruktúrától
A Modelplane szolgáltatói modellje egységes erőforrás-leírásokra épül. Egy erőforrás a hardvert írja le, egy másik annak létrehozását végzi, a node pool felépítése pedig a különböző szolgáltatóknál is azonos marad. A Vultr így a Google Kubernetes Engine, az Amazon Elastic Kubernetes Service és az Azure Kubernetes Service mellett jelenik meg a támogatott környezetek között.
A Vultr ügyfelei számára ez kétirányú hordozhatóságot jelenthet. A közlemény szerint az ML-rész, vagyis a gépi tanulási munkafolyamat konfigurációja nem változik akkor sem, ha az alatta lévő hardver módosul. Egy Vultr Cloud GPU-kon futó munkaterhelés ezért a konfiguráció megváltoztatásával helyezhető át, migrációs átírás nélkül.
A modell telepítése így különválik attól a döntéstől, hogy melyik szolgáltató és milyen hardver biztosítja a futtatást. A forrás szerint az infrastruktúrához kapcsolódó beállítás módosítható, miközben az ML-manifeszt változatlan marad.
Claude Code is használható saját Vultr-fürtön
A v0.3 másik fontos újdonsága az Anthropic Messages API teljes körű kiszolgálása. A vLLM-szerver az OpenAI-kompatibilis útvonalak mellett a Messages végpontot is elérhetővé teszi, a Modelplane útválasztása pedig megőrzi az útvonalat a szolgáltatási előtag alatt. Így egyetlen szolgáltatási cím mindkét API-t kiszolgálhatja.
Az Anthropic Messages API-t használó kliensek, köztük a Claude Code, közvetlenül kapcsolódhatnak ehhez a címhez. A Vultr leírása szerint a felhasználó az Opus, Sonnet és Haiku szinteket a ténylegesen kiszolgált modell nevéhez rendelheti. Ezzel olyan kódolási ügynök állítható be, amely teljes egészében a saját Vultr-fürtön futó modellre támaszkodik.
A Modelplane Anthropic Messages API-receptje a szerszámhasználathoz szükséges beállításokat is ismerteti, valamint azt, miért lehet célszerű korlátozni a kimeneti tokenek számát kisebb modell használatakor. A kezdéshez a Vultr a Modelplane útmutatóját és a v0.3 teljes kiadási jegyzékét ajánlja. A projekt GitHubon fogad hozzájárulásokat és hibajelentéseket az olyan szolgáltatókhoz vagy példányosztályokhoz, amelyeket még nem támogat.
