Féláron kínál előzetes GPU-kapacitást a Together AI

A Together AI nyilvános előzetesben elérhetővé tette a megszakítható számítási kapacitást Kubernetes-alapú GPU-fürtjein. A csomópontok ugyanazt az NVIDIA-gyorsított infrastruktúrát használják, mint a normál kapacitás, az áruk azonban az igény szerinti díj 50 százaléka.
- A preemptible compute nyilvános előzetesként érhető el Kubernetes-fürtökön.
- A csomópontok díja az on-demand ár fix 50 százaléka.
- Visszavételkor a munkafolyamat legfeljebb öt percig menthet és állhat le.
- A kapacitás rövid, újrapróbálható vagy ellenőrzőpontozott feladatokhoz készült.
- A Slurm támogatása és további régiók későbbre várhatók.
Féláron, rögzített díj mellett működik
A vállalat 2026. szeptember 10-i bejelentése szerint a preemptible compute minden régió Kubernetes-fürtjein elérhető nyilvános előzetesként. A kapacitás új és már működő Together GPU Cluster fürtökhöz is hozzáadható.
A megszakítható csomópontok a fel nem használt kapacitásból érkeznek, és akkor vehetők vissza, amikor arra máshol szükség van. Díjuk az on-demand, vagyis igény szerinti ár fix 50 százaléka. A konstrukció nem spotpiacként működik, így az ár nem változik a piaci kapacitás függvényében.
A számlázás órán belüli, a használatot egy-két perces időközönként mérik. Egy 12 percig működő csomópont után hozzávetőleg 12 percnyi használatot számláznak.
Öt perc áll rendelkezésre a leállás előtt
Ha a Together visszavesz egy csomópontot, legfeljebb ötperces leállítási folyamat indul. A rendszer először kizárja a csomópontot az új feladatokból, TogetherPreempted Kubernetes-eseményt küld, a podok pedig SIGTERM jelzést kapnak.
A munkafolyamatnak ezt követően legfeljebb öt perce van az állapot mentésére és a szabályos kilépésre. A terminationGracePeriodSeconds értéke legfeljebb 300 másodpercre állítható. A csomópont eltávolítása után a fürt megtartja a megszakítható kapacitásra beállított célt, és automatikusan pótolja a kiesést, amikor újra rendelkezésre áll elegendő kapacitás.
A megszakítható csomópontok a meglévő fürt részei, de a together.ai/compute-class=preemptible címkét kapják. Így a megszakításra érzékeny munkafolyamatok kedvezményes kapacitásra kerülhetnek, miközben a koordinátorok, a belépési podok és a kiszolgáló replikák normál csomópontokon maradnak.
Kísérletekhez és átmeneti terhelési csúcsokhoz szánják
A Together AI szerint azok a feladatok illenek a konstrukcióhoz, amelyek folytathatók, újrapróbálhatók vagy sorba állíthatók. Ide tartozhatnak a rövid kísérletek, az ablation vizsgálatok, a konfigurációs próbák, a gyors finomhangolások, az értékelések, a desztilláció és a kötegelt következtetés.
A Ray Train és a PyTorch Lightning például beavatkozás nélkül képes folytatni a munkát a legutóbbi ellenőrzési pontból. A vállalat referenciaértékként közli, hogy a 321 milliárd paraméteres GLM5.3 Flash teljes modell-ellenőrzőpontja hozzávetőleg 3,5 TB, amely párhuzamos fájlrendszerre csökkent teljesítmény mellett is 22 másodperc és 4 perc között írható ki. Ez lehetővé teszi, hogy a mentés beleférjen az ötp perces leállítási ablakba.
Átmeneti kötegelt vagy belső következtetési terhelési csúcsok idején a kedvezményes csomópontok további munkáskapacitást adhatnak. A megszakított kérések újra sorba állíthatók, miközben a felhasználói kiszolgáló replikák normál csomópontokon futnak. A többnapos, ellenőrzőpont nélküli futások és a tartalék megoldás nélküli, szigorú szolgáltatási szintet igénylő kiszolgálás a Together AI szerint nem megfelelő erre a kapacitástípusra.
A kapacitás célértékkel állítható be
A megszakítható GPU-k száma a Together Cloud konzoljában, parancssori felületen vagy API-n keresztül adható meg új és már futó fürtökön. Az API külön jelenti a kért célértéket, desired_preemptible_gpus, valamint a jelenleg kiosztott kapacitást, allocated_preemptible_gpus. Szűkös kapacitás esetén a ténylegesen kiosztott mennyiség a célérték alatt maradhat.
A fürtnek legalább egy normál csomóponttal rendelkeznie kell, a csomópontok számítási típusa pedig helyben nem alakítható át. A feladatokat a preemptible címkével kell célba irányítani, például a nodeSelector használatával.
A leállításokról a pod SIGTERM jelzést kap, Kubernetes-esemény készül, az információ megjelenik a konzol Event Timeline nézetében, és elérhető a Together API node_lifecycle_events végpontján keresztül. A Together AI közlése szerint a Slurm támogatása, további régiók bevonása és a számítási típusok helyben történő átalakítása későbbi fejlesztésként szerepel.
Together AI: Introducing preemptible compute: the same compute, half the price
