Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Féláron kínál előzetes GPU-kapacitást a Together AI

2026. szeptember 10.Forrás: Together AI
Féláron kínál előzetes GPU-kapacitást a Together AI
Kép: Together AI

A Together AI nyilvános előzetesben elérhetővé tette a megszakítható számítási kapacitást Kubernetes-alapú GPU-fürtjein. A csomópontok ugyanazt az NVIDIA-gyorsított infrastruktúrát használják, mint a normál kapacitás, az áruk azonban az igény szerinti díj 50 százaléka.

A lényeg röviden
  • A preemptible compute nyilvános előzetesként érhető el Kubernetes-fürtökön.
  • A csomópontok díja az on-demand ár fix 50 százaléka.
  • Visszavételkor a munkafolyamat legfeljebb öt percig menthet és állhat le.
  • A kapacitás rövid, újrapróbálható vagy ellenőrzőpontozott feladatokhoz készült.
  • A Slurm támogatása és további régiók későbbre várhatók.

Féláron, rögzített díj mellett működik

A vállalat 2026. szeptember 10-i bejelentése szerint a preemptible compute minden régió Kubernetes-fürtjein elérhető nyilvános előzetesként. A kapacitás új és már működő Together GPU Cluster fürtökhöz is hozzáadható.

A megszakítható csomópontok a fel nem használt kapacitásból érkeznek, és akkor vehetők vissza, amikor arra máshol szükség van. Díjuk az on-demand, vagyis igény szerinti ár fix 50 százaléka. A konstrukció nem spotpiacként működik, így az ár nem változik a piaci kapacitás függvényében.

A számlázás órán belüli, a használatot egy-két perces időközönként mérik. Egy 12 percig működő csomópont után hozzávetőleg 12 percnyi használatot számláznak.

Öt perc áll rendelkezésre a leállás előtt

Ha a Together visszavesz egy csomópontot, legfeljebb ötperces leállítási folyamat indul. A rendszer először kizárja a csomópontot az új feladatokból, TogetherPreempted Kubernetes-eseményt küld, a podok pedig SIGTERM jelzést kapnak.

A munkafolyamatnak ezt követően legfeljebb öt perce van az állapot mentésére és a szabályos kilépésre. A terminationGracePeriodSeconds értéke legfeljebb 300 másodpercre állítható. A csomópont eltávolítása után a fürt megtartja a megszakítható kapacitásra beállított célt, és automatikusan pótolja a kiesést, amikor újra rendelkezésre áll elegendő kapacitás.

A megszakítható csomópontok a meglévő fürt részei, de a together.ai/compute-class=preemptible címkét kapják. Így a megszakításra érzékeny munkafolyamatok kedvezményes kapacitásra kerülhetnek, miközben a koordinátorok, a belépési podok és a kiszolgáló replikák normál csomópontokon maradnak.

Kísérletekhez és átmeneti terhelési csúcsokhoz szánják

A Together AI szerint azok a feladatok illenek a konstrukcióhoz, amelyek folytathatók, újrapróbálhatók vagy sorba állíthatók. Ide tartozhatnak a rövid kísérletek, az ablation vizsgálatok, a konfigurációs próbák, a gyors finomhangolások, az értékelések, a desztilláció és a kötegelt következtetés.

A Ray Train és a PyTorch Lightning például beavatkozás nélkül képes folytatni a munkát a legutóbbi ellenőrzési pontból. A vállalat referenciaértékként közli, hogy a 321 milliárd paraméteres GLM5.3 Flash teljes modell-ellenőrzőpontja hozzávetőleg 3,5 TB, amely párhuzamos fájlrendszerre csökkent teljesítmény mellett is 22 másodperc és 4 perc között írható ki. Ez lehetővé teszi, hogy a mentés beleférjen az ötp perces leállítási ablakba.

Átmeneti kötegelt vagy belső következtetési terhelési csúcsok idején a kedvezményes csomópontok további munkáskapacitást adhatnak. A megszakított kérések újra sorba állíthatók, miközben a felhasználói kiszolgáló replikák normál csomópontokon futnak. A többnapos, ellenőrzőpont nélküli futások és a tartalék megoldás nélküli, szigorú szolgáltatási szintet igénylő kiszolgálás a Together AI szerint nem megfelelő erre a kapacitástípusra.

A kapacitás célértékkel állítható be

A megszakítható GPU-k száma a Together Cloud konzoljában, parancssori felületen vagy API-n keresztül adható meg új és már futó fürtökön. Az API külön jelenti a kért célértéket, desired_preemptible_gpus, valamint a jelenleg kiosztott kapacitást, allocated_preemptible_gpus. Szűkös kapacitás esetén a ténylegesen kiosztott mennyiség a célérték alatt maradhat.

A fürtnek legalább egy normál csomóponttal rendelkeznie kell, a csomópontok számítási típusa pedig helyben nem alakítható át. A feladatokat a preemptible címkével kell célba irányítani, például a nodeSelector használatával.

A leállításokról a pod SIGTERM jelzést kap, Kubernetes-esemény készül, az információ megjelenik a konzol Event Timeline nézetében, és elérhető a Together API node_lifecycle_events végpontján keresztül. A Together AI közlése szerint a Slurm támogatása, további régiók bevonása és a számítási típusok helyben történő átalakítása későbbi fejlesztésként szerepel.

Kapcsolódó hírek

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti
Chipek és infrastruktúra2026. október 2. 16:12

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti

A CoreWeave szerint a nagy AI-klaszterek értékét nem önmagában a hardver sebessége, hanem a ténylegesen elvégzett hasznos munka határozza meg. A vállalat az NVIDIA-val…

Termékek és eszközök
Termékek és eszközök2026. szeptember 30. 23:15

Az Equinix NVIDIA és Together AI együttműködésével gyorsítja az AI-inferenciát

Az Equinix, a NVIDIA és a Together AI közös megoldással gyorsítaná az AI-inferencia kísérleti fázisból éles környezetbe való átvezetését. Az Equinix Inference Exchange…

Termékek és eszközök
Termékek és eszközök2026. szeptember 30. 23:15

Az Equinix, az NVIDIA és a Together AI az AI-következtetést célozza

Az Equinix, az NVIDIA és a Together AI közös platformmal gyorsítaná a vállalati mesterségesintelligencia-modellek éles környezetbe állítását. Az Equinix Inference…