Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Leállás nélkül cserélhető modelleket kínál a Together AI

2026. szeptember 22.Forrás: Together AI
Leállás nélkül cserélhető modelleket kínál a Together AI
Kép: Together AI

A Together AI új rollout funkciója fokozatosan mozgatja az éles forgalmat egy jelenlegi modellről egy új modellre. A rendszer mérési kapuval is megállíthatja a folyamatot, majd a modellcsere leállás nélkül visszafordítható.

A lényeg röviden
  • A canary rollout lépésekben mozgatja a forgalmat az új modellhez.
  • A mérési kapu például a p95 késleltetést vagy a hibaarányt figyelheti.
  • A Qwen3.5-9B tesztjénél 10 százalékos forgalomnál 137 százalékos p95 romlást észleltek.
  • A váltást leállították és visszafordították, miközben egyetlen kérés sem hibásodott meg.
  • A rollout API-ból, konzolból és parancssorból is vezérelhető.

Fokozatos modellcsere éles forgalomban

A Together AI 2026. szeptember 22-én bemutatott megoldása két telepítés között mozgatja a forgalmat ugyanazon a végponton. A forrás az aktuálisan kiszolgáló modell, a cél pedig az a modell, amelyre a szolgáltató át szeretne állni.

A canary stratégia előre megadott lépésekben növeli az új modell részesedését. A felhasználó például 10, 50 és 100 százalékos állomásokat állíthat be, az alapértelmezett lépcsőzet pedig 5, 25, 50 és 100 százalék. Az egyes lépések között várakozási idő és opcionális mérési ellenőrzés fut.

A Together AI szerint a megközelítés célja, hogy a modellváltás biztonsági mechanizmusa a platform része legyen. A korábbi lehetőségek között szerepelhetett a teljes, azonnali csere vagy egy második telepítés és kézzel vezérelt forgalomáthelyezés.

Egészségügyi és teljesítménykapuk állítják meg a hibás váltást

Minden canary lépés előtt a céltelepítés felskálázása és egészségügyi ellenőrzése történik. Forgalom csak olyan replikákhoz kerülhet, amelyek motorja betöltődött és válaszol, nem pusztán elindult. A forrás leürítése csak a forgalom áthelyezése után kezdődik.

A rendszer a forgalomváltás és a régi kapacitás csökkentése között terjedési várakozást alkalmaz, hogy a globális útválasztási gyorsítótárak frissüljenek. A várakozási időt a mérési ablakhoz és az adatok beérkezésének késleltetéséhez igazítják.

A mérési kapu például a 95. percentilis szerinti késleltetést vagy a hibaarányt figyelheti. Ha egy ellenőrzés nem teljesül, a rollout rendszerállapotba kerülhet, értesíti a felhasználót, majd emberi jóváhagyásra vár. A folyamat törölhető, ilyenkor az aktuális forgalommegosztás rögzül, és egy fordított rollouttal visszaállítható a korábbi modell.

A bemutatott tesztben 137 százalékkal romlott a p95 késleltetés

A Together AI egy valós futtatásban a Qwen2.5-7B modellről a Qwen3.5-9B modellre váltott, mindkettőt egy-egy H100 GPU-n futtatva. A mérési kapu a forgalom 10 százalékánál a p95 késleltetés 137 százalékos romlását észlelte.

A vállalat törölte a váltást, majd visszafordította a folyamatot. A közlemény szerint közben az éles kérések kiszolgálása folytatódott, és egyetlen kérés sem hibásodott meg.

A Together AI három stratégiát kínál. A canary több forgalmi lépésben tesztel, a blue-green egyetlen, 0-ról 100 százalékra történő átváltást végez, a rolling pedig replikánként cserél. A mérési kapuk a canary módban érhetők el.

API-ból, konzolból és parancssorból vezérelhető

A rollout az API-n vagy a konzolon létrehozható, és kezdetben PENDING állapotban marad, amíg külön el nem indítják. Ez lehetőséget ad a beállítások ellenőrzésére és a jóváhagyásra. A parancssori felület létrehozáskor és indításkor egy lépésben is használható.

A Together Python csomagjának 2.34.0 vagy újabb verziója tartalmazza a tg parancssori eszközt. A folyamat közben szüneteltetés, folytatás, előléptetés és törlés is kérhető. A rollout végállapota a COMPLETED, amikor a célmodell szolgál ki, vagy a CANCELED, amikor a forgalom az aktuális megosztásnál befagy.

A felhasználók számára ez azt jelenti, hogy egy új modell teljes körű bevezetése előtt élő forgalmon mérhetik annak viselkedését. A Together AI bemutatója szerint egy teljesítményromlás automatikusan megállíthatja a folyamatot, miközben a szolgáltatás tovább működik.

Kapcsolódó hírek

Így osztja meg az AI21 a közel 10 ezer GPU-t a csapatai között
Chipek és infrastruktúra2026. október 4. 13:37

Így osztja meg az AI21 a közel 10 ezer GPU-t a csapatai között

Az AI21 egy mintegy 10 ezer GPU-t kezelő, több csapat által használt GKE-fürtön váltott kézi erőforrás-egyeztetésről automatizált feladatütemezésre. A rendszer központi…

Termékek és eszközök
Termékek és eszközök2026. szeptember 30. 23:15

Az Equinix NVIDIA és Together AI együttműködésével gyorsítja az AI-inferenciát

Az Equinix, a NVIDIA és a Together AI közös megoldással gyorsítaná az AI-inferencia kísérleti fázisból éles környezetbe való átvezetését. Az Equinix Inference Exchange…

Termékek és eszközök
Termékek és eszközök2026. szeptember 30. 23:15

Az Equinix, az NVIDIA és a Together AI az AI-következtetést célozza

Az Equinix, az NVIDIA és a Together AI közös platformmal gyorsítaná a vállalati mesterségesintelligencia-modellek éles környezetbe állítását. Az Equinix Inference…