A Together AI éles forgalomban tesztelhetővé teszi a modelleket

A Together AI végpontszintű A/B tesztelést vezetett be, amellyel a fejlesztők valós felhasználói forgalmon mérhetik össze a jelenlegi és a jelölt modellek teljesítményét. A forgalom egy kontroll és legfeljebb 20 változat között osztható fel.
- A Together AI végpontszinten kínál A/B tesztelést.
- Egy kontroll mellett legfeljebb 20 változat tesztelhető.
- A forgalom például 95/5, 80/20 vagy 50/50 arányban osztható fel.
- A platform telepítésenként biztosít technikai mérőszámokat.
- A kísérlet törlése visszaállítja a forgalmat az alapértelmezett megosztásra.
Valós felhasználói forgalmon mérhető a modellminőség
A Together AI szerint egy új modell értékét nem feltétlenül a tesztpadokon mért eredmények mutatják meg a legjobban. A fejlesztők olyan termékmutatók alapján is dönthetnek, mint a felhasználói megtartás, a pozitív értékelések aránya vagy a feladatok sikeres teljesítése. Ehhez a jelölt modell válaszait valódi felhasználóknak kell megmutatni.
A vállalat 2026. augusztus 17-én közzétett leírása szerint az A/B kísérlet közvetlenül egy végponthoz kapcsolható. A kísérletben pontosan egy kontroll és egy vagy több változat szerepelhet, amelyek mindegyike egy telepítésre mutat. A százalékos beállításoknak összesen 100-at kell kiadniuk, és ezek határozzák meg a forgalom megoszlását.
A megoldás célja, hogy a teszt logikája ne az alkalmazás kódjába kerüljön. A Together AI példája szerint a kliensoldali funkciókapcsolók, a felhasználói azonosítón alapuló elosztás és a külön végpontok kezelése működőképes, de később megnehezítheti a kísérlet lezárását és a forgalmi szabályok karbantartását.
95 és 5 százalékkal indulhat a teszt
Az első kísérletben a kontroll 95, a jelölt modell pedig 5 százalékot kap. A Together AI szerint az ügyfelek közben ugyanazt a végpontnevet, API-t és kulcsokat használják, a háttérben azonban a kérések 5 százalékát a változat szolgálja ki.
A részesedések fix forgalmi arányok, és nem a replikák számától függnek. Ez eltér a kapacitásalapú forgalommegosztástól, amely a készen álló replikák szerint változhat. A platform ezért azt javasolja, hogy a változat telepítése elkülönítve, nulla súllyal szerepeljen, majd az A/B kísérlet irányítsa hozzá a forgalmat.
A kísérlet később teljes taglistát cserélve módosítható. A bemutatott lépések szerint az arány először 95/5, majd 80/20, végül 50/50 lehet. A frissítéseket egy etag védi, így egy párhuzamosan elvégzett módosítás nem írható felül észrevétlenül.
A fokozatos emelés különböző mérési kompromisszumokat jelent. A 95/5 arány lassabb, de kisebb kockázatú első kitettséget ad, a 80/20 már jelentősebb visszajelzést biztosíthat, az 50/50 pedig gyorsabb összehasonlítást tesz lehetővé két ismert modell között. Legfeljebb 20 változattal többirányú teszt is futtatható, ha pontosan egy kontroll marad, és a százalékok összege 100.
A platform a technikai és a termékadatokat összekapcsolja
Minden kérést egy konkrét telepítés szolgál ki, a platform mérőszámai pedig telepítésenként érhetők el. Így a fejlesztők külön vizsgálhatják az egyes csoportok késleltetését, hibáit és áteresztőképességét.
A termékminőségi mutatókat a Together AI nem próbálja meg kitalálni. A válasz metaadatai tartalmazzák, melyik telepítés szolgálta ki a kérést, ezt pedig össze lehet kapcsolni például az értékelésekkel, az újrapróbálkozásokkal és a sikeresen teljesített feladatokkal. Az összekapcsolás kulcsa a telepítés azonosítója.
A forrás szerint a felhasználónkénti következetes hozzárendeléshez a kérés mintavételi kulcsa használható, például a prompt_cache_key vagy a kérés törzsében megadott user mező. Kulcs nélküli kéréseknél a hozzárendelés kérésenként gyakorlatilag véletlenszerű.
A nyertes modellre átállás után törölhető a kísérlet
Ha a változat bizonyul jobbnak, a Together AI kétlépéses lezárást ír le. Először kék-zöld átállással kell a forgalmat a kontrolltelepítésről a változatra irányítani. Ezután törölhető az A/B kísérlet, így minden forgalom a végpont alapértelmezett megosztását követi.
Ha a jelölt modell rosszabbul teljesít, a kísérlet törlése után a teljes forgalom visszatér a kontrollhoz. A változat telepítése ezután nullára skálázható vagy törölhető. Egy hibás változat problémája a saját csoportjára korlátozódik, mivel a telepítéseket külön figyelik és külön skálázzák. A Together AI szerint a változat eltávolítása után a felhasználók egy propagálási időt követően ismét a kontrollhoz kerülnek.
Together AI: A/B test models in production
