A Descript egy hét várakozás helyett órák alatt tesztel modelleket

A Descriptnél korábban napokig vagy akár egy hétig is várni kellett, hogy egy mérnök bekösse az új modell teszteléséhez szükséges integrációt. Az OpenRouter bemutatása szerint a csapat most egy-két óra alatt lefuttatja az értékeléseket, közvetlen mérnöki időpont-egyeztetés nélkül.
- A Descript korábban akár egy hetet is várhatott egy új modell kipróbálására.
- Az új folyamat egy-két óra alatt lefuttatja az értékeléseket.
- A teszteket a Claude Tag Slack-integráció indítja és automatizálja.
- A Descript hetente többször mér új modelleket saját teszteseteivel.
- A Grok 4.5 közvetlen xAI-integráció nélkül került éles használatba.
A várakozás határozta meg, mit próbáltak ki
A Descript AI-alapú videó- és hangszerkesztő platformként az Underlord nevű videószerkesztő ügynök fejlesztése közben találkozott a problémával. Az OpenRouter 2026. szeptember 21-én közzétett, szeptember 24-én frissített esettanulmánya szerint a csapat korábban három közvetlen integrációt tartott fenn az OpenAI, az Anthropic és a Google szolgáltatásaival, valamint saját tartaléklogikát írt hozzájuk.
Egy modell hozzáadása körülbelül kétórás munkát jelentett. Az ehhez szükséges mérnöki időpont megszerzése azonban napokig tartott, így egy ígéretes modell akár egy hétig is várakozhatott, mire kiderült, érdemes-e vele foglalkozni. A csapat ezért főként azokat a modelleket próbálta ki, amelyek miatt megérte megszakítani egy mérnök munkáját, a többit kihagyta.
Slackből indul az új értékelési folyamat
A Descript most hetente többször is tesztel modelleket. Aleks Mistratov, a Descript AI-termékekért felelős vezetője az OpenRouternek azt mondta: ha egy új modellről értesül, Slackben kéri az értékelések lefuttatását az OpenRouteren keresztül, majd egy-két órával később már rendelkezésre állnak az eredmények a csapat tesztkörnyezetében.
A folyamat technikai alapja az Anthropic Slack-integrációja, a Claude Tag, amelyet a Descript erre a célra állított be. A rendszer lefuttatja az értékeléseket és megnyitja a pull requesteket, ezután egy ember átnézi és jóváhagyja a módosításokat.
Az automatizálást az teszi lehetővé, hogy a modell kipróbálása előtt már nem kell külön szolgáltatói integrációt felépíteni. A teszteléshez nincs szükség új üzleti kapcsolat létrehozására vagy új API-végpont bekötésére. Munka továbbra is van vele, de ahhoz nem kell külön mérnököt felkérni.
A tesztek a modellválasztást és a gyártási használatot is alakítják
Az OpenRouter beszámolója szerint a Descript saját teszteseteivel méri az új kiadásokat, és akkor változtat azon, mit szállít, ha egy modell teljesíti a csapat által meghatározott elvárást. A legtöbb kipróbált modell végül nem kerül éles használatba, a kiválasztás így mérési eredményekre támaszkodik.
A folyamat felgyorsította az új modellek bevezetését is. Egy közelmúltbeli Anthropic-kiadásnál a Descript a bejelentéstől számított néhány órán belül éles használatra váltott. A megmaradó lépések belsőek: az értékelések lefuttatása, annak eldöntése, hogy az új modell jobb-e a jelenleg használtnál, felvétele a modellválasztóba, majd a telepítés.
A megoldás olyan modellek előtt is megnyitotta az utat, amelyekhez a Descript korábban nem készített közvetlen integrációt. A csapat nem épített ilyet az xAI-hoz, a Grok 4.5 azonban már éles környezetben fut, ugyanazon az útvonalon hozzáadva, mint más modellek.
A Descript az új modellek tesztelésére és a kiválasztott modellek futtatására ugyanazt az integrációt használja. A vállalat saját kulcsot ad a Basetennek egy nyílt súlyú modell dedikált telepítéséhez, az OpenRouter pedig először a Basetenhez irányítja a kéréseket, mögötte további szolgáltatók vannak tartalékként beállítva. Ezek a tartalékok a következtetési szolgáltatót cserélik ki, miközben a modell változatlan marad.
OpenRouter: Two Hours of Work That Takes a Week


