A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új megközelítése nagyobb döntési szabadságot ad a fő modellnek: maga határozza meg, mennyire gondolkodjon, mikor adjon át egy feladatot, és melyik részügynököt használja. A Replit szerint ez a rugalmas felépítés a szoftverfejlesztési teszteken a költséget és a pontszámot együtt nézve hatékonyabb az összehasonlított alapmegoldásoknál.
- A Replit Agent fő modellje maga választja ki az erőfeszítést és a részügynököket.
- A rendszer kis, standard és nagy részügynököket, valamint szakosított munkatársakat használ.
- DeepSWE v1.1-en 72 százalékos pontszámot ért el, feladatonként 2,11 dolláros költséggel.
- Terminal-Bench 4.0-n 49 százalékot ért el, feladatonként 2,53 dollárért.
- A Replit Agent mindkét teszten felülmúlta az egyetlen tartós munkatársra épülő sidekick-architektúrát.
A modell választja ki a munkafolyamatot
A Replit szeptember 29-i közleménye szerint a modellválasztó rendszerek, az úgynevezett routerek alapvető korlátozással működnek. Bármilyen fejlett heurisztikára vagy egy kisebb, a kéréseket elemző modellre épülnek, a router mindig kevésbé képes annál a modellnél, amelyből választ.
A Replit Agent ehelyett a fő modellre, vagyis a központi ciklusra bízza a döntéseket. Ez választja ki a részügynökök szintjét és a szükséges erőfeszítést, majd a feladat alakulása alapján saját működését is módosíthatja. A GPT-6 Astra például rutinfeladatokat olcsóbb részügynökökre bízhat, miközben a saját tokenjeit a nagyobb jelentőségű döntésekre tartogatja.
A rendszer három kérdésre ad választ minden lépésben: mennyire kell intenzíven gondolkodni, mikor érdemes átadni a munkát, és melyik részügynök kapja meg. Egy kisebb feladat egyáltalán nem indít új részügynököt, összetettebb munkánál viszont a párhuzamosság és a kontextus kezelése miatt több is bekapcsolódhat.
Négy építőelem ad szabadságot a központi ciklusnak
A Replit négy, egymással kombinálható elemmel alakította át a működést. A tartományra szabott részügynökök között általános munkatársak mellett csak olvasásra használható felfedezők, böngészős tesztelők, ellenőrök, valamint prezentációkhoz és felhasználói felületekhez készült dizájnügynökök is vannak. Mindegyik saját modellt és eszközöket használ. A Replit Design 2026 szeptemberében vezette a Builders ranglistát a Design Arenán, írta a vállalat.
A részügynökök kis, standard és nagy kategóriába kerülnek, amelyekhez külön erőfeszítési szint társul. Egy mechanikus átnevezés kis ügynökhöz, alacsony erőfeszítéssel kerülhet, egy nehéz hibánál szükséges hipotézisalkotás viszont nagy ügynököt és magas erőfeszítést kaphat.
A központi ciklus egy korábban már eligazított részügynökhöz is visszatérhet, így nem kell minden alkalommal elölről kezdenie a munkát. A rendszerben nincs egyetlen, teljes munkameneten át életben tartott segéd. Többféle típusú és szintű részügynök maradhat készenlétben, ezek közül a modell választja ki, melyiket ébreszti fel.
Az erőfeszítés dinamikus hangolása a feladat aktuális állapotát figyeli. A Replit szerint a GPT-6 család modelljein, a Fable 5.1-en és az azóta megjelent, érintett szolgáltatói modelleken az erőfeszítés munkamenet közbeni módosítása nem töri meg a gyorsítótárat.
A teszteken a költség és a pontszám együtt számított
A Replit Agentet Max módban, a vállalat legmagasabb minőségű beállításában vizsgálták, GPT-6 Astra fő modellel. A DeepSWE és a Terminal-Bench szoftverfejlesztési teszteken négy ismétlés átlagát használták, az eredményeket pedig a feladatonkénti költséggel együtt értékelték.
A DeepSWE v1.1 teszten, amely hosszú távú módosításokat vizsgál aktív, nyílt forráskódú tárolókban, a Replit Agent 72 százalékos pontszámot ért el, feladatonként 2,11 dolláros költséggel. A GPT-6 Astra önállóan, alacsony erőfeszítéssel 67 százalékot ért el 1,60 dollárért, extra magas erőfeszítéssel pedig 74 százalékot 4,43 dollárért. Az egyetlen, tartós munkatársra épülő sidekick-megoldás 61 százalékot ért el 1,34 dolláros költség mellett.
A Terminal-Bench 4.0 esetében a Replit Agent 49 százalékot ért el, feladatonként 2,53 dollárért. Astra alacsony erőfeszítéssel 42 százalékot és 2,25 dolláros költséget, extra magas erőfeszítéssel pedig 60 százalékot és 5,86 dolláros költséget produkált. A sidekick-architektúra 33 százalékot ért el 1,84 dollárért. A Replit szerint saját rendszere a sidekick-megoldást 11, illetve 16 százalékponttal előzte meg a két teszten.
A Replit szerint a fejlettebb modellek maguktól delegálnak
A vállalat három modell termelési működését is összehasonlította. A Fable 5 a menetek 32 százalékában, a Fable 5.1 21 százalékában, a GPT-6 Astra pedig 36 százalékában indított részügynököt. Általános munkatárshoz a menetek 0,9, 2,3, illetve 20 százalékában adtak át feladatot.
A Replit szerint az Astra az első olyan modelljük, amely rendszeresen, külön utasítás nélkül delegál általános munkatársaknak is. Ha már eligazított egy részügynököt, gyakran vissza is tér hozzá. A vállalat ezt a modell döntési szabadságára építő megközelítést a saját teljesítményük és költségük együttes javításának eszközeként értelmezi, miközben az új modellek megjelenésekor újra kell tesztelni, milyen keretekre van szükségük.
Replit: Free the models: Harness design at the frontier

