Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Warp saját kódolási feladataidon méri le, melyik modell működik a legjobban

2026. szeptember 3. 17:00Forrás: Warp
A Warp saját kódolási feladataidon méri le, melyik modell működik a legjobban
Kép: Warp

A Warp korai hozzáférésben elindította a Benchmarks funkciót, amely a felhasználók saját kódolási feladatain hasonlítja össze a modelleket és az ügynökkonfigurációkat. A vállalat szerint a belső tesztelésük bizonyos feladattípusoknál 63 százalékkal csökkentette a költségeket a minőség romlása nélkül.

A lényeg röviden
  • A Benchmarks saját kódolási feladatokon hasonlítja össze a modelleket és konfigurációkat.
  • A rendszer költség, minőség, helyesség és más szempontok alapján értékel.
  • A Warp szerint a WarpBench 63 százalékkal csökkentette az egy pull requestre jutó belső költséget.
  • A tesztek eredményei alapján modellrouterek irányíthatják a feladatokat.
  • A funkció a Warp Factories korai hozzáférési programjában érhető el.

Saját feladatokra épülő modellteszt

A Warp szeptember 3-án mutatta be a Benchmarks funkciót a Warp Factories korai hozzáférésű változatában. A megoldás a nyilvános tesztekkel, például a SWE-bench és a Terminal Bench rendszerével rokon, de a mérés alapját a csapat saját kódolási feladatai és környezete adja.

A Benchmarks célja, hogy a fejlesztőcsapatok ne feltételezések alapján válasszák ki a modellt vagy az ügynök konfigurációját. A rendszerrel különböző modellek, munkafolyamatok és értékelési szempontok hasonlíthatók össze. A Warp szerint a funkció a frontier és a nyílt súlyú modellekkel is működik, a jövőben pedig olyan különböző harness-ek, vagyis futtatási keretrendszerek tesztelését is támogatja, mint a Warp, a Claude Code és a Codex.

Feladatok, konfigurációk és értékelők

Egy benchmark három fő elemből áll. Az első a feladatkészlet, amely származhat a csapat korábbi futásaiból, vagy létrehozható újonnan. A második a tesztelendő gyári konfigurációk halmaza, ahol a modell, a harness és más beállítások változtathatók. A harmadik az értékelők, vagyis a Scorers rendszere, amely olyan dimenziók alapján vizsgálja a teljesítményt, mint a költség, a minőség, a helyesség, a hatékonyság és a terjengősség.

A Warp Factories a feladatok és a konfigurációk minden kombinációját lefuttatja, majd az eredményeket vizualizációkkal és pareto-grafikonokkal mutatja be. Így külön is látható, melyik konfiguráció teljesít a legjobban a költség, a minőség vagy az összesített eredmény szempontjából. A feladatok többszöri futtatása csökkenti az eredmények szórását, ugyanakkor növeli a költséget.

A benchmarkok kódalapúak. A gyári állapotot a factory.yaml fájl és a hozzá tartozó ügynökdefiníciók rögzítik, ez pedig lehetővé teszi a különböző konfigurációk A/B tesztelését. A rendszer minden futás ügynöknyomait és metaadatait tárolja. A vállalati ügyfelek ezeket a saját biztonsági határukon belül is tárolhatják. A Warp szerint a rögzített adatok között szerepelhet a prompt, a teljes beszélgetés, a futás előtti és utáni Git-állapot, a pull request és más létrehozott fájlok.

A Warp szerint 63 százalékkal csökkent a belső költség

A Warp a saját WarpBench nevű, általános célú belső benchmarkját használta a konfigurációk összevetésére. A vállalat által bemutatott futásban a GPT 5.6 Sol (high) lett a legjobb modell. A Warp szerint a WarpBench segítségével az elmúlt néhány hétben körülbelül 63 százalékkal csökkentették az egy pull requestre jutó belső költséget.

A cég egy másik példában egyszerű frontendmódosításokat vizsgál a szerver kódbázisában. Ebben a tesztben a Grok 4.6 (med), a GLM 5.3 flash és a Claude Opus 5 (med) konfigurációit hasonlítják össze a Warp harness használatával. A Warp Factories a harness cseréjét is lehetővé teszi, így például a Claude Code és a Codex teljesítménye is vizsgálható.

A benchmark elkészítésében a Warp úgynevezett foreman ügynöke is segíthet. Ez a korábbi futásokból képes tesztfeladatokat kiválasztani, például meghatározott méretű felhasználói felületet érintő módosításokat. A korábbi futások a kezelőfelületen egyenként is hozzáadhatók a benchmarkhoz.

Az eredményekből automatikus modellválasztás lehet

A teszt eredménye nem áll meg a modellek rangsorolásánál. A Warp Factories egyedi modellroutereket is támogat, amelyek osztályozási szabályok alapján választják ki az adott feladathoz tartozó modellkonfigurációt. A Warp példájában a rendszer az egyszerű, szerveroldali frontendfeladatokat a Grok 4.6 (med) konfigurációjához irányítja, mert ez teljesített a legjobban az adott belső benchmarkon.

A Warp hangsúlyozza, hogy a benchmarkok futtatása költséges, ezért nem automatikus, folyamatos használatra javasolja őket. A vállalat szerint elsősorban új modellek megjelenésekor, illetve promptok, készségek vagy más ügynökkontextusok módosításakor lehet hasznos újramérni a konfigurációkat. A Benchmarks és az önfejlesztési ciklusok együtt a Warp értelmezésében a kódolóügynök-rendszerek költség és termelékenység szerinti mérnöki optimalizálását segítik.

A funkciót a Warp Factories korai hozzáférési programjában lehet kipróbálni. A Warp képzett csapatoknak 10 ezer dollár értékű factory-használatot kínál, a csatlakozás pedig jelentkezéshez kötött.

Kapcsolódó hírek

A VAST Data szerint új fejlesztői réteg formálja az AI alkalmazásokat
Fejlesztőknek2026. október 2.

A VAST Data szerint új fejlesztői réteg formálja az AI alkalmazásokat

A VAST Data szerint az AI alkalmazások fejlesztése új technikai felületeket hoz a mindennapi munkába. A vállalat CAMP néven foglalja össze a kódoló ügynököket, az…

A VAST Data szerint új fejlesztői verem formálódik az AI körül
Fejlesztőknek2026. október 2.

A VAST Data szerint új fejlesztői verem formálódik az AI körül

A VAST Data szerint az AI-alkalmazások fejlesztése új alapokra helyezi a fejlesztői verem működését. A vállalat CAMP néven foglalja össze a négy meghatározó területet: a…

A JetBrains Air több AI-ügynök munkáját hozza egy IDE-be
Termékek és eszközök2026. október 1. 14:42

A JetBrains Air több AI-ügynök munkáját hozza egy IDE-be

Megnyílt a JetBrains Air korai hozzáférési programja, amely több AI-ügynök párhuzamos használatát és felügyeletét teszi lehetővé a JetBrains IDE-kben. Az Air plugin…