A Grok 4.7 olcsóbban hozza az Opus 4.8 szintjét kódolásban

A Grok 4.7 a Senior SWE-Bench teszten 40,0 százalékos tasteful pass@3 eredményt ért el, ezzel holtversenyben hatodik lett. Az eredmény megegyezik az Opus 4.8 teljesítményével, a Snorkel AI mérése szerint azonban egy próbálkozás költsége jóval alacsonyabb.
- A Grok 4.7 tasteful pass@3 eredménye 40,0 százalék lett.
- A modell holtversenyben hatodik az Opus 4.8-cal.
- A Grok 4.7 egy próbálkozása 0,24 dollárba került, az Opus 4.8-é 3,36 dollárba.
- A Grok 4.7 pass@3 értéke 63,2 százalék, tasteful pass^3 mutatója 7,4 százalék lett.
Javított a Grok 4.6 eredményén
A Snorkel AI szeptember 22-én közzétett elemzése szerint a Grok 4.7-et a Senior SWE-Bench nevű teszten értékelték. A benchmark azt vizsgálja, hogy a kódoló ügynökök mennyire dolgoznak egy tapasztalt szoftvermérnökhöz hasonlóan.
A Grok 4.7 tasteful pass@1 eredménye 27,4 százalék lett, szemben a Grok 4.6 26,3 százalékával. A három próbálkozásból legalább egy jó minőségű megoldást elérő futások aránya, vagyis a tasteful pass@3, 38,9 százalékról 40,0 százalékra nőtt. Ez a mutató a modellt a Snorkel AI rangsorában a hatodik helyre tette, az Opus 4.8-cal azonos szinten.
Az árkülönbség jelentős
A Snorkel AI szerint a Grok 4.7 egy próbálkozása átlagosan 0,24 dollárba kerül. Az Opus 4.8 ugyanazt a 40,0 százalékos tasteful pass@3 eredményt érte el, de egy próbálkozás költsége 3,36 dollár volt. A Grok 4.7 ehhez képest nagyjából a harmadannyi kimeneti tokent használt.
A forrás a Fable 5.1 és a GPT-5.6 Sol eredményeivel is összeveti a modellt. A Grok 4.7 39,4 ezer kimeneti tokent használt, míg a két másik modell 37,9, illetve 32,7 ezret. A Snorkel AI szerint a kódolási munka tokenigénye így hasonló, a költség viszont a Grok 4.7 esetében a másik modellek árának negyede és nyolcada között alakult.
A Grok 4.7 pass@3 értéke 63,2 százalék lett, ami megegyezik a GPT-5.6 Sol eredményével. A tasteful pass@3 mutatóban három százalékponttal maradt el tőle.
A több próbálkozás javítja az esélyeket, a megbízhatóság gyengébb
A benchmark valós pull requestekből származó hibafeladatokat használ. A feladatleírások szándékosan kevésbé részletesek, inkább egy kollégától érkező üzenetre hasonlítanak, a megoldás értékelése pedig a működés mellett a kód minőségét is figyelembe veszi. A teszt 50 nyilvános és 50 privát problémát tartalmaz, különböző könyvtárakból és több szolgáltatást használó alkalmazásokból.
A Grok 4.7 a Grok 4.6-hoz képest valamivel kevesebb feladatot oldott meg: pass@3 eredménye 63,2 százalék volt, szemben a korábbi modell 65,3 százalékával. A sikeres megoldásokon belül viszont nagyobb arányban készített megfelelő minőségű kódot, 63,3 százalékot a 4.6 59,6 százalékával szemben.
A megbízhatóság a Snorkel AI szerint gyengébb pont. A forrásban szereplő pass^3 mutató 7,4 százalék lett, míg a Grok 4.6 esetében 16,8, a Fable 5.1-nél pedig 22,1 százalék. A vállalat következtetése szerint a Grok 4.7 képességei inkább ismételt próbálkozások során mutatkoznak meg, mint egyetlen futásban. Ez azoknak a csapatoknak lehet fontos, amelyek ügynököket ismétlődő ciklusokban futtatnak, és a próbálkozások költsége alacsonyabb a kezdeti teljesítmény jelentőségénél.
Snorkel AI: Grok 4.7 on Senior SWE-Bench: Strong pass@3, Cheaper Cost per Trial


