Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Grok 4.7 olcsóbban hozza az Opus 4.8 szintjét kódolásban

2026. szeptember 22. 14:13Forrás: Snorkel AI
A Grok 4.7 olcsóbban hozza az Opus 4.8 szintjét kódolásban
Kép: Snorkel AI

A Grok 4.7 a Senior SWE-Bench teszten 40,0 százalékos tasteful pass@3 eredményt ért el, ezzel holtversenyben hatodik lett. Az eredmény megegyezik az Opus 4.8 teljesítményével, a Snorkel AI mérése szerint azonban egy próbálkozás költsége jóval alacsonyabb.

A lényeg röviden
  • A Grok 4.7 tasteful pass@3 eredménye 40,0 százalék lett.
  • A modell holtversenyben hatodik az Opus 4.8-cal.
  • A Grok 4.7 egy próbálkozása 0,24 dollárba került, az Opus 4.8-é 3,36 dollárba.
  • A Grok 4.7 pass@3 értéke 63,2 százalék, tasteful pass^3 mutatója 7,4 százalék lett.

Javított a Grok 4.6 eredményén

A Snorkel AI szeptember 22-én közzétett elemzése szerint a Grok 4.7-et a Senior SWE-Bench nevű teszten értékelték. A benchmark azt vizsgálja, hogy a kódoló ügynökök mennyire dolgoznak egy tapasztalt szoftvermérnökhöz hasonlóan.

A Grok 4.7 tasteful pass@1 eredménye 27,4 százalék lett, szemben a Grok 4.6 26,3 százalékával. A három próbálkozásból legalább egy jó minőségű megoldást elérő futások aránya, vagyis a tasteful pass@3, 38,9 százalékról 40,0 százalékra nőtt. Ez a mutató a modellt a Snorkel AI rangsorában a hatodik helyre tette, az Opus 4.8-cal azonos szinten.

Az árkülönbség jelentős

A Snorkel AI szerint a Grok 4.7 egy próbálkozása átlagosan 0,24 dollárba kerül. Az Opus 4.8 ugyanazt a 40,0 százalékos tasteful pass@3 eredményt érte el, de egy próbálkozás költsége 3,36 dollár volt. A Grok 4.7 ehhez képest nagyjából a harmadannyi kimeneti tokent használt.

A forrás a Fable 5.1 és a GPT-5.6 Sol eredményeivel is összeveti a modellt. A Grok 4.7 39,4 ezer kimeneti tokent használt, míg a két másik modell 37,9, illetve 32,7 ezret. A Snorkel AI szerint a kódolási munka tokenigénye így hasonló, a költség viszont a Grok 4.7 esetében a másik modellek árának negyede és nyolcada között alakult.

A Grok 4.7 pass@3 értéke 63,2 százalék lett, ami megegyezik a GPT-5.6 Sol eredményével. A tasteful pass@3 mutatóban három százalékponttal maradt el tőle.

A több próbálkozás javítja az esélyeket, a megbízhatóság gyengébb

A benchmark valós pull requestekből származó hibafeladatokat használ. A feladatleírások szándékosan kevésbé részletesek, inkább egy kollégától érkező üzenetre hasonlítanak, a megoldás értékelése pedig a működés mellett a kód minőségét is figyelembe veszi. A teszt 50 nyilvános és 50 privát problémát tartalmaz, különböző könyvtárakból és több szolgáltatást használó alkalmazásokból.

A Grok 4.7 a Grok 4.6-hoz képest valamivel kevesebb feladatot oldott meg: pass@3 eredménye 63,2 százalék volt, szemben a korábbi modell 65,3 százalékával. A sikeres megoldásokon belül viszont nagyobb arányban készített megfelelő minőségű kódot, 63,3 százalékot a 4.6 59,6 százalékával szemben.

A megbízhatóság a Snorkel AI szerint gyengébb pont. A forrásban szereplő pass^3 mutató 7,4 százalék lett, míg a Grok 4.6 esetében 16,8, a Fable 5.1-nél pedig 22,1 százalék. A vállalat következtetése szerint a Grok 4.7 képességei inkább ismételt próbálkozások során mutatkoznak meg, mint egyetlen futásban. Ez azoknak a csapatoknak lehet fontos, amelyek ügynököket ismétlődő ciklusokban futtatnak, és a próbálkozások költsége alacsonyabb a kezdeti teljesítmény jelentőségénél.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…

Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük
Kutatás2026. szeptember 29. 18:08

Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük

Egy új kutatás szerint az agent harnesses, vagyis az ügynöki rendszereket eszközökkel, szabályokkal és memóriával támogató rétegek bizonyos részei betaníthatók magába a…

A modellek átvehetik az ügynöki keretek egy részét
Kutatás2026. szeptember 29. 18:08

A modellek átvehetik az ügynöki keretek egy részét

Egy új kutatás szerint az ügynöki keretek, vagyis a modelleket eszközökkel és szabályokkal segítő rendszerek egyes részei közvetlenül betaníthatók a modellbe. A keretek…