A GPT-5.6 Sol vezeti a régi rendszerekre szabott tesztet

A GPT-5.6 Sol érte el a legjobb eredményt a Factory Legacy-Bench nevű tesztjén, amely a COBOL, a Java 7, a BASIC, a C89, a Fortran és az Assembly kezelését vizsgálja. A benchmark szeptember 24-én bekerült a Fireworks Specialized Intelligence Indexébe is.
- A GPT-5.6 Sol 60,0 százalékos eredménnyel vezette a Legacy-Bench értékelését.
- A teszt hat régi nyelven vizsgál hibakeresési, megvalósítási és migrációs feladatokat.
- A Legacy-Bench bekerült a Fireworks Specialized Intelligence Indexébe.
- Egy COBOL-feladatban a modell 275 dolláros levonást számolt a helyes 125 dollár helyett.
- Tíz reprezentatív feladat GitHubon, Harbor-formátumban érhető el.
Hat régi nyelv és valós vállalati feladatok
A Factory közlése szerint a Legacy-Bench azt méri, hogy a fejlett AI-modellek mennyire tudják hibakeresni, megvalósítani és migrálni a régi szoftvereket. A feladatok hat nyelvi környezetet fednek le: COBOL, Java 7, BASIC, C89, Fortran és Assembly.
A teszt olyan munkafolyamatokra épül, amelyek a pénzügyi elszámolásokban, a bérszámfejtésben, a biztosításban, a távközlésben és a tudományos számítástechnikában jelennek meg. A Factory szerint ezeknél a rendszereknél a modelleknek pontos kódolásokkal és bináris elrendezésekkel, fix szélességű rekordokkal, csomagolt decimális mezőkkel, valamint közvetlenül a kódba épített üzleti szabályokkal kell dolgozniuk.
A hibák következménye különösen súlyos lehet. Egy program lefordulhat, elindulhat és helyesnek tűnhet úgy is, hogy közben módosít egy fizetési számítást, vagy egyetlen bájt miatt elront egy további rendszernek szánt rekordot.
A GPT-5.6 Sol 60 százalékkal végzett az élen
A Fireworks Specialized Intelligence Indexéhez készített legutóbbi értékelésben a GPT-5.6 Sol 60,0 százalékos eredményt ért el, 0,44 dolláros költséggel és 2 perc 43 másodperces időtartammal. A további modellek eredményei a következők:
- Claude Opus 5: 52,0 százalék, 1,13 dollár, 5 perc 37 másodperc.
- GPT-6 Astra: 51,0 százalék, 0,98 dollár, 3 perc 33 másodperc.
- DeepSeek V4.1 Flash: 49,0 százalék, 0,12 dollár, 5 perc 43 másodperc.
- Kimi K3: 44,0 százalék, 1,09 dollár, 8 perc 49 másodperc.
- GLM 5.3: 23,0 százalék, 0,69 dollár, 15 perc 09 másodperc.
Az eredmények alapján a GPT-5.6 Sol kilenc százalékponttal előzte meg a GPT-6 Astrát. A Factory hangsúlyozza, hogy az általános kódolási teszteken elért teljesítmény nem feltétlenül jelenik meg ugyanilyen formában a régi rendszerekben. A korlátozott visszajelzés, a ritkábban előforduló nyelvek és az egyetlen hibás bájtot is teljes kudarcnak tekintő kimeneti feladatok külön kihívást jelentenek.
A benchmark a szakosodott értékelést bővíti
A Legacy-Bench szeptember 24-én csatlakozott a Fireworks Specialized Intelligence Indexéhez. Az Index célja, hogy nyílt, zárt és szakosodott modelleket hasonlítson össze olyan területspecifikus feladatokon, amelyeket gyakorlati szakemberek terveztek.
A Factory példaként egy Java 7-es feladatot említ, ahol a hibás teszt kivételt adott, ez pedig segített a modellnek a hiba felismerésében és javításában. Egy COBOL-bérszámfejtési feladatnál ugyanakkor a program lefordult, és a 29 tesztből 24-et teljesített, mégis 275 dolláros egészségbiztosítási levonást számolt a helyes 125 dollár helyett. A kimenet hihetőnek tűnt, a modell pedig sikeresnek jelentette a munkát.
A Legacy-Bench tíz reprezentatív feladata GitHubon, Harbor-formátumban érhető el, míg a teljes benchmarkot az értékelésekhez használják. A Factory szerint az eredmények a mérnöki vezetőknek abban segíthetnek, hogy saját munkafolyamataikhoz mérjék a modellek alkalmasságát. A benchmark kipróbálásához a [email protected] címen lehet kapcsolatba lépni a vállalattal.
Factory: Which model is best for legacy code?


