Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A GPT-5.6 Sol vezeti a régi rendszerekre szabott tesztet

2026. szeptember 24.Forrás: Factory
A GPT-5.6 Sol vezeti a régi rendszerekre szabott tesztet
Kép: Factory

A GPT-5.6 Sol érte el a legjobb eredményt a Factory Legacy-Bench nevű tesztjén, amely a COBOL, a Java 7, a BASIC, a C89, a Fortran és az Assembly kezelését vizsgálja. A benchmark szeptember 24-én bekerült a Fireworks Specialized Intelligence Indexébe is.

A lényeg röviden
  • A GPT-5.6 Sol 60,0 százalékos eredménnyel vezette a Legacy-Bench értékelését.
  • A teszt hat régi nyelven vizsgál hibakeresési, megvalósítási és migrációs feladatokat.
  • A Legacy-Bench bekerült a Fireworks Specialized Intelligence Indexébe.
  • Egy COBOL-feladatban a modell 275 dolláros levonást számolt a helyes 125 dollár helyett.
  • Tíz reprezentatív feladat GitHubon, Harbor-formátumban érhető el.

Hat régi nyelv és valós vállalati feladatok

A Factory közlése szerint a Legacy-Bench azt méri, hogy a fejlett AI-modellek mennyire tudják hibakeresni, megvalósítani és migrálni a régi szoftvereket. A feladatok hat nyelvi környezetet fednek le: COBOL, Java 7, BASIC, C89, Fortran és Assembly.

A teszt olyan munkafolyamatokra épül, amelyek a pénzügyi elszámolásokban, a bérszámfejtésben, a biztosításban, a távközlésben és a tudományos számítástechnikában jelennek meg. A Factory szerint ezeknél a rendszereknél a modelleknek pontos kódolásokkal és bináris elrendezésekkel, fix szélességű rekordokkal, csomagolt decimális mezőkkel, valamint közvetlenül a kódba épített üzleti szabályokkal kell dolgozniuk.

A hibák következménye különösen súlyos lehet. Egy program lefordulhat, elindulhat és helyesnek tűnhet úgy is, hogy közben módosít egy fizetési számítást, vagy egyetlen bájt miatt elront egy további rendszernek szánt rekordot.

A GPT-5.6 Sol 60 százalékkal végzett az élen

A Fireworks Specialized Intelligence Indexéhez készített legutóbbi értékelésben a GPT-5.6 Sol 60,0 százalékos eredményt ért el, 0,44 dolláros költséggel és 2 perc 43 másodperces időtartammal. A további modellek eredményei a következők:

  • Claude Opus 5: 52,0 százalék, 1,13 dollár, 5 perc 37 másodperc.
  • GPT-6 Astra: 51,0 százalék, 0,98 dollár, 3 perc 33 másodperc.
  • DeepSeek V4.1 Flash: 49,0 százalék, 0,12 dollár, 5 perc 43 másodperc.
  • Kimi K3: 44,0 százalék, 1,09 dollár, 8 perc 49 másodperc.
  • GLM 5.3: 23,0 százalék, 0,69 dollár, 15 perc 09 másodperc.

Az eredmények alapján a GPT-5.6 Sol kilenc százalékponttal előzte meg a GPT-6 Astrát. A Factory hangsúlyozza, hogy az általános kódolási teszteken elért teljesítmény nem feltétlenül jelenik meg ugyanilyen formában a régi rendszerekben. A korlátozott visszajelzés, a ritkábban előforduló nyelvek és az egyetlen hibás bájtot is teljes kudarcnak tekintő kimeneti feladatok külön kihívást jelentenek.

A benchmark a szakosodott értékelést bővíti

A Legacy-Bench szeptember 24-én csatlakozott a Fireworks Specialized Intelligence Indexéhez. Az Index célja, hogy nyílt, zárt és szakosodott modelleket hasonlítson össze olyan területspecifikus feladatokon, amelyeket gyakorlati szakemberek terveztek.

A Factory példaként egy Java 7-es feladatot említ, ahol a hibás teszt kivételt adott, ez pedig segített a modellnek a hiba felismerésében és javításában. Egy COBOL-bérszámfejtési feladatnál ugyanakkor a program lefordult, és a 29 tesztből 24-et teljesített, mégis 275 dolláros egészségbiztosítási levonást számolt a helyes 125 dollár helyett. A kimenet hihetőnek tűnt, a modell pedig sikeresnek jelentette a munkát.

A Legacy-Bench tíz reprezentatív feladata GitHubon, Harbor-formátumban érhető el, míg a teljes benchmarkot az értékelésekhez használják. A Factory szerint az eredmények a mérnöki vezetőknek abban segíthetnek, hogy saját munkafolyamataikhoz mérjék a modellek alkalmasságát. A benchmark kipróbálásához a [email protected] címen lehet kapcsolatba lépni a vállalattal.

Kapcsolódó hírek

Az NVIDIA tesztje szerint sok kódolóügynök elbukik éles kiszolgálásban
Kutatás2026. szeptember 23.

Az NVIDIA tesztje szerint sok kódolóügynök elbukik éles kiszolgálásban

Az NVIDIA új SWE-Serve benchmarkja azt vizsgálja, hogy az AI-kódolóügynökök javításai működnek-e valódi modellkiszolgálás közben. A 19, éles szervert indító feladatnál a…

A Factory Router 63 százalékkal csökkentette a következtetés költségét
Cégek és üzlet2026. szeptember 23.

A Factory Router 63 százalékkal csökkentette a következtetés költségét

A Factory Router produkciós használat mellett összesítve 63 százalékkal csökkentette a következtetés költségét a közzétett frontier modellárakhoz képest. A rendszer a…

A Fireworks szerint a modellek együtt többre képesek, mint külön-külön
Kutatás2026. szeptember 21.

A Fireworks szerint a modellek együtt többre képesek, mint külön-külön

A megfelelő modell feladatonkénti kiválasztásával jelentősen javítható egy kódoló ügynök teljesítménye, miközben a költség is csökkenthető. A Fireworks AI elemzése…