Az OpenAI szerint a SWE-Bench Pro feladatainak 30 százaléka hibás
Az OpenAI visszavonta korábbi ajánlását a SWE-Bench Pro használatára, miután egy audit szerint a benchmark feladatainak mintegy 30 százaléka hibás. A vállalat szerint ez megnehezíti a kódolási modellek képességeinek megbízható mérését.
- Az OpenAI szerint a SWE-Bench Pro feladatainak körülbelül 30 százaléka hibás.
- A humán ellenőrzés 249 feladatnál talált problémát a vizsgált készletben.
- A fő hibák a túl szigorú, hiányosan specifikált, alacsony lefedettségű és félrevezető tesztek voltak.
- Az OpenAI visszavonta korábbi ajánlását a SWE-Bench Pro használatára.
- A vállalat új, fejlesztők által készített és szigorúbban ellenőrzött benchmarkokat sürget.
Jelentős arányban találtak problémás feladatokat
Az OpenAI 2026. július 8-án közzétett elemzésében a SWE-Bench Pro nevű kódolási benchmark minőségét vizsgálta. A vállalat szerint a teszt már nem ad megbízható képet a szoftverfejlesztési képességekről, ha a feladatok jelentős része hibásan méri a megoldásokat.
A benchmark 731 feladatból álló nyilvános részén a vezető modellek teljesítménye nyolc hónap alatt 23,3 százalékos sikerességi arányról 80,3 százalékra javult. Az OpenAI ugyanakkor azt írja, hogy a gyors javulási adatok értelmezéséhez figyelembe kell venni a feladatok minőségét is.
A vállalat kezdeti, automatizált szűrője 286 potenciálisan hibás feladatot jelölt meg. A mélyebb vizsgálatban a datapont-elemző rendszer 200 feladatot, vagyis a teljes készlet 27,4 százalékát minősítette hibásnak. Az öt tapasztalt szoftvermérnök által végzett emberi ellenőrzés 249 feladatnál, azaz 34,1 százaléknál talált problémát. Az OpenAI ezek alapján úgy becsüli, hogy a SWE-Bench Pro feladatainak körülbelül 30 százaléka hibás.
Négy fő hibakategóriát azonosítottak
Az audit négy fő problématípust különített el. A túl szigorú tesztek olyan konkrét megvalósítási részleteket követelnek meg, amelyek nem szerepelnek a feladatleírásban, így funkcionálisan helyes megoldásokat is elutasíthatnak.
A hiányosan specifikált felszólítások nem tartalmaznak olyan követelményeket, amelyeket a rejtett tesztek számon kérnek, és amelyek a leírásból vagy a környezetből nem következnek ésszerűen. Az alacsony lefedettségű tesztek nem ellenőrzik kellőképpen a kért funkciót, ezért hiányos javítások is átmehetnek rajtuk. A félrevezető feladatleírások pedig rossz viselkedés felé terelik a modellt, vagy ellentmondanak annak, amit a tesztek elvárnak.
A vizsgálatban minden megjelölt feladatot több, Codexen alapuló vizsgálati ügynök ellenőrzött, majd kutatói felülvizsgálat és öt mérnök egymástól független értékelése következett. A humán értékelők gyakrabban minősítették hibásnak a feladatokat, mint az ügynökök. A két ellenőrzési útvonal által azonosított kategóriák 74 százalékban fedték egymást.
Az OpenAI visszavonta korábbi ajánlását
Az OpenAI szerint az eredmények azt mutatják, milyen nehéz egyszerre nehéz és igazságos benchmarkokat összeállítani. A SWE-Bench Pro feladatai nyilvános és privát kódtárak változástörténetéből származnak. A modelleknek úgy kell megvalósítaniuk egy funkciót, hogy az új teszteken átmenjenek, miközben a meglévő működés sem sérül.
A vállalat szerint az ilyen feladatok eredetileg emberi együttműködéshez létrehozott hibajegyekből és kódváltoztatásokból készülnek. A probléma leírása, a beolvasztott kód és az egységtesztek ezért nem mindig alkotnak tiszta, megbízható értékelési feladatot. Az OpenAI új, tapasztalt szoftverfejlesztők által készített benchmarkok létrehozását szorgalmazza, amelyeknél erősebb emberi ellenőrzés biztosíthatja a mérés hitelességét.
Az OpenAI korábban azt javasolta, hogy a közösség térjen át a SWE-Bench Pro használatára a problémásnak talált SWE-bench Verified helyett. A mostani eredmények fényében ezt az ajánlást visszavonta. A vállalat szerint a benchmarkok eredményei a modelltelepítési és biztonsági döntéseket is befolyásolják, ezért olyan értékelésekre van szükség, amelyek nehezen manipulálhatók, megbízhatók és valóban a modellek képességeit tükrözik.
OpenAI: Separating signal from noise in coding evaluations


