Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az OpenAI szerint a SWE-Bench Pro feladatainak 30 százaléka hibás

2026. július 8.Forrás: OpenAI

Az OpenAI visszavonta korábbi ajánlását a SWE-Bench Pro használatára, miután egy audit szerint a benchmark feladatainak mintegy 30 százaléka hibás. A vállalat szerint ez megnehezíti a kódolási modellek képességeinek megbízható mérését.

A lényeg röviden
  • Az OpenAI szerint a SWE-Bench Pro feladatainak körülbelül 30 százaléka hibás.
  • A humán ellenőrzés 249 feladatnál talált problémát a vizsgált készletben.
  • A fő hibák a túl szigorú, hiányosan specifikált, alacsony lefedettségű és félrevezető tesztek voltak.
  • Az OpenAI visszavonta korábbi ajánlását a SWE-Bench Pro használatára.
  • A vállalat új, fejlesztők által készített és szigorúbban ellenőrzött benchmarkokat sürget.

Jelentős arányban találtak problémás feladatokat

Az OpenAI 2026. július 8-án közzétett elemzésében a SWE-Bench Pro nevű kódolási benchmark minőségét vizsgálta. A vállalat szerint a teszt már nem ad megbízható képet a szoftverfejlesztési képességekről, ha a feladatok jelentős része hibásan méri a megoldásokat.

A benchmark 731 feladatból álló nyilvános részén a vezető modellek teljesítménye nyolc hónap alatt 23,3 százalékos sikerességi arányról 80,3 százalékra javult. Az OpenAI ugyanakkor azt írja, hogy a gyors javulási adatok értelmezéséhez figyelembe kell venni a feladatok minőségét is.

A vállalat kezdeti, automatizált szűrője 286 potenciálisan hibás feladatot jelölt meg. A mélyebb vizsgálatban a datapont-elemző rendszer 200 feladatot, vagyis a teljes készlet 27,4 százalékát minősítette hibásnak. Az öt tapasztalt szoftvermérnök által végzett emberi ellenőrzés 249 feladatnál, azaz 34,1 százaléknál talált problémát. Az OpenAI ezek alapján úgy becsüli, hogy a SWE-Bench Pro feladatainak körülbelül 30 százaléka hibás.

Négy fő hibakategóriát azonosítottak

Az audit négy fő problématípust különített el. A túl szigorú tesztek olyan konkrét megvalósítási részleteket követelnek meg, amelyek nem szerepelnek a feladatleírásban, így funkcionálisan helyes megoldásokat is elutasíthatnak.

A hiányosan specifikált felszólítások nem tartalmaznak olyan követelményeket, amelyeket a rejtett tesztek számon kérnek, és amelyek a leírásból vagy a környezetből nem következnek ésszerűen. Az alacsony lefedettségű tesztek nem ellenőrzik kellőképpen a kért funkciót, ezért hiányos javítások is átmehetnek rajtuk. A félrevezető feladatleírások pedig rossz viselkedés felé terelik a modellt, vagy ellentmondanak annak, amit a tesztek elvárnak.

A vizsgálatban minden megjelölt feladatot több, Codexen alapuló vizsgálati ügynök ellenőrzött, majd kutatói felülvizsgálat és öt mérnök egymástól független értékelése következett. A humán értékelők gyakrabban minősítették hibásnak a feladatokat, mint az ügynökök. A két ellenőrzési útvonal által azonosított kategóriák 74 százalékban fedték egymást.

Az OpenAI visszavonta korábbi ajánlását

Az OpenAI szerint az eredmények azt mutatják, milyen nehéz egyszerre nehéz és igazságos benchmarkokat összeállítani. A SWE-Bench Pro feladatai nyilvános és privát kódtárak változástörténetéből származnak. A modelleknek úgy kell megvalósítaniuk egy funkciót, hogy az új teszteken átmenjenek, miközben a meglévő működés sem sérül.

A vállalat szerint az ilyen feladatok eredetileg emberi együttműködéshez létrehozott hibajegyekből és kódváltoztatásokból készülnek. A probléma leírása, a beolvasztott kód és az egységtesztek ezért nem mindig alkotnak tiszta, megbízható értékelési feladatot. Az OpenAI új, tapasztalt szoftverfejlesztők által készített benchmarkok létrehozását szorgalmazza, amelyeknél erősebb emberi ellenőrzés biztosíthatja a mérés hitelességét.

Az OpenAI korábban azt javasolta, hogy a közösség térjen át a SWE-Bench Pro használatára a problémásnak talált SWE-bench Verified helyett. A mostani eredmények fényében ezt az ajánlást visszavonta. A vállalat szerint a benchmarkok eredményei a modelltelepítési és biztonsági döntéseket is befolyásolják, ezért olyan értékelésekre van szükség, amelyek nehezen manipulálhatók, megbízhatók és valóban a modellek képességeit tükrözik.

Kapcsolódó hírek

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…

Az Apple SCLATE rendszere hónapnyi ügynöki munkát órákra sűrít
Kutatás2026. szeptember 30.

Az Apple SCLATE rendszere hónapnyi ügynöki munkát órákra sűrít

Az Apple bemutatta a SCLATE nevű végrehajtási réteget, amely a folyamatos tanulásra képes AI-ügynökök képzését és értékelését támogatja. A rendszer egy hónapnyi…

Az Apple SCLATE rendszere hónapok helyett órák alatt teszteli az ügynököket
Kutatás2026. szeptember 30.

Az Apple SCLATE rendszere hónapok helyett órák alatt teszteli az ügynököket

Az Apple bemutatta a SCLATE nevű végrehajtási környezetet, amely hosszú, több munkameneten átívelő forgatókönyvekben képezi és értékeli az AI-ügynököket. A rendszer egy…