SWE-bench Verified

Az Apple SCLATE rendszere hónapnyi ügynöki munkát órákra sűrít
Az Apple bemutatta a SCLATE nevű végrehajtási réteget, amely a folyamatos tanulásra képes AI-ügynökök képzését és értékelését támogatja. A rendszer egy hónapnyi…

Az Apple SCLATE rendszere hónapok helyett órák alatt teszteli az ügynököket
Az Apple bemutatta a SCLATE nevű végrehajtási környezetet, amely hosszú, több munkameneten átívelő forgatókönyvekben képezi és értékeli az AI-ügynököket. A rendszer egy…

A Fireworks AI elindította a valós munkát mérő modellindexet
A Fireworks AI elindította a Specialized Intelligence Indexet, amely iparág-specifikus, gyakorlati feladatokon méri a nyílt, zárt és specializált AI-modellek…
KutatásAz OpenAI szerint a SWE-Bench Pro feladatainak 30 százaléka hibás
Az OpenAI visszavonta korábbi ajánlását a SWE-Bench Pro használatára, miután egy audit szerint a benchmark feladatainak mintegy 30 százaléka hibás. A vállalat szerint ez…