A Snorkel AI 30 millió dollárral bővíti a nyílt AI-benchmarkok támogatását

A Snorkel AI 30 millió dollárra emeli nyílt benchmarkokat támogató programjának keretét. A vállalat új értékelési módszereket, benchmarkok folyamatos tesztelését és független kutatókat finanszírozna.
- A Snorkel AI 30 millió dollárra növeli az Open Benchmarks Grants keretét.
- A program biztonsági, kiberbiztonsági, fizikai AI- és tudományos benchmarkokat is támogat.
- Új Open Benchmarks Red Team vizsgálja a tesztek gyenge pontjait.
- Snorkel Research Fellowship ösztöndíj indul független értékelési kutatásokhoz.
Tízszeresére nő a támogatási keret
A Snorkel AI október 7-én jelentette be, hogy a korábbi 3 millió dolláros Open Benchmarks Grants vállalását tízszeresére, összesen 30 millió dollárra bővíti. A program kutatókat, szakterületi szakértőket és nyílt forráskódú csapatokat támogat, amelyek robusztus, nyílt és a legfejlettebb AI-rendszerek értékelésére alkalmas benchmarkokat fejlesztenek.
A vállalat szerint a korábbi támogatási együttműködésekben olyan benchmarkok mögött álló csapatokkal dolgozott, mint a Terminal-Bench, a TB-Science, az ARC-AGI-3, az OSWorld 2.0, az Agents’ Last Exam, a Continual Learning Bench, a Senior SWE-Bench és a SlopCodeBench. A Snorkel közlése szerint ezeknél a projekteknél értékelési módszerek kialakításában, feladatépítési folyamatok fejlesztésében és minőség-ellenőrzésben is részt vett.
A régi benchmarkok könnyebben kijátszhatóvá válhatnak
A benchmarkok mérőszámokat adnak a modellek fejlődésének követéséhez, és irányt mutathatnak az AI-rendszerek fejlesztésében. A Snorkel szerint azonban ha a benchmarkok fejlesztése lemarad a modellek fejlődési ütemétől, csökken az értékük. A vállalat ezt a problémát a „benchmaxxing” jelenségével is összekapcsolja: ha a tesztek túl egyszerűvé, statikussá és egymáshoz hasonlóvá válnak, a modelleket könnyebb közvetlenül ezekre optimalizálni.
A cég ezért változatosabb, rendszeresen frissített és egymástól függetlenül fejlesztett benchmarkokat sürget. A támogatási területek között szerepel a biztonság és az összehangolás, a kiberbiztonság, a fizikai AI, a tudományos ügynökök, a hosszú ideig tartó munkafolyamatok, a nyílt végű kimenetek, a dinamikus környezetek és az emberi teljesítményre gyakorolt hatás mérése.
A Snorkel három fő irányt emel ki. A teszteknek összetettebb környezeteket és bemeneteket kell kezelniük, például szakértői tudást, rendezetlen kontextust, többféle modalitást és összetett eszközhasználatot. A második irány az autonómia időtartama, vagyis annak vizsgálata, hogy egy ügynök mennyi ideig képes megbízhatóan dolgozni, fenntartani a kontextust, hibát javítani és változó célokhoz alkalmazkodni. A harmadik a kimenetek összetettsége, ahol a minőség, a hasznosság és a kockázatok kezelése szakértői megítélést igényelhet.
Új red team és kutatói ösztöndíj indul
A kibővített program része lesz az Open Benchmarks Red Team, amely a benchmarkok gyenge pontjainak folyamatos feltárásában és javításában segíti a fejlesztőket. A csapat többek között a jutalom kijátszását, az adatszennyeződést, a félreérthető feladatokat, a hibás ellenőrzőket, a kevéssé változatos adateloszlásokat és az elavult feladathalmazokat vizsgálja majd.
A Snorkel szerint a munkában szakterületi szakértői ellenőrzés, minőség-ellenőrzési módszerek és hibaanalízis-rendszerek is szerepet kapnak. A feltárt eredményeket először az adott benchmark fejlesztőcsapatával osztják meg, hogy közösen erősítsék a tesztet.
A vállalat emellett Snorkel Research Fellowship néven kutatói ösztöndíjprogramot indít. A résztvevők saját kutatási kérdéseket határozhatnak meg, és a tervezéstől a nyilvános közzétételig vezethetik a munkát. Ehhez Snorkel-kutatói társtémavezetést, szakterületi szakértőket, számítási kapacitást, valamint kutatási és mérnöki támogatást biztosítanak.
A felhasználók megbízhatóbb mérésekre számíthatnak
A Snorkel kezdeményezése a nyílt benchmarkok ellenőrizhetőségét és ismételhetőségét kívánja erősíteni. A vállalat szerint a nyílt módszerek lehetővé teszik, hogy a kutatók megvizsgálják az értékeléseket, megismételjék az eredményeket, és a modellek fejlődésével együtt javítsák a feladatokat és az osztályozási mechanizmusokat.
Az új támogatások közvetlenül a fejlesztők, kutatók és AI-rendszereket értékelő csapatok számára jelenthetnek több erőforrást. A cél olyan tesztelési ökoszisztéma kialakítása, amely a Snorkel szerint lépést tud tartani a hosszabb ideig működő, összetettebb és változó környezetekben dolgozó AI-ügynökökkel.
Snorkel AI: Frontier AI is Accelerating. Open Benchmarks Need to Keep Up.


