Harvard benchmark méri, képes-e egy AI robotot tervezni

A Harvard és a Georgia Tech kutatói bemutatták az RLE-Bench nevű nyílt forráskódú tesztet, amely azt vizsgálja, hogy az AI-kódoló ügynökök képesek-e fizikai robotok tervezéséhez és működtetéséhez szükséges mérnöki feladatokat elvégezni. A benchmark 48 feladatot tartalmaz, a vezérlési algoritmusok fejlesztésétől a robotikai hardver és interfészek tervezéséig.
- Az RLE-Bench 48 robotikai mérnöki feladatot tartalmaz.
- A benchmark négy területet vizsgál, köztük a vezérlést, az érzékelést és a mechanikai tervezést.
- A feladatok szimulált környezetben, fizikai korlátok mellett futnak.
- A teszt nyílt forráskódú és nyilvánosan elérhető.
- A kutatók a közösség segítségével szélesítenék a benchmarkot.
A robotikai mérnöki munkát vizsgálja
Az RLE-Benchet a Harvard John A. Paulson School of Engineering and Applied Sciences és a Georgia Tech School of Computational Science and Engineering kutatói fejlesztették. A munkát Na Li, a Harvard SEAS villamosmérnöki és alkalmazott matematikai professzora, valamint Bo Dai, a Georgia Tech adjunktusa vezette. A csapat tagja volt Haitong Ma és Chenxiao Gao, a Harvard doktorandusza, továbbá Rushi Qiang a Georgia Techtől.
A kutatók szerint az RLE-Bench egy olyan AI-robotikaitanulási mérnök munkáját próbálja szabványosított módon mérni, amelyhez gépi tanulási, robotikai, irányítástechnikai, szoftveres és hardveres ismeretekre is szükség van. A teszt célja, hogy közös mércét adjon az új és a már létező AI-rendszerek összehasonlításához.
Négy területen, szimulációban tesztelik az ügynököket
Az RLE-Bench feladatai négy fő területre oszlanak: interaktív vezérlésre, irányítási szabályok fejlesztésére, érzékelésre és állapotbecslésre, valamint mechanikai tervezésre. A feladatok így nem pusztán azt mérik, hogy egy ügynök képes-e kódot írni, hanem azt is, hogy tud-e gondolkodni az érzékelésről, a rendszerdinamikáról, a stabilitásról, a hardver korlátairól és a szoftver, illetve a fizikai világ kapcsolatáról.
A feladatok szimulált környezetben futnak. Az ügynökök létrehozhatják, végrehajthatják, megvizsgálhatják és továbbfejleszthetik a megoldásaikat, miközben a problémák fizikai korlátokhoz kötődnek. Egy működőnek tűnő terv például instabillá válhat, ha terhet helyeznek rá, vagy azért bukhat el, mert nem számol megfelelően a tömeggel, a nyomatékkal vagy a geometriával.
Az egyik példafeladatban az ügynöknek olyan univerzális mobil alapot kell terveznie több robotkarhoz, amely lehetővé teszi a polcon különböző magasságban lévő tárgyak elérését. A kar minden célt elérhet, miközben a teljes robot egyes stabilitási teszteken felborul. Haitong Ma szerint egy számítási szempontból ésszerűnek látszó megoldásnál a teljes rendszer fizikájának figyelembevétele fontos hibaforrásokat tárhat fel.
Nyílt forráskódú alap a későbbi bővítéshez
Az RLE-Bench nyílt forráskódú és nyilvánosan elérhető, ezért kutatók és fejlesztők közös feladatsoron értékelhetik az AI-rendszereket. A Harvard közleménye szerint a benchmark jelenlegi változata alapot adhat egy szélesebb közösségi teszthez.
Na Li úgy fogalmazott: „A benchmarkok azért fontosak, mert közös mércét adnak a területnek. Így azonos feltételek mellett hasonlíthatjuk össze a rendszereket, és azonosíthatjuk, hol maradtak fontos képességbeli hiányosságok.” A kutató szerint a robotikában már több értékes benchmark létezik, ezek azonban gyakran elsősorban a vezérlési szabályok tanulására és értékelésére összpontosítanak.
Az RLE-Bench 1.0 még nem fedi le a robotikai mérnöki munka teljes körét. A közlemény olyan további területeket említ, mint az új hardverek tervezése, a szimuláció, a rendszerintegráció, a hibakeresés, a biztonság és a telepítés. A készítők azt remélik, hogy a kutatók és a robotikai szakemberek saját mérnöki problémáikkal bővítik a feladatsort. Li szerint az RLE-Bench 2.0 célja a kép teljessé tétele arról, mire van szüksége egy AI-rendszernek ahhoz, hogy robotikai mérnökként működjön.
Harvard SEAS: Can Your AI Engineer a Robot?


