Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Harvard benchmark méri, képes-e egy AI robotot tervezni

2026. szeptember 17.Forrás: Harvard SEAS
Harvard benchmark méri, képes-e egy AI robotot tervezni
Kép: Harvard SEAS

A Harvard és a Georgia Tech kutatói bemutatták az RLE-Bench nevű nyílt forráskódú tesztet, amely azt vizsgálja, hogy az AI-kódoló ügynökök képesek-e fizikai robotok tervezéséhez és működtetéséhez szükséges mérnöki feladatokat elvégezni. A benchmark 48 feladatot tartalmaz, a vezérlési algoritmusok fejlesztésétől a robotikai hardver és interfészek tervezéséig.

A lényeg röviden
  • Az RLE-Bench 48 robotikai mérnöki feladatot tartalmaz.
  • A benchmark négy területet vizsgál, köztük a vezérlést, az érzékelést és a mechanikai tervezést.
  • A feladatok szimulált környezetben, fizikai korlátok mellett futnak.
  • A teszt nyílt forráskódú és nyilvánosan elérhető.
  • A kutatók a közösség segítségével szélesítenék a benchmarkot.

A robotikai mérnöki munkát vizsgálja

Az RLE-Benchet a Harvard John A. Paulson School of Engineering and Applied Sciences és a Georgia Tech School of Computational Science and Engineering kutatói fejlesztették. A munkát Na Li, a Harvard SEAS villamosmérnöki és alkalmazott matematikai professzora, valamint Bo Dai, a Georgia Tech adjunktusa vezette. A csapat tagja volt Haitong Ma és Chenxiao Gao, a Harvard doktorandusza, továbbá Rushi Qiang a Georgia Techtől.

A kutatók szerint az RLE-Bench egy olyan AI-robotikaitanulási mérnök munkáját próbálja szabványosított módon mérni, amelyhez gépi tanulási, robotikai, irányítástechnikai, szoftveres és hardveres ismeretekre is szükség van. A teszt célja, hogy közös mércét adjon az új és a már létező AI-rendszerek összehasonlításához.

Négy területen, szimulációban tesztelik az ügynököket

Az RLE-Bench feladatai négy fő területre oszlanak: interaktív vezérlésre, irányítási szabályok fejlesztésére, érzékelésre és állapotbecslésre, valamint mechanikai tervezésre. A feladatok így nem pusztán azt mérik, hogy egy ügynök képes-e kódot írni, hanem azt is, hogy tud-e gondolkodni az érzékelésről, a rendszerdinamikáról, a stabilitásról, a hardver korlátairól és a szoftver, illetve a fizikai világ kapcsolatáról.

A feladatok szimulált környezetben futnak. Az ügynökök létrehozhatják, végrehajthatják, megvizsgálhatják és továbbfejleszthetik a megoldásaikat, miközben a problémák fizikai korlátokhoz kötődnek. Egy működőnek tűnő terv például instabillá válhat, ha terhet helyeznek rá, vagy azért bukhat el, mert nem számol megfelelően a tömeggel, a nyomatékkal vagy a geometriával.

Az egyik példafeladatban az ügynöknek olyan univerzális mobil alapot kell terveznie több robotkarhoz, amely lehetővé teszi a polcon különböző magasságban lévő tárgyak elérését. A kar minden célt elérhet, miközben a teljes robot egyes stabilitási teszteken felborul. Haitong Ma szerint egy számítási szempontból ésszerűnek látszó megoldásnál a teljes rendszer fizikájának figyelembevétele fontos hibaforrásokat tárhat fel.

Nyílt forráskódú alap a későbbi bővítéshez

Az RLE-Bench nyílt forráskódú és nyilvánosan elérhető, ezért kutatók és fejlesztők közös feladatsoron értékelhetik az AI-rendszereket. A Harvard közleménye szerint a benchmark jelenlegi változata alapot adhat egy szélesebb közösségi teszthez.

Na Li úgy fogalmazott: „A benchmarkok azért fontosak, mert közös mércét adnak a területnek. Így azonos feltételek mellett hasonlíthatjuk össze a rendszereket, és azonosíthatjuk, hol maradtak fontos képességbeli hiányosságok.” A kutató szerint a robotikában már több értékes benchmark létezik, ezek azonban gyakran elsősorban a vezérlési szabályok tanulására és értékelésére összpontosítanak.

Az RLE-Bench 1.0 még nem fedi le a robotikai mérnöki munka teljes körét. A közlemény olyan további területeket említ, mint az új hardverek tervezése, a szimuláció, a rendszerintegráció, a hibakeresés, a biztonság és a telepítés. A készítők azt remélik, hogy a kutatók és a robotikai szakemberek saját mérnöki problémáikkal bővítik a feladatsort. Li szerint az RLE-Bench 2.0 célja a kép teljessé tétele arról, mire van szüksége egy AI-rendszernek ahhoz, hogy robotikai mérnökként működjön.

Forrás
Harvard SEAS: Can Your AI Engineer a Robot?

Kapcsolódó hírek

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…

Az Apple kutatása szerint kevésbé számít az ügynökök körítése
Kutatás2026. október 1.

Az Apple kutatása szerint kevésbé számít az ügynökök körítése

Az Apple kutatói szerint a gépi tanulási feladatokra fejlesztett ügynököknél az alapul szolgáló nagy nyelvi modell teljesítménye fontosabb lehet az ügynök köré épített…

A Jev gyorsabban és olcsóbban értékelte a kódoló ügynök lépéseit
Kutatás2026. szeptember 30.

A Jev gyorsabban és olcsóbban értékelte a kódoló ügynök lépéseit

A TypeSafe AI Jev modellje gyorsabban és alacsonyabb becsült költséggel értékelte egy kódoló ügynök parancsainak kockázatát, mint a tesztben használt két általános célú…