Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

2026. október 1.Forrás: Apple
Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kép: Apple

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és ugyanazon nyelvi modell mellett. Az Apple kutatói szerint a teljesítmény fő mozgatórugója maga az alapul szolgáló modell lehet.

A lényeg röviden
  • Az Apple kutatói egyszerű kódoló ügynököt vetettek össze összetett harness-ekkel.
  • Az összehasonlítás azonos időkeret és ugyanazon élvonalbeli nyelvi modell mellett zajlott.
  • A nyílt forráskódú, korszerű harness-ek nem adtak előnyt az alapvonalhoz képest.
  • A kutatók szerint az alapul szolgáló modell volt a teljesítmény fő meghatározója.
  • Az összetett harness-ek fejlesztése az aktuális MLE-benchmarkokon gyenge megtérülést hozhat.

Egyszerű alapvonalat hasonlítottak össze összetett rendszerekkel

Az Apple Machine Learning Research oldalán 2026 októberében közzétett tanulmány a hosszabb, több lépésből álló gépi tanulási mérnöki feladatokat végző ügynököket vizsgálja. A szerzők, Kirill Brilliantov, Alejandro Hernández-Cano és Emmanuel Abbé azt elemezték, mennyit ad hozzá a teljesítményhez az ügynök köré épített, úgynevezett harness, vagyis a működését támogató gépezet.

A kutatás hátterében az áll, hogy az önálló gépi tanulási mérnöki ügynökök jelentős előrelépést értek el nyilvános ranglistákon, miközben a hosszú munkafolyamatok során időnként megtorpant a fejlődés. Erre válaszul egyre összetettebb rendszerek jelentek meg. Ezek több ügynököt koordináló szervezőket és külön információ-visszakereső alügynököket is alkalmazhatnak.

A tanulmány ezzel szemben egy egyszerűbb kódoló ügynököt vizsgált. Ebben a nyelvi modell közvetlenül hozzáfér a végrehajtási környezethez, és olvasási, írási, valamint bash parancsokat használhat. A kutatók ezt az alapvonalat nyílt forráskódú, korszerű ügynöki keretrendszerekkel vetették össze.

Azonos feltételek mellett nem láttak előnyt

Az Apple kutatói szerint azonos időkeret és ugyanazon élvonalbeli nyelvi modell mellett a vizsgált nyílt forráskódú, korszerű harness-ek nem nyújtottak előnyt az egyszerű kódoló ügynökhöz képest. A következtetésük szerint a teljesítmény elsődleges meghatározója maga az alapul szolgáló modell volt.

A szerzők nagyszabású, szisztematikus eltávolításos vizsgálatokat, úgynevezett ablation study-kat is végeztek. Ezek során a rendszer különböző rétegeinek és összetevőinek hatását vizsgálták. Eredményeik alapján a kódoló ügynöki környezetben a hozzáadott gépezet rétegei redundánssá válhatnak.

A tanulmány állítása az aktuális gépi tanulási mérnöki benchmarkokra vonatkozik. A kutatók arra jutottak, hogy az erős modellek köré kézzel kialakított, összetett harness-ek fejlesztésére fordított munka jelenleg gyenge megtérülést hoz ezeken a teszteken.

A kutatás az ügynökfejlesztés irányáról szóló vitát erősítheti

Az eredmény a gépi tanulási mérnöki ügynökök fejlesztői számára azt jelenti, hogy az összetettebb felépítés önmagában nem garantál jobb benchmarkeredményt. A vizsgált körülmények között a közvetlen környezeti hozzáféréssel működő, egyszerű alapvonal ugyanazt a teljesítményt érte el, mint a több rétegből álló megoldások.

A szerzők következtetése nem az ügynöki rendszerek minden lehetséges feladatára vonatkozik, hanem a tanulmányban vizsgált kódoló ügynöki beállításra és az aktuális MLE-benchmarkokra. A munka fő kérdése az volt, hogy egy erős ügynöknek mekkora támogató gépezetre van szüksége az önálló gépi tanulási mérnöki munkához. A válaszuk szerint jelenleg jóval kevesebbre lehet szükség, mint amit az egyre összetettebb rendszerek sugallnak.

Kapcsolódó hírek

Az Apple kutatása szerint kevésbé számít az ügynökök körítése
Kutatás2026. október 1.

Az Apple kutatása szerint kevésbé számít az ügynökök körítése

Az Apple kutatói szerint a gépi tanulási feladatokra fejlesztett ügynököknél az alapul szolgáló nagy nyelvi modell teljesítménye fontosabb lehet az ügynök köré épített…

Az Apple SCLATE rendszere hónapnyi ügynöki munkát órákra sűrít
Kutatás2026. szeptember 30.

Az Apple SCLATE rendszere hónapnyi ügynöki munkát órákra sűrít

Az Apple bemutatta a SCLATE nevű végrehajtási réteget, amely a folyamatos tanulásra képes AI-ügynökök képzését és értékelését támogatja. A rendszer egy hónapnyi…

Az Apple SCLATE rendszere hónapok helyett órák alatt teszteli az ügynököket
Kutatás2026. szeptember 30.

Az Apple SCLATE rendszere hónapok helyett órák alatt teszteli az ügynököket

Az Apple bemutatta a SCLATE nevű végrehajtási környezetet, amely hosszú, több munkameneten átívelő forgatókönyvekben képezi és értékeli az AI-ügynököket. A rendszer egy…