Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Scale AI szerint négy szinten kell tesztelni a fejlett AI-modelleket

2026. október 6.Forrás: Scale AI
A Scale AI szerint négy szinten kell tesztelni a fejlett AI-modelleket
Kép: Scale AI

Az Egyesült Államoknak a mesterséges intelligencia teljes életciklusát lefedő tesztelési és értékelési rendszert kell kiépítenie a Scale AI szerint. A vállalat négy különálló szintet azonosít a modellfejlesztéstől a bevezetés utáni folyamatos ellenőrzésig.

A lényeg röviden
  • A Scale AI négyfázisú AI-tesztelési életciklust javasol.
  • A vállalati belső tesztelés mellett független állami értékelést sürget.
  • A bevezetett AI-rendszereket működés közben is folyamatosan vizsgálni kell.
  • A kormányzati kapacitások és a független szakértelem jelenleg korlátozottak a vállalat szerint.

A vállalati tesztelés önmagában nem elég

A Scale AI blogján, 2026. október 6-án megjelent írás szerint Washingtonnak világos hatáskört kell adnia a változtatásra képes kormányzati tisztviselőknek, és forrásokat kell biztosítania a nagy képességű AI-modellek bevezetés előtti értékelésére. A vállalat szerint külön kapacitásra is szükség van, megfelelő szövetségi finanszírozással.

Francis de Souza, a Scale AI vezérigazgatója korábban arra szólította fel Washingtont, hogy az Egyesült Államok erősítse meg szövetségi tesztelési és értékelési képességeit. A Scale AI szerint a frontier modelleket fejlesztő laborok saját kutatás-fejlesztési tesztelése nélkülözhetetlen, de önmagában nem elegendő ahhoz, hogy a kormány megértse a gyorsan változó technológia képességeit és kockázatait.

Az értékelés a vállalat álláspontja szerint nem egyszeri mérés, és nem alkalmazható minden modellre ugyanúgy. Több, egymásra épülő vizsgálatra és kockázatcsökkentési intézkedésre van szükség a modell életciklusának különböző szakaszaiban.

Négy szakaszból állna az értékelési életciklus

Az első szint a kutatás-fejlesztési tesztelés, amelyet maguk a frontier laborok végeznek. Ilyenkor azt vizsgálják, hogyan viselkedik az új modell, milyen képességei vannak, hol teljesít jól vagy rosszul, és szükség van-e védelmi korlátokra. A Scale AI példaként az Anthropic Frontier Safety Roadmap és a Meta Advanced AI Scaling Framework dokumentumait említi, amelyek önkéntes vállalati kereteket írnak le.

A második szint a bevezetés előtti modelltesztelés. Ezt a laborok belső értékelése után, a nyilvános kiadás előtt kellene elvégezni. A vizsgálat azt méri, mennyire működnek a biztonsági korlátok, milyen védelmek törhetők át, és hogyan kezeli a modell a szélsőséges eseteket. A Scale AI szerint ez azért fontos, mert a laborok saját modelljeiket értékelik.

A harmadik szint a bevezetés előtti rendszertesztelés. Itt az a szervezet vizsgálja az AI működését, amely a modellt döntéshozatalban, ügynöki munkafolyamatokban, ügyféloldali szolgáltatásban vagy felhasználói alkalmazásban használja. A modell korábbi tesztjeitől független kérdés, hogyan viselkedik valós rendszerben, eszközökkel, csatlakozókkal, memóriával, fájlengedélyekkel vagy más modellek meghívásának lehetőségével.

A negyedik szint a bevezetés utáni tesztelés. Ez folyamatos feladat, mivel egy egyszeri mérés nem mutatja meg, mi történik hat hónappal vagy egy évvel később. A rendszer viselkedése eltérhet a kezdeti biztonsági elvárásoktól, a felhasználók új bemeneteket adhatnak, a támadók pedig többfordulós jailbreakelési kísérletekkel próbálkozhatnak.

A Scale AI nagyobb állami szerepet sürget

A Scale AI szerint jelenleg nincs olyan amerikai szövetségi törvény, amely megakadályozná, hogy frontier AI-modelleket kormányzati előzetes felülvizsgálat vagy tesztelés nélkül tegyenek elérhetővé a nyilvánosság számára. A vállalat megemlíti a Trump-kormányzat önkéntes értékelési keretét, a 14409-es végrehajtási rendeletet is, amely a laborok és a kormány együttműködését szorgalmazta a nagy képességű kiberbiztonsági modellek tesztelésében. A Scale AI szerint az összes jelentős amerikai frontier labor megállapodást írt alá a kormánnyal modelljei általánosabb tesztelésének lehetővé tételéről, és a legtöbb megállapodás megelőzte a júniusi rendeletet.

A vállalat úgy látja, hogy a kormányzaton belül ma ritkán áll rendelkezésre a szigorú és mélyreható teszteléshez szükséges kapacitás és szakértelem. Ezért független szakértőkkel és szervezetekkel közösen kellene kialakítani az értékelési kereteket és a felülvizsgálati küszöböket.

A Scale AI álláspontja szerint az egyértelműbb és következetesebb kormányzati elvárások segíthetik az iparág beruházásait, a fejlett modellek fejlesztését és azok valós munkafolyamatokba történő bevezetését. A laborok, a független tesztelők, a kormányok és a vállalatok közös felelőssége lenne a valós hibák felismerése, a kockázatok megértése és a működés közbeni eltérések kezelése.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A mesterséges intelligencia új lendületet ad a külföldi propagandának
Biztonság és etika2026. október 5. 18:00

A mesterséges intelligencia új lendületet ad a külföldi propagandának

A külföldi befolyásolási műveletek egyre több eszközt kapcsolnak össze, köztük a hagyományos propagandát, a közösségi médiát, a fedett hálózatokat, az influenszereket és…

A Grok miatt indított perek összevonását kéri egy amerikai ügyvédi iroda
Biztonság és etika2026. október 5. 17:37

A Grok miatt indított perek összevonását kéri egy amerikai ügyvédi iroda

A Potts Law Firm azt kéri az amerikai Többkerületi Peres Ügyek Bírói Testületétől, hogy egyesítse és közös előzetes eljárásban kezelje azokat a szövetségi pereket…

A Scale AI szerint Washingtonnak saját AI-tesztelési kapacitás kell
Cégek és üzlet2026. szeptember 25.

A Scale AI szerint Washingtonnak saját AI-tesztelési kapacitás kell

A Scale AI szerint az amerikai szövetségi kormány nem tudja megfelelően mérni a legfejlettebb mesterségesintelligencia-modellek kockázatait, ezért független tesztelési…