A Scale AI szerint négy szinten kell tesztelni a fejlett AI-modelleket

Az Egyesült Államoknak a mesterséges intelligencia teljes életciklusát lefedő tesztelési és értékelési rendszert kell kiépítenie a Scale AI szerint. A vállalat négy különálló szintet azonosít a modellfejlesztéstől a bevezetés utáni folyamatos ellenőrzésig.
- A Scale AI négyfázisú AI-tesztelési életciklust javasol.
- A vállalati belső tesztelés mellett független állami értékelést sürget.
- A bevezetett AI-rendszereket működés közben is folyamatosan vizsgálni kell.
- A kormányzati kapacitások és a független szakértelem jelenleg korlátozottak a vállalat szerint.
A vállalati tesztelés önmagában nem elég
A Scale AI blogján, 2026. október 6-án megjelent írás szerint Washingtonnak világos hatáskört kell adnia a változtatásra képes kormányzati tisztviselőknek, és forrásokat kell biztosítania a nagy képességű AI-modellek bevezetés előtti értékelésére. A vállalat szerint külön kapacitásra is szükség van, megfelelő szövetségi finanszírozással.
Francis de Souza, a Scale AI vezérigazgatója korábban arra szólította fel Washingtont, hogy az Egyesült Államok erősítse meg szövetségi tesztelési és értékelési képességeit. A Scale AI szerint a frontier modelleket fejlesztő laborok saját kutatás-fejlesztési tesztelése nélkülözhetetlen, de önmagában nem elegendő ahhoz, hogy a kormány megértse a gyorsan változó technológia képességeit és kockázatait.
Az értékelés a vállalat álláspontja szerint nem egyszeri mérés, és nem alkalmazható minden modellre ugyanúgy. Több, egymásra épülő vizsgálatra és kockázatcsökkentési intézkedésre van szükség a modell életciklusának különböző szakaszaiban.
Négy szakaszból állna az értékelési életciklus
Az első szint a kutatás-fejlesztési tesztelés, amelyet maguk a frontier laborok végeznek. Ilyenkor azt vizsgálják, hogyan viselkedik az új modell, milyen képességei vannak, hol teljesít jól vagy rosszul, és szükség van-e védelmi korlátokra. A Scale AI példaként az Anthropic Frontier Safety Roadmap és a Meta Advanced AI Scaling Framework dokumentumait említi, amelyek önkéntes vállalati kereteket írnak le.
A második szint a bevezetés előtti modelltesztelés. Ezt a laborok belső értékelése után, a nyilvános kiadás előtt kellene elvégezni. A vizsgálat azt méri, mennyire működnek a biztonsági korlátok, milyen védelmek törhetők át, és hogyan kezeli a modell a szélsőséges eseteket. A Scale AI szerint ez azért fontos, mert a laborok saját modelljeiket értékelik.
A harmadik szint a bevezetés előtti rendszertesztelés. Itt az a szervezet vizsgálja az AI működését, amely a modellt döntéshozatalban, ügynöki munkafolyamatokban, ügyféloldali szolgáltatásban vagy felhasználói alkalmazásban használja. A modell korábbi tesztjeitől független kérdés, hogyan viselkedik valós rendszerben, eszközökkel, csatlakozókkal, memóriával, fájlengedélyekkel vagy más modellek meghívásának lehetőségével.
A negyedik szint a bevezetés utáni tesztelés. Ez folyamatos feladat, mivel egy egyszeri mérés nem mutatja meg, mi történik hat hónappal vagy egy évvel később. A rendszer viselkedése eltérhet a kezdeti biztonsági elvárásoktól, a felhasználók új bemeneteket adhatnak, a támadók pedig többfordulós jailbreakelési kísérletekkel próbálkozhatnak.
A Scale AI nagyobb állami szerepet sürget
A Scale AI szerint jelenleg nincs olyan amerikai szövetségi törvény, amely megakadályozná, hogy frontier AI-modelleket kormányzati előzetes felülvizsgálat vagy tesztelés nélkül tegyenek elérhetővé a nyilvánosság számára. A vállalat megemlíti a Trump-kormányzat önkéntes értékelési keretét, a 14409-es végrehajtási rendeletet is, amely a laborok és a kormány együttműködését szorgalmazta a nagy képességű kiberbiztonsági modellek tesztelésében. A Scale AI szerint az összes jelentős amerikai frontier labor megállapodást írt alá a kormánnyal modelljei általánosabb tesztelésének lehetővé tételéről, és a legtöbb megállapodás megelőzte a júniusi rendeletet.
A vállalat úgy látja, hogy a kormányzaton belül ma ritkán áll rendelkezésre a szigorú és mélyreható teszteléshez szükséges kapacitás és szakértelem. Ezért független szakértőkkel és szervezetekkel közösen kellene kialakítani az értékelési kereteket és a felülvizsgálati küszöböket.
A Scale AI álláspontja szerint az egyértelműbb és következetesebb kormányzati elvárások segíthetik az iparág beruházásait, a fejlett modellek fejlesztését és azok valós munkafolyamatokba történő bevezetését. A laborok, a független tesztelők, a kormányok és a vállalatok közös felelőssége lenne a valós hibák felismerése, a kockázatok megértése és a működés közbeni eltérések kezelése.


