Az LLM-ek exportellenőrzési feladatban segíthetik az amerikai BIS-t

A nagy nyelvi modellek előzetes tesztjei ígéretes eredményeket mutattak az exportellenőrzési árubesorolásban, de az amerikai Bureau of Industry and Security, vagyis BIS számára még további vizsgálatokra van szükség. Az Institute for AI Policy and Strategy pilotprogramot javasol a technológia valós környezetben történő kipróbálására.
- Az IAPS a Claude Opus 4.8 modellt tesztelte exportellenőrzési árubesorolásra.
- A modell több szabályforrást, képet, tudományos ismeretet és matematikai műveletet is használt.
- Az árubesorolásban a megengedhető hibaszint nulla, ezért emberi ellenőrzésre lehet szükség.
- Az IAPS valósághű pilotprogramot javasol a BIS számára.
- A ChatGPT Enterprise az IAPS szerint alkalmas lehet a programhoz, de más szolgáltatókat is vizsgálni kellene.
Az exportengedélyezésben alkalmaznák a modelleket
Az árubesorolás során meg kell állapítani, hogy egy fizikai termék, szoftver vagy nem kézzelfogható technológia melyik Export Control Classification Number, röviden ECCN alá tartozik a Commerce Control Listen. Az ECCN legalább öt karakterből áll: az első szám a lista kategóriáját, a betű a termékcsoportot, a további három szám pedig az adott terméktípust jelöli. Egyes kódok további alpontokat is tartalmaznak.
A BIS az Egyesült Államok kettős felhasználású termékekre vonatkozó exportellenőrzését adminisztrálja. Az IAPS augusztus 5-én közzétett elemzése szerint az árubesorolás részleges automatizálása gyorsíthatná az exportengedélyek feldolgozását, miközben a hivatal munkatársai tapasztalatot szerezhetnének a házon belüli mesterségesintelligencia-eszközök fejlesztésében.
Az elemzés szerint a Center for Strategic and International Studies 2026 áprilisában végzett felmérésében exportőrök arról számoltak be, hogy a BIS engedélyezési eljárásai lassultak, és csökkent az átláthatóság. Jeffrey Kessler, a kereskedelmi minisztérium ipari és biztonsági ügyekért felelős helyettes államtitkára július 14-én a képviselőház külügyi bizottsága előtt arról beszélt, hogy a BIS fokozott ellenőrzést alkalmaz az engedélyeknél.
Ígéretes képességek, de nulla hibahatár
Az IAPS a Claude Opus 4.8 modellt vizsgálta kvalitatív módszerekkel. A modell csak minimális támogatást kapott, egy olyan „ecfr” eszközt használhatott, amely hozzáférést biztosított a Code of Federal Regulations API-jához. A kutatók szerint az árubesorolásban elfogadható hibaszint nulla. Ha egy modell hibázik, az eredményt embernek kell ellenőriznie, ám az ellenőrzés ugyanannyi munkát igényelhet, mint a besorolás közvetlen elvégzése. Ezért a rendszernek legalább egy emberi engedélyezési tisztviselő megbízhatóságát kell elérnie ahhoz, hogy érdemi munkaidőt takarítson meg.
A tesztelt modell egyes esetekben több szabályforrást is sikeresen kapcsolt össze. Például a Commerce Control List és az Export Administration Regulations 772. része, amely a fogalommeghatározásokat tartalmazza, alapján sorolt be egy terméket. A modell képi információt is felhasznált: egy képből helyesen azonosított egy NVIDIA Vera Rubin AI accelerator boardot. Egy ASML-termékről a név és a modellnév alapján felismerte, hogy ellenőrzés alá eső szélsőséges ultraibolya, vagyis EUV litográfiai gépről van szó.
A rendszer tudományos ismereteket és matematikai műveleteket is alkalmazott, többek között pontosan végzett mértékegység-átváltásokat. Ugyanakkor az egyik válaszban a kérdésben szereplő utalásokra támaszkodott, ezért az IAPS szerint a jövőbeli mérésekhez valós BIS-adatokhoz hasonló, hosszabb és zavaró információkat is tartalmazó bemenetekre lenne szükség.
Pilotprogrammal vizsgálná a BIS a gyakorlati használatot
Az IAPS szerint az egyszeri kérdésekkel végzett, minimális támogatású tesztelés nem elegendő a modellek megbízhatóságának szigorú felmérésére. Egy jövőbeli benchmarknak gyártói adatlapokat, a végfelhasználásról szóló leveleket és az engedélykérelmekhez általában benyújtott más információkat kellene tartalmaznia. A készletnek sokféle terméket és minél több egyedi határesetet kellene lefednie.
A kutatók több szolgáltató modelljeit, valamint eltérő képességszintű és költségű rendszereket is összehasonlítanának. Az IAPS felhívja a figyelmet arra, hogy a gyakran engedélyezett termékeknél kevésbé lehet szükség támogatásra, mert azok besorolását már sokszor felülvizsgálták. A segítséget inkább a ritkább vagy nehezebben besorolható tételek jelenthetik.
Az intézet azt javasolja, hogy a BIS az OMB M-25-21 számú memorandumának 4(a)(i) szakaszában szereplő pilotprogramos kivétel alapján indítson tesztet, és kérjen tanúsítást a kereskedelmi minisztérium mesterséges intelligenciáért felelős vezetőjétől. A programnak olyan, már elérhető eszközöket kellene használnia, amelyek kezelhetik az exportengedélyezési információkat, mivel ezek ellenőrzött, nem minősített információnak számítanak. Az IAPS szerint a FedRAMP Moderate szinten elérhető ChatGPT Enterprise alkalmas lehet erre, de alternatív szolgáltatók vizsgálatát is javasolja.
A pilotprogram fő kérdése az lenne, hogy a BIS számára hozzáférhető modellek milyen pontossággal végzik az árubesorolást, milyen hibák fordulnak elő leggyakrabban, és javíthatók-e ezek külső kiegészítő rendszerekkel vagy az adatok tisztításával. A tapasztalatok később más, engedélyezési, szabályalkotási és végrehajtási feladatok mesterséges intelligenciás támogatásához is alapot adhatnak.
Institute for AI Policy and Strategy: Evaluating LLM Capabilities for Commodity Classification


