Fehérjemodellek segíthetnek kiszűrni az AI-ügynökök biológiai kockázatait

A Goodfire olyan biosecurity-monitorokat fejlesztett, amelyek fehérjemodellekből származó embeddingekkel vizsgálják az AI-ügynökök által kezelt biológiai szekvenciákat. A vállalat szerint a módszer a kettős felhasználású feladatoknál kevesebb ártalmatlan kérést blokkol, miközben hatékonyabban jelzi a kockázatosakat.
- A Goodfire fehérjemodell-embeddingekkel elemzi az AI-ügynökök által kezelt szekvenciákat.
- A monitorokat kettős felhasználású biológiai feladatokon tesztelték.
- A vállalat szerint a módszer ellenállóbb az átfogalmazással és fragmentálással szemben.
- A vizsgálatokban a szekvenciánkénti elemzés ezredmásodpercek alatt futott.
- A Goodfire a tervezési és a DNS-szintézis előtti szűrést is fontosnak tartja.
A feladat kontextusa önmagában nem mindig elég
A Goodfire október 1-jén közzétett kutatása szerint az AI-ügynökök egyre összetettebb feladatokat végezhetnek DNS- és fehérjeszekvenciákon, miközben nem mindig ismerik fel, ha egy szekvencia biztonsági szempontból aggályos. A biológiai kutatásban sok feladat kettős felhasználású: ugyanaz a módszer ártalmatlan és veszélyes célokra is alkalmazható.
Ez megnehezíti a jelenlegi, feladatalapú ellenőrzést. Ha a monitor kizárólag a feladat leírását vizsgálja, előfordulhat, hogy legitim kutatást blokkol, vagy nem jelzi a káros munkát. A Goodfire ezért olyan monitorokat készített, amelyek a feladathoz tartozó szöveges kontextus mellett magukat a biológiai szekvenciákat is elemzik.
Fehérje-embeddingekkel keresik a nehezebben felismerhető mintákat
A rendszer fehérje nyelvi modellekből származó embeddingeket használ. Ezek a vállalat leírása szerint olyan biológiai kapcsolatokat is hozzáférhetővé tehetnek, amelyeket önmagukban a szekvenciaalapú módszerek, a szerkezeti mutatók vagy más mérőszámok nem feltétlenül ragadnak meg.
A megközelítést egy saját benchmarkon vizsgálták. Ebben olyan kettős felhasználású feladatok szerepeltek, mint az úgynevezett inverse folding, az újrahajtogatás és a szekvenciafragmentálás. A feladatok között csak a bemenetként használt szekvencia különbözött, így a biztonsági döntéshez annak tartalmát kellett figyelembe venni.
A tesztekben fehérjetoxinok szolgáltak aggályos szekvenciaként. A benchmark természetes fehérjéket és olyan előre létrehozott, átalakított szekvenciákat is tartalmazott, amelyek hasonló szerkezettel és hajtogatási minőséggel rendelkeztek, mint az eredetiek. A Goodfire szerint a saját monitorai az értékelt, élvonalbeli modellek védelmi megoldásainál jobb kompromisszumot értek el az aggályos és az ártalmatlan példák felismerése között.
A fragmentálás és az átfogalmazás sem rejti el könnyen a kockázatot
A kutatás egyik célja az volt, hogy a monitor akkor is működjön, amikor a szekvenciát módosítják vagy feldarabolják. Az új fehérjék tervezésénél létrehozhatók olyan változatok, amelyek megőrzik az eredeti szerkezetet, de eltérő szekvenciát használnak. A DNS-szintézis előtt a hosszú szekvenciákat szintén részekre oszthatják, ami megnehezítheti a veszélyes minták felismerését.
A Goodfire embeddingalapú osztályozói a vállalat eredményei szerint minden vizsgált hosszúságnál felülmúlták a szekvenciaalapú szűrést a korábban visszatartott természetes fehérjék fragmentumain. Az eredeti fehérjék adatbázisban szereplő átfogalmazásainál a módszer megközelítőleg 0,98-as AUROC-értéket ért el. Amikor az eredeti szekvenciák hiányoztak az adatbázisból, minden módszer teljesítménye romlott, az embeddingalapú megoldás azonban az alacsony téves riasztási arányoknál továbbra is előnyben maradt.
A vizsgálat kiterjedt korábban nem látott fehérjecsaládokra, enzimes toxinokra és egy külső, bakteriális toxinokat tartalmazó adathalmazra is. A vállalat ugyanakkor jelzi, hogy az átfogalmazási eredmények számítógépes becsléseken alapulnak, ezért önmagukban nem bizonyítják, hogy az újratervezett fehérjék biológiailag aktívak maradtak.
A szűrés az AI-ügynökök munkafolyamatának része lehet
A Goodfire szerint a módszer szekvenciánként ezredmásodpercek alatt fut, és a vizsgálatokban sebessége összevethető volt az adatbázis-alapú szekvenciakereséssel. A detektálás a vállalat eredményei alapján a nagyobb teljesítményű fehérjemodellekkel javult, így a biológiai tervezési képességek fejlődésével a szűrés is erősödhet.
A cég a DNS-szintézis előtti ellenőrzés mellett a tervezési szakaszban, különösen az AI-ügynökök munkafolyamataiban is fontosnak tartja a vizsgálatot. A Goodfire közlése szerint frontier laborokkal és következtetési szolgáltatókkal dolgozik a monitorok bevezetésén, és érdeklődő szervezetek jelentkezését várja.
Goodfire Research: Better biosecurity monitors for AI agents via protein embeddings - Goodfire


