Proteinmodellekkel javítaná az AI-ügynökök biológiai biztonságát a Goodfire

A Goodfire olyan biztonsági monitorokat fejlesztett AI-ügynökökhöz, amelyek a fehérjeszekvenciák és a feladat kontextusa alapján mérik a biológiai kutatási feladatok kockázatát. A cég szerint a módszer kevesebb ártalmatlan kutatási feladatot utasít el, miközben hatékonyabban jelzi a veszélyes példákat.
- A Goodfire proteinmodellek beágyazásaira épülő biztonsági monitorokat fejlesztett.
- A rendszer a szekvenciát és a feladat kontextusát együtt vizsgálja.
- A cég szerint a monitor kevesebb ártalmatlan feladatot utasít el.
- A módszer a kutatásban milliszekundumok alatt elemzett egy szekvenciát.
- Az átalakított fehérjék eredményei számítógépes becsléseken alapulnak.
A biológiai feladatoknál a szekvencia is számít
A Goodfire október 1-jén közzétett kutatásában azt írja, hogy az AI-ügynökök egyre összetettebb műveleteket tudnak végezni biológiai szekvenciákon, például DNS-en és fehérjéken. Ezek a feladatok gyakran kettős felhasználásúak: ugyanaz a módszer támogathat ártalmatlan kutatást, vagy hozzájárulhat káros célú munkához, attól függően, milyen szekvenciáról van szó.
A jelenlegi, feladat-alapú biztonsági rendszerek ezért nehéz helyzetben vannak. Ha minden hasonló kérést blokkolnak, legitim kutatási munkát is akadályoznak, ha viszont csak a feladat leírását vizsgálják, nem feltétlenül veszik észre a problémás szekvenciákat. A Goodfire szerint a biológiai biztonság következő fontos területe az lehet, hogy a védelmi rendszerek már az ügynökök munkafolyamatai közben is ellenőrizzék a terveket.
Fehérjemodellek beágyazásai alapján működik a monitor
A fejlesztett monitorok fehérjékre tanított nyelvi modellekből származó beágyazásokat használnak. Ezek a reprezentációk a kutatás szerint olyan biológiai kapcsolatokat is megragadhatnak, amelyeket önmagában a szekvencia, a szerkezet vagy más hagyományos mérőszám nem feltétlenül jelez.
A rendszer a felhasználói interakcióból kinyeri a szekvenciákat, majd a feladat kontextusával együtt elemzi őket. A Goodfire egy saját tesztkészletet készített olyan kettős felhasználású feladatokból, mint az úgynevezett inverse folding, az új fehérjejelöltek előállítása és a szekvenciák feldarabolása. A tesztekben a kérés szövege azonos vagy hasonló lehetett, a kockázati szintet pedig maga a bemenetként megadott szekvencia határozta meg.
A vállalat protein toxinokat használt kockázatos szekvenciaként. A készletben természetes fehérjék, valamint olyan előre létrehozott, átalakított szekvenciák is szerepeltek, amelyek az eredetihez hasonló szerkezetet és hajtogatási minőséget őriztek meg.
Kevesebb téves elutasítás és jobb ellenállás az átalakításokkal szemben
A Goodfire beszámolója szerint a beágyazásokra épülő osztályozók felülmúlták a vizsgált alapmódszereket az olyan feladatoknál, amelyeknél a szokásos szűrés nehezebben működik. A rendszer a cég értékelésében minden vizsgált hosszúságnál jobb eredményt ért el a feldarabolt, korábban nem látott természetes fehérjéknél a szekvencia-alapú szűréshez képest.
Azoknál az átalakított szekvenciáknál, amelyek eredeti fehérjéi szerepeltek a szűrési adatbázisban, a módszer megközelítőleg 0,98-as AUROC-értéket ért el. Amikor az eredeti szekvenciák hiányoztak az adatbázisból, minden módszer teljesítménye romlott, de a Goodfire megoldása alacsony tévespozitív arány mellett továbbra is előnyben maradt. A kutatók teljes fehérjecsaládokat, enzimes toxinokat és egy külső, bakteriális toxinokat tartalmazó adatkészletet is vizsgáltak.
A rendszer milliszekundumok alatt dolgozik szekvenciánként, ami a kutatás mérési környezetében összevethető az adatbázis-alapú szekvenciakereséssel. A felismerés a fejlettebb fehérjemodellekkel javult, ezért a Goodfire szerint a módszer a biológiai tervezési képességek fejlődésével együtt is erősödhet. A vállalat frontvonalbeli AI-laborokkal és következtetési szolgáltatókkal dolgozik a monitorok bevezetésén.
A kutatás ugyanakkor jelzi, hogy az átalakított fehérjékre vonatkozó eredmények számítógépes becsléseken alapulnak, és önmagukban nem bizonyítják, hogy ezek a fehérjék biológiailag aktívak maradtak.
Goodfire Research: Better biosecurity monitors for AI agents via protein embeddings - Goodfire


