Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Fehérjemodellek segíthetnek kiszűrni az AI-ügynökök biológiai kockázatait

2026. október 1.Forrás: Goodfire Research
Fehérjemodellek segíthetnek kiszűrni az AI-ügynökök biológiai kockázatait
Kép: Goodfire Research

A Goodfire olyan biosecurity-monitorokat fejlesztett, amelyek fehérjemodellekből származó embeddingekkel vizsgálják az AI-ügynökök által kezelt biológiai szekvenciákat. A vállalat szerint a módszer a kettős felhasználású feladatoknál kevesebb ártalmatlan kérést blokkol, miközben hatékonyabban jelzi a kockázatosakat.

A lényeg röviden
  • A Goodfire fehérjemodell-embeddingekkel elemzi az AI-ügynökök által kezelt szekvenciákat.
  • A monitorokat kettős felhasználású biológiai feladatokon tesztelték.
  • A vállalat szerint a módszer ellenállóbb az átfogalmazással és fragmentálással szemben.
  • A vizsgálatokban a szekvenciánkénti elemzés ezredmásodpercek alatt futott.
  • A Goodfire a tervezési és a DNS-szintézis előtti szűrést is fontosnak tartja.

A feladat kontextusa önmagában nem mindig elég

A Goodfire október 1-jén közzétett kutatása szerint az AI-ügynökök egyre összetettebb feladatokat végezhetnek DNS- és fehérjeszekvenciákon, miközben nem mindig ismerik fel, ha egy szekvencia biztonsági szempontból aggályos. A biológiai kutatásban sok feladat kettős felhasználású: ugyanaz a módszer ártalmatlan és veszélyes célokra is alkalmazható.

Ez megnehezíti a jelenlegi, feladatalapú ellenőrzést. Ha a monitor kizárólag a feladat leírását vizsgálja, előfordulhat, hogy legitim kutatást blokkol, vagy nem jelzi a káros munkát. A Goodfire ezért olyan monitorokat készített, amelyek a feladathoz tartozó szöveges kontextus mellett magukat a biológiai szekvenciákat is elemzik.

Fehérje-embeddingekkel keresik a nehezebben felismerhető mintákat

A rendszer fehérje nyelvi modellekből származó embeddingeket használ. Ezek a vállalat leírása szerint olyan biológiai kapcsolatokat is hozzáférhetővé tehetnek, amelyeket önmagukban a szekvenciaalapú módszerek, a szerkezeti mutatók vagy más mérőszámok nem feltétlenül ragadnak meg.

A megközelítést egy saját benchmarkon vizsgálták. Ebben olyan kettős felhasználású feladatok szerepeltek, mint az úgynevezett inverse folding, az újrahajtogatás és a szekvenciafragmentálás. A feladatok között csak a bemenetként használt szekvencia különbözött, így a biztonsági döntéshez annak tartalmát kellett figyelembe venni.

A tesztekben fehérjetoxinok szolgáltak aggályos szekvenciaként. A benchmark természetes fehérjéket és olyan előre létrehozott, átalakított szekvenciákat is tartalmazott, amelyek hasonló szerkezettel és hajtogatási minőséggel rendelkeztek, mint az eredetiek. A Goodfire szerint a saját monitorai az értékelt, élvonalbeli modellek védelmi megoldásainál jobb kompromisszumot értek el az aggályos és az ártalmatlan példák felismerése között.

A fragmentálás és az átfogalmazás sem rejti el könnyen a kockázatot

A kutatás egyik célja az volt, hogy a monitor akkor is működjön, amikor a szekvenciát módosítják vagy feldarabolják. Az új fehérjék tervezésénél létrehozhatók olyan változatok, amelyek megőrzik az eredeti szerkezetet, de eltérő szekvenciát használnak. A DNS-szintézis előtt a hosszú szekvenciákat szintén részekre oszthatják, ami megnehezítheti a veszélyes minták felismerését.

A Goodfire embeddingalapú osztályozói a vállalat eredményei szerint minden vizsgált hosszúságnál felülmúlták a szekvenciaalapú szűrést a korábban visszatartott természetes fehérjék fragmentumain. Az eredeti fehérjék adatbázisban szereplő átfogalmazásainál a módszer megközelítőleg 0,98-as AUROC-értéket ért el. Amikor az eredeti szekvenciák hiányoztak az adatbázisból, minden módszer teljesítménye romlott, az embeddingalapú megoldás azonban az alacsony téves riasztási arányoknál továbbra is előnyben maradt.

A vizsgálat kiterjedt korábban nem látott fehérjecsaládokra, enzimes toxinokra és egy külső, bakteriális toxinokat tartalmazó adathalmazra is. A vállalat ugyanakkor jelzi, hogy az átfogalmazási eredmények számítógépes becsléseken alapulnak, ezért önmagukban nem bizonyítják, hogy az újratervezett fehérjék biológiailag aktívak maradtak.

A szűrés az AI-ügynökök munkafolyamatának része lehet

A Goodfire szerint a módszer szekvenciánként ezredmásodpercek alatt fut, és a vizsgálatokban sebessége összevethető volt az adatbázis-alapú szekvenciakereséssel. A detektálás a vállalat eredményei alapján a nagyobb teljesítményű fehérjemodellekkel javult, így a biológiai tervezési képességek fejlődésével a szűrés is erősödhet.

A cég a DNS-szintézis előtti ellenőrzés mellett a tervezési szakaszban, különösen az AI-ügynökök munkafolyamataiban is fontosnak tartja a vizsgálatot. A Goodfire közlése szerint frontier laborokkal és következtetési szolgáltatókkal dolgozik a monitorok bevezetésén, és érdeklődő szervezetek jelentkezését várja.

Kapcsolódó hírek

A Goodfire szerint a logitek új monitorként jelezhetik az értékelési tudatosságot
Kutatás2026. október 1.

A Goodfire szerint a logitek új monitorként jelezhetik az értékelési tudatosságot

A Goodfire Research „Logits as a new monitor for evaluation awareness” címmel tett közzé kutatási bejegyzést. A cím alapján a munka azt vizsgálja, hogyan használhatók a…

A Goodfire kutatási oldala már az arXiv-cikkhez irányít
Kutatás2026. október 1.

A Goodfire kutatási oldala már az arXiv-cikkhez irányít

A Goodfire „Adversarial Examples Are Not Bugs, They Are Superposition” című kutatási oldala jelenleg az arXiv-papírhoz irányítja az olvasókat. A megadott oldalon a…

Proteinmodellekkel javítaná az AI-ügynökök biológiai biztonságát a Goodfire
Biztonság és etika2026. október 1.

Proteinmodellekkel javítaná az AI-ügynökök biológiai biztonságát a Goodfire

A Goodfire olyan biztonsági monitorokat fejlesztett AI-ügynökökhöz, amelyek a fehérjeszekvenciák és a feladat kontextusa alapján mérik a biológiai kutatási feladatok…