A ProteinGuide kísérleti adatokkal tereli a fehérjetervező AI-t
A Berkeley kutatói kifejlesztették a ProteinGuide módszert, amely kísérleti adatokkal irányítja a meglévő fehérjegeneráló modelleket a kívánt tulajdonságok felé, azok újratanítása nélkül. A Nature Biotechnology tanulmánya szerint a módszer egyetlen tervezési kör után is nagy aktivitású adeninalapú bázisszerkesztőt eredményezett.
- A ProteinGuide újratanítás nélkül irányítja a meglévő fehérjegeneráló modelleket.
- A módszer külön, kísérleti adatokon betanított tulajdonságbecslőt használ.
- A ProteinGuide többek között az ESM3 és a ProteinMPNN modellekkel is alkalmazható.
- Egyetlen irányított tervezési kör után nagy aktivitású adeninalapú bázisszerkesztők születtek.
- A módszer teljesítményét a rendelkezésre álló kísérleti adatok korlátozza.
Kísérleti adatokkal irányítják a modelleket
A fehérjetervező generatív modellek természetes fehérjeszekvenciák és -struktúrák nagy adathalmazain tanulnak, ezért sokféle, a természetben korábban nem látott szekvenciát is képesek létrehozni. A kutatóknak azonban rendszerint meghatározott célokra van szükségük, például terápiákhoz, bioszenzorokhoz vagy ipari enzimekhez.
A fehérjék funkcióiról és arról, hogy egy-egy szekvenciamódosítás miként befolyásolja ezeket a funkciókat, kevesebb adat áll rendelkezésre, mint a szekvenciákról és a struktúrákról. A ProteinGuide egy külön, kísérleti méréseken betanított tulajdonságbecslőt kapcsol a generatív modellhez. Ez a becslő az iteratív generálási folyamat minden lépésében a kívánt tulajdonságok felé tereli a következő választ.
A módszerhez nincs szükség a generatív modell újratanítására, és a modell paramétereinek elérése sem feltétel. Junhao Xiong, a tanulmány egyik vezető szerzője szerint így rugalmasabban használhatók a nagy, előre betanított vagy részben hozzáférhető paraméterű modellek.
Több fehérjemodellen és célon tesztelték
A ProteinGuide a Berkeley-i Jennifer Listgarten és David Savage professzorok vezette kutatásból született. A módszer a Listgarten-csoport korábbi, Discrete Guidance nevű keretrendszerére épül, és több széles körben használt fehérjegeneráló modellre is kiterjesztették, köztük a ProteinMPNN-re és az ESM3-ra.
A számítógépes tesztekben a kutatók fehérjestabilitást és aktivitást javítottak, valamint egymással versengő célokat is egyensúlyoztak. Egy példában egy szenzor ólomhoz való kötődését kellett növelni úgy, hogy közben a nem kívánt cinkkötődés csökkenjen.
A hagyományos utólagos szűrésnél a modell által létrehozott fehérjéket kísérleti adatokon alapuló előrejelzésekkel rangsorolják. A finomhangolás ezzel szemben további tanítást igényel, és a modellt túl szűken a kívánatos példák köré összpontosíthatja. A ProteinGuide ezeket a lépéseket a generálás közben végzett irányítással váltja ki.
Egy tervezési kör után is nagy aktivitású bázisszerkesztők születtek
A módszer laboratóriumi tesztjéhez a kutatók adeninalapú bázisszerkesztőket vizsgáltak. Ezek CRISPR-alapú eszközök, amelyek a TadA baktériumenzim módosított változatát tartalmazzák, és az adenint guaninná alakíthatják a DNS meghatározott helyein.
Az ESM3 és az FMIF előre betanított modellekkel először 2000 változatból álló könyvtárat terveztek. Maria Lukarska és munkatársai egy baktériumokon végzett, nagy áteresztőképességű kiválasztási vizsgálattal megmérték a DNS-szerkesztési aktivitást, majd ezekből az adatokból aktivitásbecslőt tanítottak.
A ProteinGuide ezután egy második, szintén 2000 változatból álló könyvtár létrehozását irányította. Ebben több olyan változat szerepelt, amely aktívabb volt az első könyvtár bármely tagjánál. Az egyik legjobb eredmény aktivitása két korábban fejlesztett, nagy aktivitású szerkesztő, az ABE7.10 és az ABE8 közé esett. Az ABE7.10 hét irányított evolúciós kör eredménye volt.
A sikeres változatok genetikai szempontból sokfélék maradtak, vagyis nem ugyanazokat a mutációkat hordozták. A kutatók szerint ez arra utal, hogy a fehérjeszekvenciák terében több különböző evolúciós út is elvezethet hasonló működéshez. A módszer hatékonyságát ugyanakkor az irányításhoz felhasznált mérési adatok minősége és mennyisége korlátozza.
Berkeley EECS: Guiding AI toward better protein design


