Feltérképezték, hogyan „gondolkodik” az Evo 2 genomikai modell

A Goodfire Research kutatói az Arc Institute Evo 2 genomikai alapmodelljének belső működését vizsgálták. Azonosítottak több, biológiailag értelmezhető mintázatot, és korai kísérletekben a DNS-szekvenciák, illetve új fehérjeszerkezetek generálásának irányításával is próbálkoztak.
- Az Evo 2 7B és 40B paraméteres változatban készült.
- A modell akár 1 millió bázispár hosszúságú szekvenciákat kezelhet.
- A Goodfire exon és intron határokhoz, valamint fehérjeszerkezetekhez kapcsolódó jellemzőket talált.
- A DNS-generálás és az új fehérjeszerkezetek irányítása egyelőre korai kutatási szakaszban van.
- Az Evo 2 a Goodfire frissítése szerint 2026 márciusára a Nature folyóiratban is megjelent.
Az Evo 2 a DNS szintjén dolgozik
Az Arc Institute által fejlesztett Evo 2 következő generációs biológiai alapmodell. A Goodfire leírása szerint 7 milliárd és 40 milliárd paraméteres változatban készült, és akár 1 millió bázispár hosszúságú szekvenciákat is képes feldolgozni nukleotidszintű felbontásban.
A modellt az élővilág valamennyi fő csoportját lefedő adatokon tanították. Ennek köszönhetően különböző biológiai összetettségi szinteken használható előrejelzésre és generálásra. A nyelvi modellekkel szemben az Evo 2 nem ember által közvetlenül olvasható szöveggel dolgozik, hanem DNS-szekvenciákkal, amelyekből a kódolt fehérjék és az összetett RNS-struktúrák is következnek.
Értelmezhető mintázatokat kerestek a modellben
A Goodfire és az Arc Institute együttműködésében úgynevezett ritka autoenkódereket, pontosabban BatchTopK sparse autoencodereket tanítottak az Evo 2 26. rétegén. Ezek segítségével a kutatók olyan jellemzőket próbáltak elkülöníteni, amelyek megmutatják, milyen biológiai fogalmakat és mintázatokat dolgoz fel a modell.
A vizsgálat során többek között exon és intron határokhoz, valamint a fehérjék másodlagos szerkezetéhez kapcsolódó jellemzőket találtak. Az exonok a fehérjék előállításához szükséges kódoló szakaszok, az intronok pedig a nem kódoló részek. A két szakaszt elválasztó határok az RNS-összeillesztésben játszanak szerepet.
A kutatók a jellemzők jelentőségét nagyszabású összehangolási elemzéssel is vizsgálták. Ennek során kanonikus biológiai fogalmakat vetettek össze az autoenkóder által azonosított mintázatokkal. A bemutatott példák között a fehérjéket kódoló DNS-szakaszok felismerése is szerepel.
A célzott irányítás még kezdeti szakaszban van
A Goodfire szerint a jellemzők feltérképezése később lehetővé teheti, hogy a kutatók célzottan befolyásolják az Evo 2 működését. A korai kísérletek már mutattak jeleket arra, hogy a módszerrel új fehérjeszerkezetek létrehozása is irányítható lehet, de a vállalat hangsúlyozza, hogy a munka még kezdeti szakaszban tart.
Az Evo 2 irányítása összetettebb a nyelvi modellekénél. Egy nyelvi modell kívánt viselkedése utasításokkal, azaz promptokkal is befolyásolható, az Evo 2 azonban nukleotidokkal dolgozik. A kutatók szerint a belső jellemzőkön keresztüli vezérlés új lehetőségeket nyithat a DNS-szekvenciák kontrollált generálásában.
A Goodfire február 20-án tette közzé kutatását, amelynek DOI-azonosítója 10.5281/zenodo.14895891. A kutatási oldal 2026 márciusi frissítése szerint az Evo 2 időközben a Nature folyóiratban is megjelent, a Goodfire kezdeti értelmezhetőségi eredményeivel együtt.
Mit jelenthet ez a biológiai kutatásban?
A modell belső működésének értelmezése segíthet feltárni a benne rejtőző biológiai tudást, és olyan mintázatok azonosítását teheti lehetővé, amelyeket a kutatók közvetlenül a DNS-szekvenciákból nehezen olvasnának ki. A Goodfire célja, hogy a biológusok célzott kísérleteket végezhessenek nagyobb léptékben, kontrollált DNS-generálással.
A vállalat szerint az ilyen módszerek idővel a biológiai rendszerek jobb megértéséhez, új genomikai mérnöki eljárásokhoz, valamint jobb betegségleíró kezelések fejlesztéséhez is hozzájárulhatnak. A közlemény ugyanakkor további kutatást tart szükségesnek ahhoz, hogy az Evo 2 irányításának teljes lehetőségei feltárhatók legyenek.
Goodfire Research: Interpreting Evo 2: Arc Institute's Next-Generation Genomic Foundation Model - Goodfire


