Az Evo 2 belső biológiai tudását tárta fel a Goodfire

A Goodfire Research olyan biológiai mintázatokat azonosított az Arc Institute Evo 2 genomikai alapmodelljében, mint a kódoló DNS-szakaszok, az exon-intron határok és a fehérjék másodlagos szerkezete. A kutatók szerint az eredmények a DNS-szekvenciák célzott generálásának irányába mutatnak, de a módszer még korai szakaszban jár.
- A Goodfire az Arc Institute Evo 2 modelljének belső biológiai jellemzőit vizsgálta.
- Az Evo 2 7B és 40B paraméteres változatban, legfeljebb 1 millió bázispáros szekvenciákon dolgozik.
- A kutatók exon-intron határokhoz, kódoló szekvenciákhoz és fehérjeszerkezetekhez kapcsolódó mintázatokat találtak.
- A modell jellemzőinek irányított használata új fehérjeszerkezetek tervezését segítheti.
- A DNS-generálás vezérlésére irányuló munka még korai szakaszban van.
A genomot elemző modell belső működését vizsgálták
A Goodfire és az Arc Institute együttműködésében az Evo 2 működésének értelmezésére alkalmaztak mesterségesintelligencia-értelmezési módszereket. A cél olyan, jelentéssel bíró számítási egységek azonosítása volt, amelyek megmutatják, hogyan dolgozza fel a modell a biológiai információt.
Az Evo 2 az Arc Institute következő generációs biológiai alapmodellje. A forrás szerint 7B és 40B paraméteres változatban készült, és legfeljebb 1 millió bázispár hosszúságú szekvenciákat képes nukleotidszintű felbontásban feldolgozni. A modellt az élővilág minden főbb tartományából származó adatokon tanították, így különböző biológiai összetettségű feladatoknál használható előrejelzésre és generálásra.
Exon-intron határokat és fehérjeszerkezeteket is felismert
A Goodfire a modell 26. rétegén BatchTopK ritka autoenkódereket, vagyis sparse autoencodereket, röviden SAE-ket tanított. Ezek segítségével olyan jellemzőket kerestek, amelyek a modell belső működésének értelmezhető mintázataihoz kapcsolódnak.
A kutatók több biológiailag releváns jellemzőt azonosítottak. Ezek között szerepelnek az exonok és intronok határai, amelyek a gének fehérjekódoló és nem kódoló részei közötti átmeneteket jelölik, valamint a fehérjék másodlagos szerkezetei. A Goodfire emellett azt írta, hogy az Evo 2 megtanulta felismerni a kódoló szekvenciákat, vagyis a fehérjék felépítéséhez szükséges utasításokat tartalmazó DNS-részeket.
Az eredményeket a kutatók egy nagyszabású összehangolási elemzéssel is vizsgálták, amelyben ismert biológiai fogalmakat vetettek össze az SAE-k által azonosított jellemzőkkel. A vizsgálathoz eukarióta és prokarióta adatok egyenlő arányú keverékét használták, minőségi referencia-genomokra támaszkodva.
A DNS irányított generálása még további kutatást igényel
A Goodfire szerint a biológiai alapmodellek értelmezése különösen nehéz feladat. Ezek a rendszerek DNS-szekvenciákat dolgoznak fel, amelyek közvetlenül az emberi szakértők számára is nehezen olvashatók. Az Evo 2 emellett több információs szinten működik, a nyers DNS-től az általa kódolt fehérjéken át az összetett RNS-szerkezetekig.
A kutatók korai jeleket láttak arra, hogy az Evo 2 jellemzőinek irányításával új fehérjeszerkezetek tervezhetők. A módszer összetettebbnek bizonyult, mint egy nyelvi modell vezérlése, ezért a teljes lehetőségek kiaknázásához további kutatásra van szükség.
A Goodfire szerint az ilyen vezérlés azért lehet fontos, mert egy kizárólag nukleotidokkal dolgozó modell hagyományos szöveges utasításokkal nem irányítható. Az értelmezhető jellemzők használata új lehetőséget teremthet a célzott DNS-szekvencia-generálásra, biológiai kísérletek nagyobb léptékű támogatására és a genomszerkesztési módszerek fejlesztésére. A kutatásról szóló anyagot a Goodfire 2025. február 20-án tette közzé, a lap szerint pedig 2026 márciusában az Evo 2 a Nature folyóiratban is megjelent, a kezdeti értelmezési eredményekkel együtt.
Goodfire Research: Interpreting Evo 2: Arc Institute's Next-Generation Genomic Foundation Model - Goodfire


