Az AI-ügynökök felgyorsíthatják a tudományos szoftverfejlesztést
Az AI-ügynökök gyorsíthatják a tudományos szoftverek fejlesztését, karbantartását és optimalizálását, derül ki az OpenAI nyolc projektet vizsgáló terepjelentéséből. A kutatók szerepe közben egyre inkább a célok meghatározására, az eredmények ellenőrzésére és a szoftverek hosszú távú gondozására helyeződik át.
- Az OpenAI nyolc, AI-ügynökökkel támogatott tudományos projektet vizsgált.
- Öt projektben csak Codexet, háromban Codexet és Claude Code-ot használtak.
- Az ügynökök gyorsították a fejlesztést, karbantartást és optimalizálást.
- A tudományos helyesség ellenőrzése továbbra is emberi feladat.
- A különálló újraírásokhoz egyértelmű felelős és karbantartási terv szükséges.
Nyolc tudományos projekt tapasztalatai
Az OpenAI 2026. július 28-án közzétett beszámolója nyolc, AI-ügynökökkel támogatott tudományos számítástechnikai projekt tapasztalatait gyűjti össze. A projektek többsége élettudományi területen készült, öt esetben kizárólag a Codexet használták, három projektben pedig a Codex és a Claude Code kombinációját.
A vizsgált munkák között rutinszerű karbantartás, célzott optimalizálás, nagy léptékű programnyelvi migráció és GPU-alapú újratervezés is szerepelt. A résztvevők szerint az ügynökök jelentősen felgyorsították a szoftverfejlesztést és -karbantartást. Egyes kis csapatok így olyan feladatokat is el tudtak vállalni, amelyek korábban jóval több időt vagy speciális mérnöki támogatást igényeltek volna.
Az OpenAI szerint a tudományos szoftverek fejlesztését régóta nehezíti, hogy sok eszköz egy kutatási tanulmányhoz mellékelt kódból nőtt ki. Ezeket gyakran kis akadémiai csapatok készítették, korlátozott mérnöki tapasztalattal és kevés idővel a csomagolásra, tesztelésre, optimalizálásra vagy hosszú távú támogatásra. Az eredmény gyakran lassú, sérülékeny munkafolyamat, amely folyamatos karbantartást igényel.
A gyors kódolás után az ellenőrzés válik szűk keresztmetszetté
A jelentés egyik visszatérő megállapítása, hogy az AI-ügynökök csökkentik a fejlesztési munka és a mérnöki szaktudás korlátozó szerepét. A fő nehézséget egyre inkább az jelenti, hogy az ember megbízhatóan ellenőrizze az ügynökök által készített eredményeket.
Az ügynökök jól teljesítettek a pontosan körülhatárolt kéréseknél, de nem tudták megbízhatóan megítélni, hogy a megoldás tudományosan helyes-e, vagy megfelel-e az elvárásoknak. A beszámoló szerint előfordult, hogy akkor is magabiztosan nyilatkoztak a munkájukról, amikor abban egyértelmű hibák maradtak.
A legerősebb ellenőrzési módszerek külső referenciára vagy mérhető elfogadási feltételre támaszkodtak. Ilyen lehetett a pontos kimeneti egyezés, egy meglévő eszközzel elért paritás, a megfelelő statisztikai viselkedés vagy szimulált adatokkal előre meghatározott válaszok használata.
A projektek jellemzően több szakaszban, visszajelzésekre építve haladtak. A csapatok a nagy célokat kisebb módosításokra bontották, majd köztes mérésekkel és tesztrendszerekkel értékelték, illetve finomították az ügynökök munkáját. A kezdeti megvalósítás gyakran gyorsan elkészült, a szélső esetek és a finom numerikus eltérések kezelése azonban több időt vett igénybe. A teljes megoldás utolsó szakasza sokszor a munka legnehezebb része volt.
A hosszú távú felelősség továbbra is emberi feladat
Az AI-ügynökök használata nem oldja meg automatikusan a kutatási szoftverek karbantartási problémáját. Az OpenAI által idézett korábbi vizsgálatok szerint a publikált kutatási kódok és omikai eszközök gyakran nem telepíthetők megfelelően új számítási környezetben, vagy nem futnak a dokumentációban leírt módon. Ez jelentős konfigurációs és hibakeresési munkát ró a kutatókra.
A könnyebb megvalósítás ugyanakkor új kockázatot is létrehozhat. Ha sok, egymáshoz hasonló újraírás készül, a felhasználók széttöredezhetnek, és megoszlik a szakértői figyelem, amely az egyes eszközök megbízhatóságának fenntartásához szükséges. Ezért a hosszú távú felelősség és a megfelelő hozzárendelés kulcsfontosságú.
A beszámoló példái között szerepel, hogy az MHCflurry és a cyvcf2 módosításai bekerültek az eredeti, upstream projektekbe. A rustar-aligner ezzel szemben új közösségi gondozás alá került, mert az eredeti projektet már nem tartották fenn. Az OpenAI szerint az érintett karbantartókkal való egyeztetést minél korábban el kell kezdeni. Ha különálló megvalósításra van szükség, annak egyértelmű felelőssel és hiteles karbantartási tervvel kell rendelkeznie.
A jelentés alapján a kutatók a jövőben kevesebb időt fordíthatnak a megvalósítás mechanikus részére, miközben nagyobb szerepet kap a célok kijelölése, a helyesség mérése és a tudományos minőség megítélése. Az ügynökök gyorsíthatják a tudományos szoftverek fejlesztési ciklusait, de tartós értékük attól függ, hogy az emberek mit építenek, hogyan ellenőrzik, és ki gondozza az elkészült eszközöket.
OpenAI: Scientific computing in the age of agentic AI


