Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az MLCommons az AIRIS projektben méri majd az orvosi AI megbízhatóságát

2026. szeptember 23.Forrás: MLCommons
Az MLCommons az AIRIS projektben méri majd az orvosi AI megbízhatóságát
Kép: MLCommons

Az MLCommons csatlakozott az uniós finanszírozású AIRIS kutatási projekthez, amely biológiai ismereteket és klinikai adatokat integráló generatív AI-modelleket fejleszt. A szervezet független értékelési rendszert és benchmarkokat készít a platform pontosságának, robusztusságának, méltányosságának, értelmezhetőségének és használhatóságának mérésére.

A lényeg röviden
  • Az AIRIS 21 európai, kanadai és amerikai partner közös projektje.
  • A Horizon Europe program négy évre 16,9 millió eurót biztosít.
  • Az MLCommons független értékelési keretrendszert és benchmarkokat fejleszt.
  • A tesztek a pontosságot, robusztusságot, méltányosságot, értelmezhetőséget és használhatóságot mérik.
  • A benchmarkokat külső kutatók saját adatokkal is használhatják.

21 partner dolgozik a biomedicinai AI-rendszeren

Az AIRIS, vagyis a Mechanism-Informed Multimodal Generative AI for Causal and Dynamical Modeling in Biomedical Research projekt az Európai Unió Horizon Europe programjának támogatásával valósul meg. A kezdeményezésben 21 európai, kanadai és amerikai partner vesz részt.

A konzorcium a következő négy évben 16,9 millió eurós finanszírozásból fejleszt generatív AI-platformot. A cél egy olyan AI-alapú kutatási munkatárs létrehozása, amely segít jobban megérteni a betegségek előrehaladását, és támogatja a személyre szabott orvoslás fejlődését.

Az AIRIS olyan modelleket kíván építeni, amelyek a biológiai tudást és a klinikai adatokat együtt kezelik. A platform a betegségek mechanisztikus modelljeit építi fel és ezekkel következtet, így a projekt célja szerint nem kizárólag statisztikai mintázatokra támaszkodik. A kutatók ettől korábban ismeretlen betegségi útvonalak azonosítását és új tudományos hipotézisek kidolgozását várják.

Öt betegségterületre készülnek benchmarkok

Az MLCommons a mesterségesintelligencia-rendszerek teljesítményének összehasonlítására szolgáló benchmarkok fejlesztésében szerzett tapasztalatára építve kap központi szerepet az AIRIS értékelésében. A szervezet egy átfogó értékelési keretrendszert és integrált benchmarkcsomagot vezet fejlesztésre.

A mérési rendszer öt szempontot vizsgál: a pontosságot, a robusztusságot, a méltányosságot, az értelmezhetőséget és a használhatóságot. Külön benchmark készül mind az öt betegségterülethez, valamint a betegek alcsoportjai közötti torzítások felismerésére. Az értékelés olyan szempontokat is figyelembe vesz, mint a nem, az etnikum és az életkor.

„A szigorú, független értékelés alakítja át az ígéretes AI-rendszert olyanná, amelyben a kutatók valóban megbízhatnak”, mondta Alexandros Karargyris, az MLCommons Medical munkacsoportjának vezetője. Hozzátette, hogy nyílt benchmarkokkal szeretnék vizsgálni a pontosság mellett a méltányosságot, a robusztusságot és az értelmezhetőséget is valós betegségi környezetekben.

Külső kutatók is tesztelhetik majd a rendszert

Az MLCommons az értékelési fordulókat is koordinálja. A szervezet a platform egymást követő verzióinak fejlődését követi, a benchmarkokat pedig megnyitja külső kutatók előtt. Így a tudományos közösség saját adatokon is tesztelheti az AIRIS-t.

A projekt célja, hogy a platform a multimodális, mechanisztikus modellekre épülő biomedicinai generatív AI egyik referenciaértékelésévé váljon. A forrás szerint ez átlátható mércét adhat a kutatóknak, miközben az AIRIS megbízhatóbbá teheti a komplex betegségek vizsgálatát.

Az MLCommons hosszabb távon olyan AI-kutatási együttműködést szeretne támogatni, amely a kutatási folyamat minden szakaszában segíti a tudósokat. A projekt az úgynevezett feketedobozos előrejelzéseken túl a biológiai tudásra alapozná a következtetéseit. A nyílt benchmarkok és a több szempontú értékelés a felhasználók számára azt jelentheti, hogy az AIRIS teljesítménye nem egyetlen pontossági mutató alapján, hanem több, a klinikai kutatás szempontjából fontos tényező szerint is vizsgálható lesz.

Kapcsolódó hírek

A Microsoft Quine rendszere a biológiai kutatásokat gyorsítaná
Kutatás2026. szeptember 29.

A Microsoft Quine rendszere a biológiai kutatásokat gyorsítaná

A Microsoft Research bemutatta a Quine nevű kísérleti AI kutatási rendszert, amely a biológia több szintjéről és adatforrásából származó információkat kapcsolja össze. A…

A Microsoft Quine rendszere a biológiai kutatásokat gyorsítaná fel
Kutatás2026. szeptember 29.

A Microsoft Quine rendszere a biológiai kutatásokat gyorsítaná fel

A Microsoft Research bemutatta a Quine nevű kísérleti AI-kutatási rendszert, amely többféle biológiai adatot kapcsol össze tudományos eszközökkel, szakirodalommal és…

Az Iambic bemutatta az Enchant v3 gyógyszerkutató modellt
Modellek2026. szeptember 21.

Az Iambic bemutatta az Enchant v3 gyógyszerkutató modellt

Az Iambic bemutatta az Enchant v3 multimodális transzformermodelt, amelyet a gyógyszerkutatás és -fejlesztés teljes folyamatának támogatására terveztek. A modell 41…