Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Új benchmark méri, valóban tanulnak-e az AI-rendszerek a tapasztalatból

2026. augusztus 21.Forrás: Snorkel AI
Új benchmark méri, valóban tanulnak-e az AI-rendszerek a tapasztalatból
Kép: Snorkel AI

A Continual Learning Bench azt méri, hogy az LLM-alapú rendszerek valóban javulnak-e a egymást követő feladatok során szerzett tapasztalatoktól. A Berkeley kutatója által bemutatott benchmark hat terület feladatait kapcsolja össze közös, menet közben felfedezhető struktúrákkal.

A lényeg röviden
  • A Continual Learning Bench az AI-rendszerek tapasztalatból történő javulását méri.
  • A benchmark hat területet fed le, köztük a szoftverfejlesztést és a kereslet-előrejelzést.
  • A feladatsorok közös, menet közben felfedezhető struktúrákra épülnek.
  • A gain a rendszer állapottal és állapot nélkül mért teljesítményének különbségét mutatja.
  • A teszt különválasztja az alapmodell erejét és a sorozat közbeni tanulást.

A jelenlegi tesztek többnyire minden feladatot külön kezelnek

A benchmarkot Parth Asawa, a Berkeley Egyetem Sky Computing Lab PhD-hallgatója mutatta be a Snorkel AI legutóbbi Reading Group eseményén. A Snorkel AI 2026. augusztus 21-én közzétett beszámolója szerint a Continual Learning Bench, röviden CL-Bench, az első szakértők által validált benchmark, amely azt vizsgálja, hogy az LLM-alapú rendszerek ténylegesen fejlődnek-e a sorozatos tapasztalatszerzés hatására.

Asawa szerint a modelleket ma jellemzően úgy értékelik, hogy egymástól függetlenül oldanak meg egyes feladatokat. A teljesítményt ezután egyetlen számmal, például a helyesen megoldott problémák arányával írják le. Ez a módszer abból indul ki, hogy az egyes példák egymástól függetlenek, ezért a modell minden új feladatot úgy kezel, mintha korábban nem találkozott volna hasonlóval.

A kutató szerint ez nem mutatja meg, hogy a teljesítmény miként változik a tapasztalattal. A tanulásnak inkább olyan görbeként kellene megjelennie, amelyen a rendszer idővel javul. A folyamatos tanulást sample-efficient, vagyis mintahatékony, hosszú időtávon stabil online tanulásként definiálja.

Hat területre épül a Continual Learning Bench

A CL-Bench hat területet fed le: szoftverfejlesztést, jelfeldolgozást, járványkitörések előrejelzését, adatbázis-lekérdezéseket, stratégiai játékokat és kereslet-előrejelzést. Minden feladatsorban van egy rejtett, közös struktúra, amelyet egy állapotot megőrző rendszer menet közben felismerhet és felhasználhat. Egy állapot nélküli rendszer erre nem képes.

A benchmark alapvető kérdése egyszerű: amikor a modell elér a tizedik problémához, segített-e neki az első kilenc megoldása? Asawa szerint meglévő benchmarkok puszta összefűzése erre nem adna megfelelő választ. Az olyan feladatok, mint az AIME 2025 problémái, önmagukban függetlenek, és nem tartalmaznak olyan közös struktúrát, amelytől a korábbi tapasztalat várhatóan javítaná a későbbi teljesítményt.

A folyamatos tanulási benchmarkhoz ezért három feltétel szükséges. Kell megfelelő fejlődési tartalék, hogy a teszt ne pusztán az alapmodell képességeit mérje. Szükség van közös, rejtett struktúrára, amelyet az optimális tanuló idővel felismerhet. Emellett visszajelzésnek is rendelkezésre kell állnia, például a helyes válasznak, fordítóprogramok hibaüzeneteinek vagy emberi értékelésnek.

A gain mutató különválasztja az alapmodellt és a tanulást

A feladatsorok értékeléséhez a teljes összjutalom önmagában nem elegendő. Ez ugyanis összekeverheti az alapmodell erejét a tanulási képességgel. Egy erősebb modell induláskor jobban teljesíthet, miközben egy gyengébb rendszer a sorozat során nagyobb javulást mutat.

A CL-Bench ezért a gain mutatót használja:

gain = állapottal mért jutalom, mínusz állapot nélküli jutalom

A méréshez ugyanazt a rendszert kétszer futtatják végig a feladatsoron. Az első alkalommal a rendszer megőrizheti a közös állapotot. Ez történhet a kontextusban, külső memóriában, például strukturált memória- vagy vektortárolóban, illetve a paraméterek frissítésével. A második futásnál minden példát követően törlik az állapotot, így a rendszer minden feladatot az alapállapotából kezd.

A gain@4 azt fejezi ki, hogy az első három feladat mennyivel javította a negyedik megoldását ahhoz képest, mintha a rendszer előzmények nélkül találkozott volna vele. A Snorkel AI beszámolója szerint ez a megközelítés képes elkülöníteni az egyes feladatok nehézségét, a kiinduló modellképességet és a felhalmozott tapasztalat hatását.

A módszer a fejlesztők értékelési szempontjait bővítheti

A folyamatos tanulás többféle módon valósulhat meg nyelvi modelleknél. Ide tartozik a kontextuson belüli alkalmazkodás, a külső memóriába írt információk használata és a paraméteres tanulás. A bemutató szerint ezekhez jelenleg nem tartozik egységes értékelési módszertan, ezért a különböző kutatások eredményei nehezen hasonlíthatók össze.

A CL-Bench célja, hogy az egyszeri feladatmegoldás mellett a teljesítmény időbeli javulását is mérhetővé tegye. A forrás szerint a megközelítés azt vizsgálja, hogy egy rendszer felhasználja-e a korábbi tapasztalatot, és ezáltal hatékonyabban oldja-e meg a későbbi, közös struktúrára épülő feladatokat.

Snorkel AIContinual Learning BenchUC Berkeley Sky Computing LabParth AsawaTerminal-Benchbenchmarkkutatási eredménynyelvi modellek

Kapcsolódó hírek

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI
Kutatás2026. október 2.

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI

A MedPAIR adatbázis azt méri, hogy az orvosok és a nagy nyelvi modellek ugyanazokat a mondatokat tartják-e fontosnak egy klinikai kérdés megválaszolásához. A kutatásban…

A Snorkel szerint az Opus 5.5 vezet a kódolási tesztben
Kutatás2026. szeptember 23.

A Snorkel szerint az Opus 5.5 vezet a kódolási tesztben

Az Opus 5.5 érte el a legmagasabb összesített sikerarányt a Snorkel AI szakértők által összeállított kódolási feladatsorán. A modell 68 százalékos eredményt ért el…

A Terminal-Bench 4.0 folyamatos ellenőrzéssel tartaná értékét
Kutatás2026. augusztus 29.

A Terminal-Bench 4.0 folyamatos ellenőrzéssel tartaná értékét

Megjelent a Terminal-Bench 4.0, amely a feladatok szigorúbb ellenőrzésére, a reprodukálhatóságra és a benchmark folyamatos karbantartására épít. A Snorkel AI szerint a…