A NVIDIA szerint egy nap alatt 93 százalék fölé javítható a Cosmos 3

A NVIDIA TAO agent skills segítségével a Cosmos 3 Nano videós kérdésválaszolási pontossága 54,41 százalékról 93,35 százalékra nőtt a vállalat kísérletében. A NVIDIA szerint a folyamat, amely adatjavítást, tanítást és hiperparaméter-keresést is automatizál, egyetlen nap alatt lefuttatható.
- A Cosmos 3 Nano zero-shot pontossága 54,41 százalék volt.
- A LoRA egyetlen automatizált futtatással 87,14 százalékra emelte az eredményt.
- A TAO AutoML 43 próbán keresztül 93,35 százalékos csúcspontosságot ért el.
- A NVIDIA szerint a LoRA hozzávetőleg hétszer kevesebb GPU-órát igényelt a teljes paraméteres finomhangolásnál.
- A TAO agent skills az adatjavítástól a tanításon át a hiperparaméter-keresésig automatizálja a munkafolyamatot.
A Cosmos 3 Nano közlekedési videókon tanult
A NVIDIA július 14-én bemutatott kísérlete a Cosmos 3 Nano utólagos tanítását vizsgálta a Toyota Woven Traffic Safety, vagyis WTS adathalmazán. A több mint 8000 tanítási és validációs mintát tartalmazó adatbázis négyválasztós videós kérdésválaszolási feladatra épül.
A modellnek összetett közlekedési jeleneteket kell értelmeznie, többek között útelrendezéseket, jelzőlámpákat, járműveket, gyalogosokat és az események kontextusát. Egy példa alapján a rendszernek azt kell meghatároznia, hogy az adott útszakasz egyenes út, kanyar, jelzőlámpa nélküli kereszteződés vagy jelzőlámpás kereszteződés.
A Cosmos 3 a NVIDIA leírása szerint kevert transzformátoros architektúrát használ, amely a szöveget, a képet, a videót, a környezeti hangot és a cselekvések követését közös világmodellben kapcsolja össze.
A LoRA egyetlen futtatással 87,14 százalékra emelte az eredményt
A kiinduló, úgynevezett zero-shot pontosság 54,41 százalék volt. A NVIDIA Low-Rank Adaptation, röviden LoRA alkalmazásával egyetlen automatizált futtatás után 87,14 százalékos exact-match pontosságot mért.
A LoRA során az alapmodell súlyai változatlanok maradnak, a tanításhoz pedig kis méretű, tanulható mátrixokat illesztenek be. A vállalat szerint a Cosmos 3 Nano esetében ez a megközelítés hozzávetőleg hétszer kevesebb GPU-órát igényelt, mint a teljes paraméterkészlet finomhangolása.
A teljes paraméteres felügyelt finomhangolás akkor lehet indokolt, ha nagy a különbség az alapmodell és a célterület között, vagy a feladat szerkezeti változtatásokat igényel. A NVIDIA szerint ugyanakkor ez jelentős számítási kapacitást kérhet, és az általános tudás visszaesésével is járhat.
A TAO agent skills automatizálja a fejlesztési folyamatot
A NVIDIA TAO agent skills olyan, kódoló ügynökök által használható képességeket biztosít, amelyek a látásalapú modellek utólagos tanításának lépéseit kezelik. A munkafolyamat része az adatok javítása, az alapértékelés, a tanítási konténer futtatása és a hiperparaméterek keresése.
A TAO AutoML több keresési stratégiát alkalmazott 43 próbán keresztül. A kísérlet során a csúcspontosság 93,35 százalékra emelkedett, ami 38,94 százalékpontos javulás a kiinduló eredményhez képest.
A megoldás kétféleképpen használható. A teljesen nyílt Cosmos 3 utólagos tanítási keretrendszer közvetlen hozzáférést ad a tanítási receptekhez, az adatformátumokhoz és a konfigurációkhoz. A TAO agent skills erre a képességre épít, és a kódoló ügynök segítségével állítja össze és hajtja végre a szükséges lépéseket.
A módszer a Reasoner toronyra összpontosít
A Cosmos 3 architektúrája Reasoner és Generator toronyra válik szét. A Reasoner a többmodalitású megértésért és a logikai következtetésért felel, a Generator pedig videó- és akciógenerálást végez. A TAO agent skills a NVIDIA szerint automatikusan kezeli a súlyok szétválasztását, így az utólagos tanítás a célfeladathoz szükséges Reasoner súlyokra összpontosul.
A vállalat szerint ugyanez a munkafolyamat más vizuális következtetési feladatokra is alkalmazható, például raktárfelügyeletre, önvezető járművek érzékelésére és robotikai munkacellákra. A telepítéshez a Cosmos 3 Reasoner NIM egyesített ellenőrzőpontot szolgál ki, amely az alapmodell súlyait és a LoRA-adaptert egyesíti.
NVIDIA Developer: Post-Train NVIDIA Cosmos 3 in One Day Using Agent Skills


