Az NVIDIA 502 ezer egyedi pénzügyi hírcímet generált

Az NVIDIA 502 536 egyedi pénzügyi hírcímet állított elő szintetikusadat-generáló folyamatával. A NeMo Data Designer, a NeMo Curator és a Nemotron 3 Nano együtt olyan adathalmazt hozott létre, amely a ritkább pénzügyi események lefedését is javítja.
- Az NVIDIA 502 536 egyedi pénzügyi hírcímet generált.
- A folyamat 82 iterációban, 13 kategóriával működött.
- A globális szemantikus deduplikáció a kimenetek körülbelül 82 százalékát kiszűrte.
- A FinHeadlineMix nyílt forrású adathalmazként érhető el.
- A példa szerint egy 3B tanulómodell a tanármodell F1-értékének 95 százalékát érte el.
Iteratív generálással készült az adathalmaz
Az NVIDIA Developer július 9-én bemutatott módszere a pénzügyi hírekben tapasztalható egyensúlytalanságra ad választ. A valós hírfolyamokban gyakoriak a gyorsjelentések és a részvényárfolyamok mozgásai, miközben a hitelminősítések változásai, a termékengedélyezések és a munkaügyi események jóval ritkábbak.
A vállalat által ismertetett folyamat 12 témakört és egy „Other” kategóriát használt. A rendszer minden körben címsorokat generált, kiszűrte a hibás kimeneteket, majd a teljes addig felhalmozott korpuszhoz hasonlította az új elemeket. Ezután új, változatos példákat választott a következő körhöz, és módosította a kategóriák súlyozását.
A teljes futtatás 82 iteráció után 502 536 egyedi címsort eredményezett. A munkát az NVIDIA szerint nagyjából hat nap alatt végezték el egyetlen, nyolc NVIDIA B200 GPU-t tartalmazó csomóponton.
A globális deduplikáció szűrte ki az ismétlődéseket
A módszer egyik kulcseleme az úgynevezett globális szemantikus deduplikáció volt. Az NVIDIA NeMo Curator nemcsak az egyes adagokon belüli, hanem a korábbi körökben megtartott összes címmel is összevetette az új kimeneteket. Így a különböző iterációkban megjelenő, jelentésükben hasonló címek is kiszűrhetők voltak.
Egy korai, 50 ezer címes alapfuttatásban a deduplikáció után 17 348 egyedi elem maradt. A vállalat összefoglalója szerint a teljes korpuszhoz viszonyított globális szűrés a generált címek körülbelül 82 százalékát eltávolította. A hozam később iterációnként 5000 és 6000 új címsor között stabilizálódott, miután az összegyűjtött korpusz meghaladta a 100 ezer elemet.
A változatosság növelésére a rendszer kategóriánként olyan néhány példát választott, amelyek a klaszterek középpontjától a legtávolabb estek. A három kiválasztott példát a következő generálási körben használta fel, miközben a korábbi példákhoz való hasonlóságot is szűrte.
Kompakt modellek tanítását is támogatja az adathalmaz
A generáláshoz az NVIDIA Nemotron 3 Nano modellt használta, amely 30 milliárd paraméteres, Mixture-of-Experts felépítésű modell, egy előretekintésben 3 milliárd aktív paraméterrel. A vLLM-en keresztül futtatott rendszer négyutas tenzoros párhuzamosítást és 448 párhuzamos kérést alkalmazott. A kategóriaeloszlást minden iteráció után korrigálták, hogy a ritkább osztályok közelebb kerüljenek az egyenkénti 1 százalékos célértékhez.
Az NVIDIA nyílt forrásúvá tette a FinHeadlineMix adathalmazt. Ez a pénzügyi hírcímek osztályozásához, finomhangoláshoz és tudásdesztillációhoz használható. A vállalat AI Model Distillation for Financial Data fejlesztői példája szerint egy 3 milliárd paraméteres tanulómodell 25 ezer címkézett példával a 49, illetve 70 milliárd paraméteres tanármodell F1-értékének 95 százalékát érte el.
A felhasználók letölthetik a FinHeadlineMixet, reprodukálhatják a generálási és deduplikációs folyamatot a NeMo eszközeivel, vagy kompakt modellek finomhangolására használhatják. A forrás szerint a megközelítés pénzügyi kutatási, kockázatmodellezési és megfigyelési munkafolyamatokhoz is illeszthető.
NVIDIA Developer: Synthetic Data Generation for Financial AI Research with NVIDIA NeMo


