Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA 502 ezer egyedi pénzügyi hírcímet generált

2026. július 9. 21:40Forrás: NVIDIA Developer
Az NVIDIA 502 ezer egyedi pénzügyi hírcímet generált
Kép: NVIDIA Developer

Az NVIDIA 502 536 egyedi pénzügyi hírcímet állított elő szintetikusadat-generáló folyamatával. A NeMo Data Designer, a NeMo Curator és a Nemotron 3 Nano együtt olyan adathalmazt hozott létre, amely a ritkább pénzügyi események lefedését is javítja.

A lényeg röviden
  • Az NVIDIA 502 536 egyedi pénzügyi hírcímet generált.
  • A folyamat 82 iterációban, 13 kategóriával működött.
  • A globális szemantikus deduplikáció a kimenetek körülbelül 82 százalékát kiszűrte.
  • A FinHeadlineMix nyílt forrású adathalmazként érhető el.
  • A példa szerint egy 3B tanulómodell a tanármodell F1-értékének 95 százalékát érte el.

Iteratív generálással készült az adathalmaz

Az NVIDIA Developer július 9-én bemutatott módszere a pénzügyi hírekben tapasztalható egyensúlytalanságra ad választ. A valós hírfolyamokban gyakoriak a gyorsjelentések és a részvényárfolyamok mozgásai, miközben a hitelminősítések változásai, a termékengedélyezések és a munkaügyi események jóval ritkábbak.

A vállalat által ismertetett folyamat 12 témakört és egy „Other” kategóriát használt. A rendszer minden körben címsorokat generált, kiszűrte a hibás kimeneteket, majd a teljes addig felhalmozott korpuszhoz hasonlította az új elemeket. Ezután új, változatos példákat választott a következő körhöz, és módosította a kategóriák súlyozását.

A teljes futtatás 82 iteráció után 502 536 egyedi címsort eredményezett. A munkát az NVIDIA szerint nagyjából hat nap alatt végezték el egyetlen, nyolc NVIDIA B200 GPU-t tartalmazó csomóponton.

A globális deduplikáció szűrte ki az ismétlődéseket

A módszer egyik kulcseleme az úgynevezett globális szemantikus deduplikáció volt. Az NVIDIA NeMo Curator nemcsak az egyes adagokon belüli, hanem a korábbi körökben megtartott összes címmel is összevetette az új kimeneteket. Így a különböző iterációkban megjelenő, jelentésükben hasonló címek is kiszűrhetők voltak.

Egy korai, 50 ezer címes alapfuttatásban a deduplikáció után 17 348 egyedi elem maradt. A vállalat összefoglalója szerint a teljes korpuszhoz viszonyított globális szűrés a generált címek körülbelül 82 százalékát eltávolította. A hozam később iterációnként 5000 és 6000 új címsor között stabilizálódott, miután az összegyűjtött korpusz meghaladta a 100 ezer elemet.

A változatosság növelésére a rendszer kategóriánként olyan néhány példát választott, amelyek a klaszterek középpontjától a legtávolabb estek. A három kiválasztott példát a következő generálási körben használta fel, miközben a korábbi példákhoz való hasonlóságot is szűrte.

Kompakt modellek tanítását is támogatja az adathalmaz

A generáláshoz az NVIDIA Nemotron 3 Nano modellt használta, amely 30 milliárd paraméteres, Mixture-of-Experts felépítésű modell, egy előretekintésben 3 milliárd aktív paraméterrel. A vLLM-en keresztül futtatott rendszer négyutas tenzoros párhuzamosítást és 448 párhuzamos kérést alkalmazott. A kategóriaeloszlást minden iteráció után korrigálták, hogy a ritkább osztályok közelebb kerüljenek az egyenkénti 1 százalékos célértékhez.

Az NVIDIA nyílt forrásúvá tette a FinHeadlineMix adathalmazt. Ez a pénzügyi hírcímek osztályozásához, finomhangoláshoz és tudásdesztillációhoz használható. A vállalat AI Model Distillation for Financial Data fejlesztői példája szerint egy 3 milliárd paraméteres tanulómodell 25 ezer címkézett példával a 49, illetve 70 milliárd paraméteres tanármodell F1-értékének 95 százalékát érte el.

A felhasználók letölthetik a FinHeadlineMixet, reprodukálhatják a generálási és deduplikációs folyamatot a NeMo eszközeivel, vagy kompakt modellek finomhangolására használhatják. A forrás szerint a megközelítés pénzügyi kutatási, kockázatmodellezési és megfigyelési munkafolyamatokhoz is illeszthető.

NVIDIANVIDIA NeMoNeMo Data DesignerNeMo CuratorNemotron 3 NanoFinHeadlineMixpénzügynyelvi modellekkutatási eredmény
Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

64 GB memóriával jön az NVIDIA DGX Spark új változata
Chipek és infrastruktúra2026. október 2. 15:00

64 GB memóriával jön az NVIDIA DGX Spark új változata

Az NVIDIA 2026. október 2-án bejelentette a DGX Spark 64 GB-os, egyesített memóriával szerelt konfigurációját. A rendszer október 23-án érkezik az Acer, ASUS, Dell…

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható
Kutatás2026. október 1. 07:00

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat…

Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható
Kutatás2026. október 1. 07:00

Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi arab Najdi és Hijazi nyelvjárásokhoz igazítható. A vállalat szerint a…