Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA QAD-vel készítette el a Nemotron 3.5 Lightning NVFP4 modellt

2026. augusztus 17.Forrás: NVIDIA Developer
Az NVIDIA QAD-vel készítette el a Nemotron 3.5 Lightning NVFP4 modellt
Kép: NVIDIA Developer

Az NVIDIA Developer augusztus 17-én ismertette, hogyan készült a Nemotron 3.5 Lightning NVFP4 checkpoint az NVIDIA Model Optimizer és kvantálást figyelembe vevő desztilláció segítségével. A cég szerint a modell a 66 GB-os teljes pontosságú változatról 22 GB-ra csökkent, miközben akár 4-szer gyorsabb áteresztést kínál.

A lényeg röviden
  • A Nemotron 3.5 Lightning NVFP4 checkpoint 66 GB-ról 22 GB-ra csökkent az NVIDIA szerint.
  • A cég akár 4-szer gyorsabb áteresztést állít az NVFP4 változatnál.
  • A QAD a BF16 tanármodellt használja a kvantált tanulómodell javítására.
  • Köztes checkpointokon a QAD 96.33 százalékról 99.72 százalékra, illetve 95.84 százalékról 98.53 százalékra javította a medián visszanyerést.
  • A végső NVFP4 checkpointnál a QAD javította a Terminal-Bench v2.1 és a SWE-Bench Multilingual eredményeket.

A cél: kisebb memóriaigény, nagyobb áteresztés

Az NVIDIA bejegyzése szerint a Nemotron modellek nyílt családja lehetőséget ad a fejlesztőknek arra, hogy késleltetés, sebesség, memória és számítási igény alapján válasszanak modellt. A Nemotron 3.5 Lightning NVFP4 checkpoint ennek egyik példája: a vállalat állítása szerint sok súly 4 bites kvantálásával 66 GB-ról 22 GB-ra tömörítették a teljes pontosságú checkpointot, miközben akár 4-szer gyorsabb áteresztést értek el.

Az NVIDIA szerint az NVFP4-re tömörítéshez gyakran elegendő az utólagos kvantálás, vagyis a post-training quantization, röviden PTQ. A bejegyzés azonban azt írja, hogy szorosabb memóriahatárok és nagyobb áteresztés esetén agresszívebb kvantálásra van szükség. Erre használta a cég a quantization-aware distillation, röviden QAD módszert.

A QAD célja, hogy visszanyerje azt a pontosságot, amely az agresszív kvantálás során elveszhet. Az NVIDIA szerint a módszerrel készült NVFP4 checkpoint kevesebb memóriát használ, nagyobb áteresztést ad, és közben megőrzi a modell minőségét.

Így működik a QAD a Nemotron 3.5 Lightningnél

A bejegyzésben ismertetett eljárás két szakaszból áll. Először a teljes pontosságú modellből PTQ-val készül kvantált tanulómodell. A Nemotron 3.5 Lightning esetében a BF16 teljes pontosságú modell a tanár, a PTQ-val W4A16-NVFP4 formára kvantált változat pedig a tanuló.

A második szakaszban a befagyasztott BF16 tanármodellt desztillálják a kvantált tanulóba. Az NVIDIA leírása szerint ehhez KL-divergencia veszteséget használnak, amely a tanár és a tanuló logitjait hasonlítja össze. A tanuló minden előrehaladási lépése szimulált kvantáláson megy át, így a modell a tanítás során találkozik azzal a kvantálási zajjal, amelyet következtetéskor is kezelnie kell.

A cég szerint ez azért fontos, mert a tanuló nem csak a következő token előrejelzését tanulja, hanem a tanármodell viselkedéséhez igazodik. A folyamat célja, hogy agresszív kvantálás mellett is magas minőséget tartson meg.

A PTQ-receptek és a skálázási stratégia szerepe

Az NVIDIA több PTQ-receptet próbált ki a tanulómodell előállításához. Ezek abban különböztek, hogyan kalibrálják a súlyokat, és milyen agresszíven kvantálják a Mamba-projekciókat, valamint a KV cache-t. A választás a későbbi tanításra is hatott: a maximum alapján kalibrált receptek dinamikus skálás QAD-hez, az MSE-alapú receptek befagyasztott skálás QAD-hez vezettek.

Néhány beállítás minden receptben közös volt. A bejegyzés szerint mindegyik W4A16 formára kvantálta az lm_head réteget, amit az NVIDIA faithful lm_head néven említ, miközben az attention projection rétegek BF16 formátumban maradtak. A kalibráció 1,000 mintát használt, és egyetlen NVIDIA DGX B300 rendszeren futott.

Az NVIDIA öt PTQ-receptre koncentrált, és mindegyiknél 8k és 128k közötti szekvenciahosszal végzett kalibrációt. A cég szerint korábbi kísérletek alapján a hosszabb szekvenciahossz jobb PTQ-eredményt adhat. A bejegyzésben azt írják, hogy a four_over_six recepten a 32K szekvenciahossz adta a legjobb PTQ-eredményt, ezért minden QAD-kísérletet a 32K kalibrációjú four_over_six checkpointon végeztek.

A vállalat szerint a four_over_six W4A16 Mamba linears beállítással adta a legjobb kompromisszumot a pontosságromlás és a következtetési teljesítmény növekedése között. A legagresszívebb változat a K és V elemeket NVFP4, vagyis W4A4 formára vitte, miközben a QK és az attn dot V batched matrix multiplication műveletek BF16-ban maradtak, a Q pedig kvantálatlan volt.

Mit mutattak a mérések

Az NVIDIA azt írja, hogy csak PTQ használatakor jellemzően 99 százalék feletti medián pontosság-visszanyerést céloznak. QAD mellett viszont 95 és 99 százalék közötti medián pontosság-visszanyerés is cél lehet a PTQ-szakasz után, mert a QAD a következő lépésben javítja az eredményt. A cég szerint ez teret ad agresszívebb beállításoknak, például annak, hogy a Mamba linear rétegek W4A16 formát kapjanak a biztonságosabb FP8 helyett.

A köztes checkpointokon a QAD az NVIDIA összefoglalója szerint azonos, 21.19 GB-os memóriaigény mellett 96.33 százalékról 99.72 százalékra, illetve 95.84 százalékról 98.53 százalékra emelte a medián pontosság-visszanyerést. A végső NVFP4 checkpoint konzervatívabb kvantálási receptet használ, amelynél a PTQ önmagában 99.24 százalékos medián visszanyerést ér el.

A bejegyzés szerint a QAD még ebben a konzervatívabb végső beállításban is javította a fontos agentic benchmarkokat, köztük a Terminal-Bench v2.1 és a SWE-Bench Multilingual eredményeit.

Mit jelent ez a fejlesztőknek

A hír fő üzenete a fejlesztők számára az, hogy az NVIDIA szerint az agresszívebb kvantálás nem feltétlenül jár együtt tartós minőségvesztéssel, ha a PTQ után QAD-t is alkalmaznak. A módszer lehetővé teszi kisebb checkpointok és nagyobb áteresztés célzását úgy, hogy a pontosság egy részét a desztilláció visszahozza.

Az NVIDIA a következő lépések között a megatron_lm_qad.yaml launcher kipróbálását javasolja a teljes QAD-folyamat futtatásához, valamint a Model Optimizer QAD-dokumentáció áttekintését. A vállalat azt is írja, hogy a végső NVFP4 checkpoint letölthető a Hugging Face-ről telepítéshez és kiértékeléshez.

Kapcsolódó hírek

Az NVIDIA szerint így érdemes mérni az AI-ügynökök valódi teljesítményét
Fejlesztőknek2026. szeptember 21.

Az NVIDIA szerint így érdemes mérni az AI-ügynökök valódi teljesítményét

Az AI-ügynökök értékelésénél az NVIDIA Developer szerint már nem elég azt nézni, hogy egy modell helyesen hív-e meg egy eszközt. A lényeg az, hogy a több lépésből álló…

NVIDIA: öt irányelv gyorsíthatja az LLM-ek spekulatív dekódolását
Fejlesztőknek2026. szeptember 2.

NVIDIA: öt irányelv gyorsíthatja az LLM-ek spekulatív dekódolását

Az NVIDIA Developer 2026. szeptember 2-án közölt technikai útmutatót arról, hogyan gyorsítható az LLM-inferencia spekulatív dekódolással. A bejegyzés öt irányelvet ad a…

NVIDIA NeMo Switchyard: modellválasztó réteg AI-ügynökökhöz
Fejlesztőknek2026. augusztus 11.

NVIDIA NeMo Switchyard: modellválasztó réteg AI-ügynökökhöz

Az NVIDIA Developer 2026. augusztus 11-én ismertette a NeMo Switchyard működését, amely AI-ügynökök feladatait irányítja különböző specializált és frontier modellek…