TensorRT LLM

NVIDIA: alig lassult a titkosított DeepSeek-R1 futtatás B200 GPU-kon
A nagy nyelvi modellek érzékeny adatokon végzett inferenciájához az NVIDIA szerint úgy adható hardveres védelem, hogy közben a teljesítményveszteség mérsékelt marad. A…

NVIDIA: öt irányelv gyorsíthatja az LLM-ek spekulatív dekódolását
Az NVIDIA Developer 2026. szeptember 2-án közölt technikai útmutatót arról, hogyan gyorsítható az LLM-inferencia spekulatív dekódolással. A bejegyzés öt irányelvet ad a…