Megjelent a PyTorch 2.14, új GPU-háttérrel és hibátűrő képességekkel
Megjelent a PyTorch 2.14, amely új GPU-s matematikai hátteret, átdolgozott NCCL-kommunikációs megoldást és fejlettebb hibátűrést hoz. A kiadás az Apple Silicon, az AMD ROCm és az Intel XPU támogatását is bővíti.
- Megjelent a PyTorch 2.14, 2 995 commitból és 487 közreműködő munkájából.
- Az NVGEMM CuTeDSL-alapú CUTLASS kerneleket hoz az Inductorba.
- Előzetes változatban érkezik az újraírt NCCL-háttér hibátűréssel és RMA-ablakokkal.
- Az Apple Silicon natív lineáris algebrai műveleteket és új Metal kerneleket kapott.
- Bővült a ROCm, az Intel XPU és az NVIDIA Rubin architektúra támogatása.
Új GPU-háttér és elosztott képzés
A PyTorch 2026. szeptember 2-án közzétett 2.14-es kiadása több ponton a teljesítményre és a nagy léptékű modellképzés megbízhatóságára összpontosít. Az NVGEMM a CuTeDSL által generált CUTLASS kerneleket viszi be az Inductorba. A háttér támogatja többek között a végműveletek összevonását, a skálázott és NVFP4 GEMM műveleteket, valamint a csoportos redukciós végműveleteket. Az automatikus hangolás az NVGEMM, a Triton és az ATen megoldásait együtt kezeli.
A projekt egy újraírt NCCL-háttér előzetesét is bemutatta. A torchcommsból átemelt megoldás a teljes kollektív kommunikációs szerződést valósítja meg, nem blokkoló kommunikátorokat, hibátűrést és egyoldalú RMA-ablakokat kínál, és a meglévő NCCL c10d-háttér közvetlen helyettesítőjeként készült.
A hibátűrés a c10d első osztályú fogalmává válik. A folyamatcsoportok helyben újrakonfigurálhatók, a Flight Recorder pedig már nem kizárólag NCCL-háttérrel működik. A PyTorch szerint ezek a képességek lehetővé teszik, hogy a több gépen futó képzési feladatok csomóponti hiba után a teljes újraindítás helyett helyreálljanak.
Fejlesztések Apple gépeken és a fordítóban
Az Apple Silicon platform natív lineáris algebrai műveleteket kapott, köztük Jacobi-kernelen alapuló szingulárisérték-felbontást, sajátérték-felbontást, QR-felbontást és Cholesky-felbontást. A projekt folytatta az MPSGraphról kézzel írt Metal kernelekre történő átállást is. Több művelet, például az indexeléshez, konvolúcióhoz és redukcióhoz kapcsolódó eljárások, már ezen az útvonalon fut.
A kiadásban a MPS memóriakezelése és másolási útvonalai is változtak. A nagy foglalások csoportosítása korlátozza a lefoglalt memória növekedését, a placement heapek pedig a töredezettség csökkentését szolgálják. Az egyelemű, autoregresszív dekódolásnál az F.linear korábban lassabb útvonalra került bizonyos alakzatok esetében. A javítás és az új GEMV kernelek ezt a helyzetet kezeli.
A torch.switch többirányú elágazással általánosítja a torch.cond működését, a torch.while_loop pedig már CUDA-grafikonban is rögzíthető. A @dynamic_spec dekorátor deklaratív módon írja le, mely tenzordimenziók változhatnak futásidőben. Ez a specifikáció közösen használható a torch.compile, a torch.export és a make_fx munkafolyamataiban.
Szélesebb hardvertámogatás és a kiadás mérete
A PyTorch 2.14 ROCm 7.14-es csomagjai a TheRock pip SDK-ból készülnek. Az Intel XPU natív gráfrögzítést kapott, az Inductor pedig már a Rubin architektúrát, az sm_107 célplatformot is kezeli. Kísérleti, külön engedélyezhető támogatás érkezett a komplex értékű tenzorokhoz is. A rendszer a támogatott komplex műveleteket valós és képzetes számításokra bontja, így a fordító hátterei több komplex számítási feladatot optimalizálhatnak.
Az Inductorban alapértelmezetté vált a kommunikáció és a számítás átfedése, ami a projekt szerint jobb GPU-kihasználtságot adhat az elosztott képzési feladatoknál konfigurációs módosítás nélkül. A kiadás 2 995 commitból áll, amelyeken 487 közreműködő dolgozott a PyTorch 2.13 óta.
A felhasználók a kiadásról szóló kérdéseiket a 2026. szeptember 17-i Q&A webináron tehetik fel. A PyTorch 2.14 újdonságait Andrey Talman, Natalia Gimelshein és Joe Spisak ismerteti, a beszélgetést Chris Gottbrath moderálja. A projekt a PyTorch Conference North America rendezvényt is meghirdette 2026. október 20-ra és 21-re, San Joséban.
PyTorch: PyTorch 2.14 Release Blog
