Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Megjelent a PyTorch 2.14, új GPU-háttérrel és hibátűrő képességekkel

2026. szeptember 2.Forrás: PyTorch

Megjelent a PyTorch 2.14, amely új GPU-s matematikai hátteret, átdolgozott NCCL-kommunikációs megoldást és fejlettebb hibátűrést hoz. A kiadás az Apple Silicon, az AMD ROCm és az Intel XPU támogatását is bővíti.

A lényeg röviden
  • Megjelent a PyTorch 2.14, 2 995 commitból és 487 közreműködő munkájából.
  • Az NVGEMM CuTeDSL-alapú CUTLASS kerneleket hoz az Inductorba.
  • Előzetes változatban érkezik az újraírt NCCL-háttér hibátűréssel és RMA-ablakokkal.
  • Az Apple Silicon natív lineáris algebrai műveleteket és új Metal kerneleket kapott.
  • Bővült a ROCm, az Intel XPU és az NVIDIA Rubin architektúra támogatása.

Új GPU-háttér és elosztott képzés

A PyTorch 2026. szeptember 2-án közzétett 2.14-es kiadása több ponton a teljesítményre és a nagy léptékű modellképzés megbízhatóságára összpontosít. Az NVGEMM a CuTeDSL által generált CUTLASS kerneleket viszi be az Inductorba. A háttér támogatja többek között a végműveletek összevonását, a skálázott és NVFP4 GEMM műveleteket, valamint a csoportos redukciós végműveleteket. Az automatikus hangolás az NVGEMM, a Triton és az ATen megoldásait együtt kezeli.

A projekt egy újraírt NCCL-háttér előzetesét is bemutatta. A torchcommsból átemelt megoldás a teljes kollektív kommunikációs szerződést valósítja meg, nem blokkoló kommunikátorokat, hibátűrést és egyoldalú RMA-ablakokat kínál, és a meglévő NCCL c10d-háttér közvetlen helyettesítőjeként készült.

A hibátűrés a c10d első osztályú fogalmává válik. A folyamatcsoportok helyben újrakonfigurálhatók, a Flight Recorder pedig már nem kizárólag NCCL-háttérrel működik. A PyTorch szerint ezek a képességek lehetővé teszik, hogy a több gépen futó képzési feladatok csomóponti hiba után a teljes újraindítás helyett helyreálljanak.

Fejlesztések Apple gépeken és a fordítóban

Az Apple Silicon platform natív lineáris algebrai műveleteket kapott, köztük Jacobi-kernelen alapuló szingulárisérték-felbontást, sajátérték-felbontást, QR-felbontást és Cholesky-felbontást. A projekt folytatta az MPSGraphról kézzel írt Metal kernelekre történő átállást is. Több művelet, például az indexeléshez, konvolúcióhoz és redukcióhoz kapcsolódó eljárások, már ezen az útvonalon fut.

A kiadásban a MPS memóriakezelése és másolási útvonalai is változtak. A nagy foglalások csoportosítása korlátozza a lefoglalt memória növekedését, a placement heapek pedig a töredezettség csökkentését szolgálják. Az egyelemű, autoregresszív dekódolásnál az F.linear korábban lassabb útvonalra került bizonyos alakzatok esetében. A javítás és az új GEMV kernelek ezt a helyzetet kezeli.

A torch.switch többirányú elágazással általánosítja a torch.cond működését, a torch.while_loop pedig már CUDA-grafikonban is rögzíthető. A @dynamic_spec dekorátor deklaratív módon írja le, mely tenzordimenziók változhatnak futásidőben. Ez a specifikáció közösen használható a torch.compile, a torch.export és a make_fx munkafolyamataiban.

Szélesebb hardvertámogatás és a kiadás mérete

A PyTorch 2.14 ROCm 7.14-es csomagjai a TheRock pip SDK-ból készülnek. Az Intel XPU natív gráfrögzítést kapott, az Inductor pedig már a Rubin architektúrát, az sm_107 célplatformot is kezeli. Kísérleti, külön engedélyezhető támogatás érkezett a komplex értékű tenzorokhoz is. A rendszer a támogatott komplex műveleteket valós és képzetes számításokra bontja, így a fordító hátterei több komplex számítási feladatot optimalizálhatnak.

Az Inductorban alapértelmezetté vált a kommunikáció és a számítás átfedése, ami a projekt szerint jobb GPU-kihasználtságot adhat az elosztott képzési feladatoknál konfigurációs módosítás nélkül. A kiadás 2 995 commitból áll, amelyeken 487 közreműködő dolgozott a PyTorch 2.13 óta.

A felhasználók a kiadásról szóló kérdéseiket a 2026. szeptember 17-i Q&A webináron tehetik fel. A PyTorch 2.14 újdonságait Andrey Talman, Natalia Gimelshein és Joe Spisak ismerteti, a beszélgetést Chris Gottbrath moderálja. A projekt a PyTorch Conference North America rendezvényt is meghirdette 2026. október 20-ra és 21-re, San Joséban.

Kapcsolódó hírek

Kutatás
Kutatás2026. október 1.

A PyTorch szerint a TLX gyorsabb lett a Blackwell Jagged Flash Attentionjénél

A PyTorch csapata olyan Jagged Flash Attention kernelt mutatott be NVIDIA Blackwell B200 GPU-kra, amely a vállalat mérései szerint a GEM munkaterhelésén gyorsabb volt a…

Kutatás
Kutatás2026. október 1.

A PyTorch TLX-kernellel gyorsította a Meta hirdetési modelljének figyelmét

A PyTorch olyan Jagged Flash Attention-kernelt mutatott be, amely az NVIDIA Blackwell B200 gyorsítón a Meta Generative Ads Model modelljéhez fontos alakzatokon…

A Modal mindenki számára elérhetővé tette a többgépes GPU-klasztereket
Chipek és infrastruktúra2026. október 1.

A Modal mindenki számára elérhetővé tette a többgépes GPU-klasztereket

A Modal általánosan elérhetővé tette a Modal Clusters szolgáltatást, amely több számítási csomópontot kapcsol össze nagy léptékű modelltréninghez és következtetéshez. A…