Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A PyTorch egy helyre költözteti a média dekódolását és kódolását

2026. október 5. 22:45Forrás: PyTorch

A PyTorch a TorchCodecba vonta össze a képek, videók és hangok dekódolását és kódolását. A TorchVision és a TorchAudio ezután elsősorban a médiaadatok átalakítására szolgál.

A lényeg röviden
  • A TorchCodec kezeli a képek, videók és hangok dekódolását és kódolását.
  • A TorchVision és a TorchAudio fő feladata a médiaadatok átalakítása lett.
  • A PyTorch szerint a TorchCodec különösen CUDA-s videódekódolásban teljesít jobban a korábbi megoldásoknál.
  • Mindhárom könyvtár ABI-stabil, ezért nem kötődik egyetlen PyTorch-verzióhoz.
  • A régi TorchVision és TorchAudio médiafelületekről a TorchCodecra kell áttérni.

Egy könyvtár kezeli a média be- és kimenetét

A PyTorch október 5-én közzétett összefoglalója szerint az elmúlt két évben három könyvtár köré szervezte át médiafeldolgozó eszközeit: a TorchCodec, a TorchVision és a TorchAudio köré. A felosztás a képek, videók és hangok gépi tanulási feldolgozását követi.

A TorchCodec feladata a dekódolás és a kódolás. A könyvtár a médiafájlokból vagy kódolt bájtokból tenzorokat készít, illetve a tenzorokat ismét médiafájlokká alakítja. A rendszer képeket, videókat és hangokat kezel CPU-n és CUDA-n is.

A PyTorch korábbi megoldásában ezek a képességek részben megoszlottak a TorchVision és a TorchAudio között, több, egymást átfedő megvalósítással és háttérprogrammal. A TorchVision például több videós belépési pontot, valamint PyAV, C++ FFmpeg és CUDA/NVCUVID alapú háttereket használt. A TorchAudio videóhoz és hanghoz egyaránt kínált eszközöket, különféle FFmpeg, libsoundfile és libsox alapú megoldásokkal.

A PyTorch szerint a központosítás egyszerűbbé teszi annak eldöntését, melyik könyvtárban található a szükséges dekóder. A fejlesztési és teljesítményhangolási munka is egy helyre kerül. A vállalat állítása szerint a TorchCodec általában gyorsabb a TorchVision és a TorchAudio korábbi megvalósításainál, különösen CUDA-alapú videódekódoláskor.

A TorchVision és a TorchAudio az átalakításokra koncentrál

A TorchVision és a TorchAudio korábban modelleket, adathalmazokat, feldolgozási folyamatokat, átalakításokat, valamint bemeneti és kimeneti eszközöket is tartalmazott. A PyTorch most az átalakításokat tekinti e könyvtárak fő feladatának. A többi terület fejlesztése jelenleg nem aktív.

A döntés hátterében a projekt szerint az áll, hogy a közösség leginkább a TorchVision és a TorchAudio transzformációit használja, miközben a modellek, adathalmazok és feldolgozási folyamatok használata elmaradt. Ezekre a feladatokra a PyTorch példaként a HuggingFace könyvtárait említi.

A változás különösen a TorchAudio esetében járt sok módosítással. Több programozási felületet először kivezetésre jelöltek, majd később eltávolítottak. A PyTorch közlése szerint a közösségi visszajelzések hatására több, eredetileg megszüntetésre szánt népszerű felületet mégis megtartottak.

Így működik együtt a három könyvtár

A gyakorlati munkafolyamat egyszerű: a TorchCodec dekódolja a médiát, a TorchVision vagy a TorchAudio átalakítja a tenzorokat, a TorchCodec pedig szükség esetén kódolja az eredményt. Videónál a TorchCodec VideoDecoder eszköze például képkockákat ad át a TorchVision v2 transzformációinak. Hangnál az AudioDecoder mintákat készít, amelyekre a TorchAudio MelSpectrogram átalakítása alkalmazható.

A képfeldolgozás hasonlóan működik. A decode_image és a hozzá kapcsolódó eszközök közvetlenül a torchvision.transforms.v2 számára használható tenzorokat adnak. A kódolási oldalon a VideoEncoder, az AudioEncoder, a JpegEncoder és a PngEncoder áll rendelkezésre.

Mindhárom könyvtár ABI-stabil. Ez azt jelenti, hogy egy adott TorchCodec, TorchVision vagy TorchAudio verzió már nem egyetlen PyTorch-verzióhoz kötődik, és a későbbi PyTorch-verziókkal is működhet. Emiatt ezeket a könyvtárakat nem kell minden PyTorch-kiadáshoz újraépíteni, a kiadási ütemük pedig már nem igazodik automatikusan a PyTorchéhoz.

A felhasználóknak át kell térniük a TorchCodecra

A PyTorch azt javasolja, hogy akik még a TorchVision vagy a TorchAudio dekódoló és kódoló felületeit használják, kezdjék meg az átállást a TorchCodecra. Ehhez migrációs útmutatót biztosít, a hiányzó funkciókról pedig GitHubon vár visszajelzést.

A változtatás célja, hogy a média beolvasása és kiírása egy karbantartott, központosított könyvtárban történjen, miközben a TorchVision és a TorchAudio a tenzorok átalakítására összpontosít. A PyTorch későbbi bejegyzésben ígér részletesebb bemutatót az egyes könyvtárak újdonságairól és a teljes dekódolási, illetve átalakítási folyamat teljesítményének javításáról.

PyTorchTorchCodecTorchVisionTorchAudiokódolásmultimodális AI
Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Fejlesztőknek
Fejlesztőknek2026. október 2. 21:55

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA…

Fejlesztőknek
Fejlesztőknek2026. október 2. 21:33

Új tanulási útvonalon készülhetnek a PyTorch-minősítésre

A PyTorch új, strukturált tanulási útvonalat indított a PyTorch Certified Associate, vagyis PTCA-minősítéshez. A Linux Foundation Education rendszerén elérhető program…

Fejlesztőknek
Fejlesztőknek2026. szeptember 22. 17:45

Hardverfüggetlen rétegekkel alakítja át a vLLM-et a PyTorch

A vLLM új, hardverfüggetlen rétegeket kap, hogy a projekt a legújabb GPU-kra szabott optimalizációk mellett továbbra is támogassa a régebbi GPU-kat és a külső…