AI-ügynökök segíthetnek az új modellek azonnali hardveres támogatásában
A PyTorch szerint AI-ügynökök által írt adapterekkel akár több ezer HuggingFace Transformers-modell is futtathatóvá tehető egy új hardveres környezetben. A módszert az IBM Spyre AI-gyorsítóján és a hozzá készült torch-spyre szoftveres háttéren mutatták be.
- A PyTorch AI-ügynökökkel írt adaptereket mutatott be új modellek hardveres támogatására.
- A módszerrel stock HuggingFace Transformers-modelleket futtattak IBM Spyre gyorsítón.
- Az adapterek a modellkód és a fordító által kezelhető műveletek közötti rést hidalják át.
- A torch-spyre a PyTorch-kódot a Spyre által végrehajtható tervvé fordítja.
- A PyTorch szerint a megoldás több ezer modell támogatását teszi lehetővé.
A modellek gyorsabban változnak, mint a szoftveres háttér
A PyTorch 2026. augusztus 20-án közzétett bejegyzése szerint az AI-modellek és modellcsaládok folyamatosan jelennek meg, miközben az ezeket futtató szoftveres verem gyakran késéssel követi az új architektúrákat. Egy új modell olyan modult, figyelmi megoldást vagy numerikus tartományt is használhat, amelyhez a meglévő fordító még nem kínál megfelelő útvonalat.
Egy modell hardveren való futtatásához fordítóra, műveleti leképezésekre és futtatókörnyezetre van szükség. Ezek alakítják át a modell számításait az adott eszköz magjaihoz, memóriarendszeréhez és számformátumaihoz. A PyTorch szerint egy új modellcsalád támogatása hagyományosan hetekig vagy hónapokig tartó, szakértői munkát igényelhet.
A helyzet új gyorsítók megjelenésekor még összetettebb. Ilyenkor egy teljes modellökoszisztémának kell együtt működnie egy olyan szoftveres veremmel, amely maga is fejlesztés alatt áll. A támogatásnak ezért a PyTorch megközelítése szerint párhuzamosan kell fejlődnie a platformmal, hogy a valós modellek már a teljes háttér elkészülte előtt is futtathatók legyenek.
Adapterek hidalják át a modell és a hardver közötti rést
A bemutatott stratégia egy vékony futásidejű rétegre, az adapterekre épül. Ezek a javítások egy modell működését úgy alakítják át az adott eszköz számára, hogy közben megőrizzék az elvégzett matematikai műveletet. Ha egy modell valamely művelete nem vezethető le megfelelően a fordítón keresztül, az adapter futás közben egy vele egyenértékű, jobban kezelhető formára cserélheti.
A PyTorch hangsúlyozza, hogy az adapter nem kézzel optimalizált kernel. A feladata olyan kód biztosítása, amelyet a fordító megfelelően le tud képezni, míg a teljesítményért továbbra is a fordító felel. Az adaptereket a bejegyzés egy építkezés ideiglenes állványzatához hasonlítja: egy-egy elem addig segít áthidalni egy hiányosságot, amíg a platformon elkészül a tartós megoldás.
Az egyes adapterek egy része később eltávolítható, amikor a szoftveres verem natív támogatást kap. Más adapterek tartósan megmaradhatnak, ha az adott gyorsító sajátos hardveres felépítését kezelik. Maga az adapterréteg hosszabb távon is hasznos maradhat, mivel a modellökoszisztéma folyamatosan újabb eltéréseket hoz.
A PyTorch az IBM Spyre gyorsítóján mutatta be a módszert
A példában szereplő hardver az IBM Spyre, amely az AIU, vagyis az Artificial Intelligence Unit köré épül. A gyorsító kis magokat használ, amelyeket nagy sávszélességű gyűrű kapcsol össze. A magok saját helyi munkamemóriával és mátrixszorzásokat végző feldolgozóelemekkel rendelkeznek.
A Spyre adatfolyam-alapú működést alkalmaz, vagyis a számításokat az adatok megérkezése indítja el a feldolgozóegységeken. A gyorsító következtetéshez tervezett, csökkentett pontosságú számformátumokat használ. Memóriája és számítási egységei úgynevezett stickekkel dolgoznak, amelyek mérete 128 bájt, fp16 esetén pedig 64 érték.
Ez eltér a PyTorch és a modellkód általános szemléletétől, amelyben a tenzor tetszőleges alakú, sík tömbként jelenik meg. A modellarchitektúrák fejszélessége, szekvenciahossza és szókincsmérete nem a Spyre stickjeihez igazodik, ezért az adapterek egyik feladata a kétféle működési modell összehangolása.
A torch-spyre olyan PyTorch-háttér, amely a szokásos torch-kódot a Spyre által végrehajtható tervvé fordítja. Erre épül a HF-adapters projekt, amely futásidejű módosításokkal teszi lehetővé a változtatás nélküli, kész HuggingFace Transformers-modellek futtatását az IBM gyorsítóján.
Az AI-ügynökök a támogatás bővítését gyorsíthatják
A PyTorch szerint az adapterek létrehozásában a kódolásra képes AI-ügynökök változtathatják meg a fejlesztés gazdaságosságát. Egy adapternek egyszerre kell értenie a Transformers modellkódját, például az egyes modulokat, figyelmi blokkokat, RoPE-megoldásokat és normalizálási műveleteket, valamint a torch-spyre fordító és futtatókörnyezetének működését.
A vállalat bemutatása szerint néhány AI által írt adapterrel stock HuggingFace Transformers-modelleket futtattak az IBM Spyre gyorsítóján, és több ezer modell teljes támogatását érték el. A megközelítés célja, hogy a modellek használhatók legyenek miközben a hardveres és fordítói háttér tovább fejlődik.
PyTorch: Harnessing AI for Day-One Model Enablement