Apple-kutatás: gyorsabb LLM-futtatás külön draft modell nélkül

A Speculative Streaming nevű Apple-kutatás azt célozza, hogy a nagy nyelvi modellek válaszgenerálása gyorsabb legyen külön segédmodell fenntartása nélkül. A módszer az Apple szerint 1,8-3,1-szeres dekódolási gyorsulást ért el több feladattípuson, a generálási minőség romlása nélkül.
- Az Apple kutatása a Speculative Streaming nevű, egy modellt használó spekulatív dekódolási módszert mutatja be.
- A tanulmányt az ENLSP Workshop at NeurIPS 2024 eseményen fogadták el, megjelenési ideje 2024 november.
- A módszer 1,8-3,1-szeres dekódolási gyorsulást ért el az Apple szerint több feladattípuson.
- A Speculative Streaming körülbelül 10000-szer kevesebb extra paramétert használ, mint a Medusa-stílusú architektúrák.
- Az Apple szerint a megközelítés erőforrás-korlátozott eszközökhöz is jól illeszkedhet.
Egy modellbe vinnék be a spekulatív dekódolást
Az Apple gépi tanulási kutatási oldalán szereplő, Speculative Streaming: Fast LLM Inference Without Auxiliary Models című munka a nagy nyelvi modellek inferenciájának gyorsítására mutat be új megközelítést. A tanulmányt Nikhil Bhendawade, Irina Belousova, Qichen Fu, Henry Mason, Mohammad Rastegari és Mahyar Najibi jegyzi, és az Efficient Natural Language and Speech Processing, ENLSP Workshop at NeurIPS 2024 eseményen fogadták el. A publikáció megjelenési idejeként a forrás 2024 novemberét jelöli.
A kiindulópont a spekulatív dekódolás, amely a forrás szerint elterjedt technika a nagy célmodell inferenciájának gyorsítására. A megszokott megoldásban egy külön, kisebb vagy gyorsabb draft modell előrejelzéseket készít, ezeket pedig a nagyobb célmodell ellenőrzi. Az Apple kutatói szerint ez hatékony lehet, de alkalmazásspecifikus környezetekben gyakran a draft és a célmodell finomhangolását is igényli ahhoz, hogy magas legyen az elfogadási arány.
A probléma a forrás alapján főként akkor nő meg, amikor egyre több downstream feladatot kell kiszolgálni. Ilyenkor a külön draft modellek jelentős bonyolultságot adnak az inferenciarendszerekhez.
Jövőbeli n-gramokat jósoltat a célmodellel
A Speculative Streaming lényege, hogy a draftolást magába a célmodellbe építi be. A kutatók ezt úgy érik el, hogy a finomhangolási célt megváltoztatják: a következő token előrejelzése helyett jövőbeli n-gramok előrejelzésére tanítják a modellt.
Ez a forrás megfogalmazása szerint egy egyetlen modellt használó spekulatív dekódolási módszer. Vagyis a gyorsításhoz nem külön auxiliary draft modellel dolgozik, hanem a célmodell kap olyan feladatot, amely képes előretekintő javaslatokat beépíteni a dekódolásba.
Az Apple által közölt eredmények szerint a Speculative Streaming 1,8-3,1-szeres gyorsulást hozott a dekódolásban különböző feladatokon. A felsorolt példák között szerepel az összefoglalás, a strukturált lekérdezések és a jelentésreprezentáció. A forrás azt állítja, hogy mindez a generálási minőség feláldozása nélkül történt.
Kevesebb extra paraméter, erőforrás-szűk környezetekre célozva
A kutatás egyik hangsúlyos állítása a paraméterhatékonyság. Az Apple szerint a Speculative Streaming a Medusa-stílusú architektúrákkal azonos szintű vagy nagyobb gyorsulást ér el, miközben körülbelül 10000-szer kevesebb extra paramétert használ.
Ez azért lehet fontos, mert a nagy nyelvi modellek futtatásánál az inferencia nem csak számítási költséget, hanem rendszerszintű bonyolultságot is jelent. Ha egy gyorsítási módszerhez feladatonként külön draft modelleket kell kezelni és finomhangolni, az a forrás alapján növeli az üzemeltetési terhet.
A felhasználók és a piac szempontjából a hír közvetlen jelentősége abban áll, hogy az ilyen kutatások a gyorsabb válaszidő és a kisebb erőforrásigény irányába mutatnak. Az Apple saját leírása szerint a módszer különösen alkalmas lehet erőforrás-korlátozott eszközökre, mivel kevés extra paraméterrel céloz gyorsabb LLM-inferenciát.


