Az AMD és a Cerebras közös AI-inferencia megoldást fejleszt

Az AMD és a Cerebras olyan AI-inferencia-infrastruktúrán dolgozik, amely az AMD Helios rendszereit a Cerebras Wafer-Scale Engine technológiájával kapcsolja össze. A vállalatok szerint a megoldás akár ötször több tokent dolgozhat fel wattóránként, és először a Cerebras Cloudon válhat elérhetővé 2026 második felében.
- Az AMD Helios és a Cerebras Wafer-Scale Engine közös inferenciamunkafolyamatban működne.
- A Helios a promptok és nagy kontextusablakok feldolgozását célozza.
- A Cerebras technológiája az alacsony késleltetésű tokenképzést gyorsítja.
- A vállalatok szerint akár 5-ször nagyobb lehet a wattonkénti tokenkibocsátás.
- A megoldás először a Cerebras Cloudon jelenhet meg 2026 második felében.
Két eltérő feladatra optimalizált rendszer egy munkafolyamatban
Az AMD és a Cerebras július 23-án jelentette be technikai partnerségét az Advancing AI 2026 eseményen. A közös megoldás alapja egy úgynevezett szétválasztott következtetési, vagyis inference architektúra, amelyben a munkafolyamat két fő szakaszát külön számítási rendszer kezeli.
Az AMD Helios rackméretű megoldásai, az AMD Instinct GPU-kkal együtt, nagy áteresztőképességű motorként működnek. Ezek dolgozzák fel a promptokat és a nagy kontextusablakokat. A Cerebras Wafer-Scale Engine ezzel párhuzamosan a tokenek generálását gyorsítja, amely a vállalatok szerint jelentős memória-sávszélességet igényel, és különösen érzékeny a késleltetésre.
A két számítási motort egyetlen integrált következtetési munkafolyamatba kapcsolják. A cégek várakozása szerint ez akár 5-ször nagyobb, wattonkénti másodpercenkénti tokenkibocsátást eredményezhet.
A gyors válaszidő kerül előtérbe
Az AMD közleménye szerint az AI-inferencia terhelései eltérő követelményeket támasztanak a késleltetés, az áteresztőképesség, a tokenkapacitás, a költség és a skálázhatóság terén. A nagy volumenű feladatoknál a tokenkibocsátás maximalizálása lehet fontos, míg a kódolási eszközök, a valós idejű másodpilóták, az élő ügynökök és az ügynökalapú munkafolyamatok gyorsabb válaszokat igényelnek.
A vállalatok szerint a gyors tokenképzés egyre fontosabb az olyan területeken is, mint a szoftverfejlesztés, az autonóm ügynökök, a robotika és a tudományos felfedezés. Ezekben az alkalmazásokban a válaszidő közvetlenül befolyásolja a felhasználói élményt és a rendszer hasznosságát.
Lisa Su, az AMD elnök-vezérigazgatója szerint az AI-inferencia az egyik legnagyobb infrastrukturális lehetőséggé válik, miközben a terhelések sokfélesége rugalmasabb megközelítést kíván. Andrew Feldman, a Cerebras vezérigazgatója és társalapítója azt mondta, hogy az ultra gyors inferencia iránti kereslet példátlan ütemben nő, az AMD-vel való együttműködés pedig több ügyfélhez juttathatja el a Cerebras teljesítményét.
A Cerebras Cloudon jelenhet meg először
A Cerebras tervei szerint AMD Helios rendszereket telepít saját adatközpontjaiban. A közös megoldás várhatóan kezdetben a Cerebras Cloudon lesz elérhető 2026 második felében.
Az AMD közlése alapján a Helios a nagy áteresztőképességű és kiegyensúlyozott adatközponti inferencia alapját adja, míg a Cerebras technológiája az ultra alacsony késleltetésű dekódolást és a valós idejű tokenkibocsátást célozza. A partnerség így azoknak a feladatoknak szól, amelyeknél egyszerre fontos a nagy számú összetett kérés feldolgozása és a gyors válasz.
A bejelentés jelenleg együttműködésről és tervezett elérhetőségről szól. Az AMD külön figyelmeztetett arra is, hogy a közlemény jövőre vonatkozó állításai, köztük a teljesítményre, a skálázhatóságra és az elérhetőségre vonatkozó várakozások, kockázatoktól és bizonytalanságoktól függnek.

