OpenAI: a Jalapeño chip gyorsabb és takarékosabb AI-kiszolgálást hoz
Az OpenAI 2026. augusztus 25-én közzétette első mérési eredményeit a Jalapeño nevű, saját fejlesztésű inference chipről. A vállalat szerint a chip egyszerre kínál nagyobb áteresztőképességet és alacsonyabb késleltetést több nyilvános modellen.
- Az OpenAI közzétette első mérési eredményeit a Jalapeño nevű saját inference chipről.
- A cég szerint a chip 1,5-szeres és 1,9-szeres közötti több AI-munkát végzett wattonként csúcsterhelésnél.
- A mért end-to-end késleltetés 1,7-szeres és 3,6-szeres közötti mértékben volt alacsonyabb a viszonyítási rendszereknél.
- A Jalapeñót GPT‑OSS 120B, DeepSeek R1 és Kimi K2.5 1T modelleken is tesztelték.
- Az OpenAI az év végéig tervezi megkezdeni a chip telepítését saját számítási infrastruktúrájában.
Első mérések az OpenAI saját inference chipjéről
Az OpenAI szerint a Jalapeño, a vállalat első saját inference chipje jelentős teljesítményelőrelépést mutatott a teszteken. A cég azt állítja, hogy a chip egységnyi energiafelhasználás mellett több AI-munkát tud kiszolgálni, miközben gyorsabban ad vissza válaszokat.
A bejelentés lényege, hogy a Jalapeño egy architektúrán belül javítja az áteresztőképességet és a késleltetést. Az OpenAI szerint a meglévő hardveres rendszereknél gyakran kompromisszumot kell kötni a kettő között. A vállalat ezt ügyféloldalon gyorsabb válaszokkal, reagálóképesebb agentekkel és a kereslet növekedése mellett megbízhatóbb hozzáféréssel köti össze.
A chipet GPT‑OSS 120B, DeepSeek R1 és Kimi K2.5 1T modelleken is tesztelték, vagyis a mérések OpenAI-n belül és kívül fejlesztett modelleket is érintettek. A három modellen a Jalapeño csúcsterhelésnél 1,5-szeres és 1,9-szeres közötti több AI-munkát végzett wattonként a viszonyítási rendszerekhez képest, az end-to-end késleltetés pedig 1,7-szeres és 3,6-szeres közötti mértékben volt alacsonyabb. Erősen interaktív terheléseknél a cég 2,1-szeres és 4,1-szeres közötti nagyobb teljesítményről számolt be.
Így mérte a teljesítményt a vállalat
Az OpenAI a méréseknél azonos felhasználói élmény mellett vizsgálta, hogy az egyes rendszerek mennyi hasznos AI-munkát végeznek egységnyi energiafelhasználásra vetítve, miközben teljesítik az ügyfelek és az interaktív agentek által megkövetelt késleltetést. A cég szerint ez különösen az agenteknél fontos, mert azok sok lépést hajtanak végre egymás után, így a késések egy teljes feladaton belül összeadódhatnak.
A gyakorlati teljesítményt az InferenceX nevű, a SemiAnalysis által készített nyilvános benchmarkon tesztelték. Ez a benchmark egy AI-kérés kiszolgálásának teljes folyamatát méri. Az OpenAI a Jalapeñót vezető, kereskedelmi forgalomban elérhető AI-rendszerekkel hasonlította össze a vizsgált működési tartományban, a nagy áteresztőképességű kiszolgálástól az erősen interaktív, alacsony késleltetésű használatig.
A vállalat szerint a Jalapeño a vizsgált tartományban jobb kombinációt adott áteresztőképességből, energiahatékonyságból és késleltetésből. Az eredményeket az egyes gyorsítók közzétett chipfogyasztási besorolása alapján normalizálták. A Jalapeño névleges teljesítményfelvétele 700 watt, ugyanakkor a mért tartós fogyasztás a tesztelt terheléseken legfeljebb 550 watt volt.
A Kimi K2.5 1T, vagyis a tesztelt legnagyobb nyilvános modell esetében az OpenAI körülbelül 1,5-szer nagyobb csúcsteljesítményt mért wattonként, az end-to-end késleltetés pedig 3,4-szer alacsonyabb volt a viszonyítási rendszerhez képest. A cég belső tesztjei szerint a Jalapeño előnye tovább nőtt az OpenAI frontier modelljein, ami a vállalat értelmezése szerint arra utal, hogy az architektúra értéke nagyobb és igényesebb terheléseknél nőhet.
A chipet nyelvi modellek kiszolgálására tervezték
Az OpenAI leírása szerint a Jalapeño fejlesztésekor abból indultak ki, milyen hardvert építenének, ha annak elsődleges feladata modern és jövőbeli nyelvi modellek, különösen interaktív agentek kiszolgálása lenne. A teljesítménynyereséget a chip, a memória, a hálózat, a szoftver és a rack szintű rendszer közös tervezésével magyarázzák, valós nyelvimodell-terhelések köré szervezve.
A forrás szerint a nyelvi modellek inference folyamata több eltérő szakaszból áll. A prefill, vagyis amikor a rendszer feldolgozza a promptot, számításigényes. A decode, amikor a válasz tokenről tokenre készül, inkább a memória-sávszélességtől függ. A kommunikáció is késleltetést okozhat, ha az adatoknak magok és chipek között kell mozogniuk.
A Jalapeñót az OpenAI szerint úgy tervezték, hogy csökkentse az adatmozgatást és a kommunikációs késéseket. A modell állapota, köztük a válaszgenerálás során használt KV cache, kifejezetten elhelyezhető és helyben tartható, miközben a rendszer az inference egyes szakaszaihoz a megfelelő számítási, memória- és hálózati erőforrásokat aktiválja. A hálózatot a cég az architektúra szerves részeként írja le, amelynek nagy tartománya segít abban, hogy a teljes terhelés egy összekapcsolt rendszeren belül maradjon.
AI segítette a fejlesztést és a programozást
Az OpenAI azt is közölte, hogy az AI közvetlen szerepet játszott a Jalapeño fejlesztésében. A vállalat szerint ez segítette a csapatot abban, hogy az első tervtől a tapeoutig kilenc hónap alatt eljusson, miközben implementációkat vizsgáltak, rövidítették a tervezési, mérési és ellenőrzési ciklusokat, és folyamatosan iteráltak a modellterheléseken.
A cég állítása szerint az AI a chip aritmetikai áramköreinek optimalizálásában is segített, hogy több számítási teljesítmény férjen bele az ütemtervbe. A Jalapeñót egyértelmű és kiszámítható programozási célpontnak tervezték emberek és AI-rendszerek számára is: a mérnökök helyi tenzorokkal, explicit kommunikációval és kiszámítható szinkronizációval írhatják le a munkát, az AI pedig optimalizálhatja a leképezést, elhelyezést, ütemezést és koordinációt.
A forrás szerint minden új modellcsalád támogatásához továbbra is új kernelekre és modellfüggő optimalizálásokra van szükség. A Codex és a GPT‑Astra használatával a csapat három olyan open-weight modellt vitt nagy teljesítményre két hónapon belül, amelyek nem szerepeltek a Jalapeño eredeti gyártási tervében. Kiválasztott GPT‑OSS attention és mixture-of-experts blokkoknál az AI által generált implementációk 1,5-szer és 1,8-szer gyorsabban futottak, mint a meglévő, emberi szakértők által írt megoldások. Az OpenAI hangsúlyozza, hogy ezek a számok a kiválasztott blokkokra vonatkoznak, nem a teljes modellre.
Mit jelenthet ez a felhasználóknak és a piacnak
Az OpenAI a Jalapeñót a teljes technológiai stackre kiterjedő előny bizonyítékaként mutatja be. A cég szerint egyszerre tud modelleket, termékeket, kiszolgálószoftvert, chipeket, memóriát, hálózatot és rendszereket tervezni, majd a valós terhelésekből tanultakat a stack minden rétegében felhasználni.
A vállalat szerint azzal, hogy ugyanabból az energiából és hardverből több hasznos munka hozható ki, a Jalapeño több kereslet kiszolgálását és egy sikeres eredmény előállítási költségének csökkentését segítheti. Az OpenAI ezt a működési tőkeáttétel javulásával, a szélesebb körű elterjedéssel, valamint a jobb modellekbe, termékekbe és infrastruktúrába történő további befektetéssel kapcsolja össze.
A cég a Jalapeño telepítését az OpenAI számítási infrastruktúrájában az év végéig tervezi megkezdeni. A chipet egy többgenerációs útiterv első generációjának nevezi: a Gen 2 már mély fejlesztés alatt áll, a Gen 3 pedig formálódik. Közben az OpenAI azt is közölte, hogy továbbra is széles körben telepít NVIDIA és más partnerektől származó gyorsítókat tréninghez és inference feladatokhoz. A bevezetés előtt a vállalat folytatja a gyártási minősítést, a szoftver érlelését, a skálázott üzemeltetés előkészítését és a teljesítmény validálását több modellen.

