Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

OpenAI: a Jalapeño chip gyorsabb és takarékosabb AI-kiszolgálást hoz

2026. augusztus 25.Forrás: OpenAI

Az OpenAI 2026. augusztus 25-én közzétette első mérési eredményeit a Jalapeño nevű, saját fejlesztésű inference chipről. A vállalat szerint a chip egyszerre kínál nagyobb áteresztőképességet és alacsonyabb késleltetést több nyilvános modellen.

A lényeg röviden
  • Az OpenAI közzétette első mérési eredményeit a Jalapeño nevű saját inference chipről.
  • A cég szerint a chip 1,5-szeres és 1,9-szeres közötti több AI-munkát végzett wattonként csúcsterhelésnél.
  • A mért end-to-end késleltetés 1,7-szeres és 3,6-szeres közötti mértékben volt alacsonyabb a viszonyítási rendszereknél.
  • A Jalapeñót GPT‑OSS 120B, DeepSeek R1 és Kimi K2.5 1T modelleken is tesztelték.
  • Az OpenAI az év végéig tervezi megkezdeni a chip telepítését saját számítási infrastruktúrájában.

Első mérések az OpenAI saját inference chipjéről

Az OpenAI szerint a Jalapeño, a vállalat első saját inference chipje jelentős teljesítményelőrelépést mutatott a teszteken. A cég azt állítja, hogy a chip egységnyi energiafelhasználás mellett több AI-munkát tud kiszolgálni, miközben gyorsabban ad vissza válaszokat.

A bejelentés lényege, hogy a Jalapeño egy architektúrán belül javítja az áteresztőképességet és a késleltetést. Az OpenAI szerint a meglévő hardveres rendszereknél gyakran kompromisszumot kell kötni a kettő között. A vállalat ezt ügyféloldalon gyorsabb válaszokkal, reagálóképesebb agentekkel és a kereslet növekedése mellett megbízhatóbb hozzáféréssel köti össze.

A chipet GPT‑OSS 120B, DeepSeek R1 és Kimi K2.5 1T modelleken is tesztelték, vagyis a mérések OpenAI-n belül és kívül fejlesztett modelleket is érintettek. A három modellen a Jalapeño csúcsterhelésnél 1,5-szeres és 1,9-szeres közötti több AI-munkát végzett wattonként a viszonyítási rendszerekhez képest, az end-to-end késleltetés pedig 1,7-szeres és 3,6-szeres közötti mértékben volt alacsonyabb. Erősen interaktív terheléseknél a cég 2,1-szeres és 4,1-szeres közötti nagyobb teljesítményről számolt be.

Így mérte a teljesítményt a vállalat

Az OpenAI a méréseknél azonos felhasználói élmény mellett vizsgálta, hogy az egyes rendszerek mennyi hasznos AI-munkát végeznek egységnyi energiafelhasználásra vetítve, miközben teljesítik az ügyfelek és az interaktív agentek által megkövetelt késleltetést. A cég szerint ez különösen az agenteknél fontos, mert azok sok lépést hajtanak végre egymás után, így a késések egy teljes feladaton belül összeadódhatnak.

A gyakorlati teljesítményt az InferenceX nevű, a SemiAnalysis által készített nyilvános benchmarkon tesztelték. Ez a benchmark egy AI-kérés kiszolgálásának teljes folyamatát méri. Az OpenAI a Jalapeñót vezető, kereskedelmi forgalomban elérhető AI-rendszerekkel hasonlította össze a vizsgált működési tartományban, a nagy áteresztőképességű kiszolgálástól az erősen interaktív, alacsony késleltetésű használatig.

A vállalat szerint a Jalapeño a vizsgált tartományban jobb kombinációt adott áteresztőképességből, energiahatékonyságból és késleltetésből. Az eredményeket az egyes gyorsítók közzétett chipfogyasztási besorolása alapján normalizálták. A Jalapeño névleges teljesítményfelvétele 700 watt, ugyanakkor a mért tartós fogyasztás a tesztelt terheléseken legfeljebb 550 watt volt.

A Kimi K2.5 1T, vagyis a tesztelt legnagyobb nyilvános modell esetében az OpenAI körülbelül 1,5-szer nagyobb csúcsteljesítményt mért wattonként, az end-to-end késleltetés pedig 3,4-szer alacsonyabb volt a viszonyítási rendszerhez képest. A cég belső tesztjei szerint a Jalapeño előnye tovább nőtt az OpenAI frontier modelljein, ami a vállalat értelmezése szerint arra utal, hogy az architektúra értéke nagyobb és igényesebb terheléseknél nőhet.

A chipet nyelvi modellek kiszolgálására tervezték

Az OpenAI leírása szerint a Jalapeño fejlesztésekor abból indultak ki, milyen hardvert építenének, ha annak elsődleges feladata modern és jövőbeli nyelvi modellek, különösen interaktív agentek kiszolgálása lenne. A teljesítménynyereséget a chip, a memória, a hálózat, a szoftver és a rack szintű rendszer közös tervezésével magyarázzák, valós nyelvimodell-terhelések köré szervezve.

A forrás szerint a nyelvi modellek inference folyamata több eltérő szakaszból áll. A prefill, vagyis amikor a rendszer feldolgozza a promptot, számításigényes. A decode, amikor a válasz tokenről tokenre készül, inkább a memória-sávszélességtől függ. A kommunikáció is késleltetést okozhat, ha az adatoknak magok és chipek között kell mozogniuk.

A Jalapeñót az OpenAI szerint úgy tervezték, hogy csökkentse az adatmozgatást és a kommunikációs késéseket. A modell állapota, köztük a válaszgenerálás során használt KV cache, kifejezetten elhelyezhető és helyben tartható, miközben a rendszer az inference egyes szakaszaihoz a megfelelő számítási, memória- és hálózati erőforrásokat aktiválja. A hálózatot a cég az architektúra szerves részeként írja le, amelynek nagy tartománya segít abban, hogy a teljes terhelés egy összekapcsolt rendszeren belül maradjon.

AI segítette a fejlesztést és a programozást

Az OpenAI azt is közölte, hogy az AI közvetlen szerepet játszott a Jalapeño fejlesztésében. A vállalat szerint ez segítette a csapatot abban, hogy az első tervtől a tapeoutig kilenc hónap alatt eljusson, miközben implementációkat vizsgáltak, rövidítették a tervezési, mérési és ellenőrzési ciklusokat, és folyamatosan iteráltak a modellterheléseken.

A cég állítása szerint az AI a chip aritmetikai áramköreinek optimalizálásában is segített, hogy több számítási teljesítmény férjen bele az ütemtervbe. A Jalapeñót egyértelmű és kiszámítható programozási célpontnak tervezték emberek és AI-rendszerek számára is: a mérnökök helyi tenzorokkal, explicit kommunikációval és kiszámítható szinkronizációval írhatják le a munkát, az AI pedig optimalizálhatja a leképezést, elhelyezést, ütemezést és koordinációt.

A forrás szerint minden új modellcsalád támogatásához továbbra is új kernelekre és modellfüggő optimalizálásokra van szükség. A Codex és a GPT‑Astra használatával a csapat három olyan open-weight modellt vitt nagy teljesítményre két hónapon belül, amelyek nem szerepeltek a Jalapeño eredeti gyártási tervében. Kiválasztott GPT‑OSS attention és mixture-of-experts blokkoknál az AI által generált implementációk 1,5-szer és 1,8-szer gyorsabban futottak, mint a meglévő, emberi szakértők által írt megoldások. Az OpenAI hangsúlyozza, hogy ezek a számok a kiválasztott blokkokra vonatkoznak, nem a teljes modellre.

Mit jelenthet ez a felhasználóknak és a piacnak

Az OpenAI a Jalapeñót a teljes technológiai stackre kiterjedő előny bizonyítékaként mutatja be. A cég szerint egyszerre tud modelleket, termékeket, kiszolgálószoftvert, chipeket, memóriát, hálózatot és rendszereket tervezni, majd a valós terhelésekből tanultakat a stack minden rétegében felhasználni.

A vállalat szerint azzal, hogy ugyanabból az energiából és hardverből több hasznos munka hozható ki, a Jalapeño több kereslet kiszolgálását és egy sikeres eredmény előállítási költségének csökkentését segítheti. Az OpenAI ezt a működési tőkeáttétel javulásával, a szélesebb körű elterjedéssel, valamint a jobb modellekbe, termékekbe és infrastruktúrába történő további befektetéssel kapcsolja össze.

A cég a Jalapeño telepítését az OpenAI számítási infrastruktúrájában az év végéig tervezi megkezdeni. A chipet egy többgenerációs útiterv első generációjának nevezi: a Gen 2 már mély fejlesztés alatt áll, a Gen 3 pedig formálódik. Közben az OpenAI azt is közölte, hogy továbbra is széles körben telepít NVIDIA és más partnerektől származó gyorsítókat tréninghez és inference feladatokhoz. A bevezetés előtt a vállalat folytatja a gyártási minősítést, a szoftver érlelését, a skálázott üzemeltetés előkészítését és a teljesítmény validálását több modellen.

Kapcsolódó hírek

Szállítja első, ügynökökhöz épített CPU-ját az NVIDIA
Chipek és infrastruktúra2026. augusztus 27.

Szállítja első, ügynökökhöz épített CPU-ját az NVIDIA

Az NVIDIA 2026. augusztus 27-i blogbejegyzésének címe szerint a vállalat megkezdte a Vera szállítását. A cég a Verát az első, ügynökökhöz épített CPU-jaként írja le.

Chipek és infrastruktúra
Chipek és infrastruktúra2026. augusztus 25.

OpenAI bemutatta Jalapeño nevű első saját inference chipjének méréseit

Az OpenAI 2026. augusztus 25-én ismertette Jalapeño, a vállalat első saját inference chipjének első mért teljesítményeredményeit. A cég a bejelentést szélesebb számítási…

NVIDIA 4,25 gigawattos AI-gyárkapacitást köt le Ohio államban
Cégek és üzlet2026. augusztus 17.

NVIDIA 4,25 gigawattos AI-gyárkapacitást köt le Ohio államban

Az NVIDIA 2026. augusztus 17-én közölte, hogy az SB Energyvel együttműködve LPS-kapacitást biztosít a PORTS-Pike Technology Campuson, Portsmouth városában, Ohio…