A CoreWeave szerint élmezőnyben a Kimi K2.7 Code ár-teljesítménye

Elérhetővé vált a Moonshot AI Kimi K2.7 Code modellje a CoreWeave Serverless Inference szolgáltatásán. A CoreWeave szerint a modell a szolgáltatók között a legmagasabb tokenenkénti sebességet és a legalacsonyabb késleltetést kínálja a legjobb ár-teljesítmény mellett.
- A Kimi K2.7 Code elérhető a CoreWeave Serverless Inference szolgáltatásán.
- A modell 32 milliárd aktív paraméterrel és 256 ezer tokenes kontextusablakkal működik.
- A CoreWeave NVFP4 kvantálást és DFlash spekulatív dekódolást használ.
- A Moonshot AI szerint a modell körülbelül 30 százalékkal kevesebb következtetési tokent használ, mint a Kimi K2.6.
- A Serverless Inference ügyfelei API-n keresztül, infrastruktúra-üzemeltetés nélkül érhetik el a modellt.
Kódolásra és ügynöki feladatokra készült modell
A CoreWeave október 2-i közleménye szerint a Kimi K2.7 Code a Moonshot AI legújabb, kódolásra fókuszáló ügynöki modellje. A modell ugyanarra a billió paraméteres MoE, vagyis szakértőkeverék architektúrára épül, mint a Kimi K2.6, tokenenként 32 milliárd aktív paraméterrel dolgozik, és 256 ezer tokenes kontextusablakot kínál.
A modell súlyait Modified MIT licenc alatt tették közzé. A Kimi K2.7 Code-ot hosszú, teljes folyamatokat lefedő kódolási feladatokra, valamint eszközöket használó ügynöki munkára hangolták. A Moonshot AI jelentése szerint ugyanazon a feladaton a modell körülbelül 30 százalékkal kevesebb következtetési tokent használ, mint a Kimi K2.6. Ez a CoreWeave szerint csökkentheti a költséget és a késleltetést azokban az ügynöki folyamatokban, amelyek ismételten meghívják a modellt.
NVFP4 kvantálás és DFlash gyorsítás
A CoreWeave a Kimi K2.7 Code teljesítményének javításához NVIDIA GB300 NVL72 és GB200 NVL72 fürtöket használt. A modell eredetileg INT4, vagyis 4 bites egész számformátumban érkezett, a Blackwell platform viszont az FP4, köztük az NVIDIA NVFP4 formátum végrehajtását gyorsítja. A vállalat ezért egyedi NVFP4 kvantálást és DFlash spekulatív dekódolást alkalmazott.
A fejlesztési folyamatban a CoreWeave először saját AI Object Storage tárolójába másolta a Moonshot AI súlyait, majd több teszten mérte fel az INT4 változatot. A felsorolt értékelések között szerepelt a Terminal-Bench 2.0, az AIME2025, a SWE-Bench Pro és a SWE-Bench Multilingual. Az NVFP4-re alakításhoz a NVIDIA Model-Optimizer projektet és egy háromlépcsős kalibrációt használtak, rövid és hosszú kontextusú beszélgetési, matematikai és kódolási adatokkal.
A DFlash spekulátor tanításához több mint 1 millió promptból álló adathalmazt készítettek. Ezek hosszú kontextusú, eszközhívást és ügynöki kódolási feladatokat tartalmazó munkafolyamatokat fedtek le. A CoreWeave a D-PACE módosított veszteségfüggvényt is alkalmazta, amely a vállalat közlése szerint a SPEED-Bench AL adathalmazon kategóriától függően hozzávetőleg 8 százalékkal javította az elfogadási hosszt.
Mit kapnak a CoreWeave ügyfelei?
A CoreWeave szerint a Kimi K2.7 Code éles végpontja alapértelmezés szerint NVFP4 és DFlash konfigurációban, vLLM-en fut. Az optimalizálásokhoz nincs szükség további beállításra az ügyfelek oldalán. A vállalat a modellt az Artificial Analysis sebesség és ár diagramján is a vezető szolgáltatók közé sorolja. Az Artificial Analysis a kimeneti sebességet token per másodpercben és az egymillió tokenre jutó árat méri. Az ár számításánál a CoreWeave által idézett módszer 7:2:1 arányban veszi figyelembe a gyorsítótár-találat, a bemeneti és a kimeneti költségeket.
A Serverless Inference használói egyetlen API-n keresztül hívhatják a Kimi K2.7 Code-ot, tokenenként fizetnek, és infrastruktúra üzemeltetése nélkül vehetik igénybe az optimalizációkat. A Dedicated Inference nagyobb kontrollt ad a GPU-választás, a futtatási konfiguráció és az automatikus skálázás felett. A CoreWeave Kubernetes Service közvetlenebb hozzáférést biztosít a GPU-khoz, a futtatási környezethez, a vezényléshez és a kapacitáshoz.
A cég szerint a Kimi K2.7 Code a második egymást követő Kimi-modell, amelyet a CoreWeave csapata optimalizált és élesített. A vállalat ezt folyamatos fejlesztési ciklusként írja le, amelyben a modell tanítása, értékelése, kiszolgálása és mérése ugyanazon a platformon történik.


