Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A CoreWeave szerint élmezőnyben a Kimi K2.7 Code ár-teljesítménye

2026. október 2.Forrás: CoreWeave
A CoreWeave szerint élmezőnyben a Kimi K2.7 Code ár-teljesítménye
Kép: CoreWeave

Elérhetővé vált a Moonshot AI Kimi K2.7 Code modellje a CoreWeave Serverless Inference szolgáltatásán. A CoreWeave szerint a modell a szolgáltatók között a legmagasabb tokenenkénti sebességet és a legalacsonyabb késleltetést kínálja a legjobb ár-teljesítmény mellett.

A lényeg röviden
  • A Kimi K2.7 Code elérhető a CoreWeave Serverless Inference szolgáltatásán.
  • A modell 32 milliárd aktív paraméterrel és 256 ezer tokenes kontextusablakkal működik.
  • A CoreWeave NVFP4 kvantálást és DFlash spekulatív dekódolást használ.
  • A Moonshot AI szerint a modell körülbelül 30 százalékkal kevesebb következtetési tokent használ, mint a Kimi K2.6.
  • A Serverless Inference ügyfelei API-n keresztül, infrastruktúra-üzemeltetés nélkül érhetik el a modellt.

Kódolásra és ügynöki feladatokra készült modell

A CoreWeave október 2-i közleménye szerint a Kimi K2.7 Code a Moonshot AI legújabb, kódolásra fókuszáló ügynöki modellje. A modell ugyanarra a billió paraméteres MoE, vagyis szakértőkeverék architektúrára épül, mint a Kimi K2.6, tokenenként 32 milliárd aktív paraméterrel dolgozik, és 256 ezer tokenes kontextusablakot kínál.

A modell súlyait Modified MIT licenc alatt tették közzé. A Kimi K2.7 Code-ot hosszú, teljes folyamatokat lefedő kódolási feladatokra, valamint eszközöket használó ügynöki munkára hangolták. A Moonshot AI jelentése szerint ugyanazon a feladaton a modell körülbelül 30 százalékkal kevesebb következtetési tokent használ, mint a Kimi K2.6. Ez a CoreWeave szerint csökkentheti a költséget és a késleltetést azokban az ügynöki folyamatokban, amelyek ismételten meghívják a modellt.

NVFP4 kvantálás és DFlash gyorsítás

A CoreWeave a Kimi K2.7 Code teljesítményének javításához NVIDIA GB300 NVL72 és GB200 NVL72 fürtöket használt. A modell eredetileg INT4, vagyis 4 bites egész számformátumban érkezett, a Blackwell platform viszont az FP4, köztük az NVIDIA NVFP4 formátum végrehajtását gyorsítja. A vállalat ezért egyedi NVFP4 kvantálást és DFlash spekulatív dekódolást alkalmazott.

A fejlesztési folyamatban a CoreWeave először saját AI Object Storage tárolójába másolta a Moonshot AI súlyait, majd több teszten mérte fel az INT4 változatot. A felsorolt értékelések között szerepelt a Terminal-Bench 2.0, az AIME2025, a SWE-Bench Pro és a SWE-Bench Multilingual. Az NVFP4-re alakításhoz a NVIDIA Model-Optimizer projektet és egy háromlépcsős kalibrációt használtak, rövid és hosszú kontextusú beszélgetési, matematikai és kódolási adatokkal.

A DFlash spekulátor tanításához több mint 1 millió promptból álló adathalmazt készítettek. Ezek hosszú kontextusú, eszközhívást és ügynöki kódolási feladatokat tartalmazó munkafolyamatokat fedtek le. A CoreWeave a D-PACE módosított veszteségfüggvényt is alkalmazta, amely a vállalat közlése szerint a SPEED-Bench AL adathalmazon kategóriától függően hozzávetőleg 8 százalékkal javította az elfogadási hosszt.

Mit kapnak a CoreWeave ügyfelei?

A CoreWeave szerint a Kimi K2.7 Code éles végpontja alapértelmezés szerint NVFP4 és DFlash konfigurációban, vLLM-en fut. Az optimalizálásokhoz nincs szükség további beállításra az ügyfelek oldalán. A vállalat a modellt az Artificial Analysis sebesség és ár diagramján is a vezető szolgáltatók közé sorolja. Az Artificial Analysis a kimeneti sebességet token per másodpercben és az egymillió tokenre jutó árat méri. Az ár számításánál a CoreWeave által idézett módszer 7:2:1 arányban veszi figyelembe a gyorsítótár-találat, a bemeneti és a kimeneti költségeket.

A Serverless Inference használói egyetlen API-n keresztül hívhatják a Kimi K2.7 Code-ot, tokenenként fizetnek, és infrastruktúra üzemeltetése nélkül vehetik igénybe az optimalizációkat. A Dedicated Inference nagyobb kontrollt ad a GPU-választás, a futtatási konfiguráció és az automatikus skálázás felett. A CoreWeave Kubernetes Service közvetlenebb hozzáférést biztosít a GPU-khoz, a futtatási környezethez, a vezényléshez és a kapacitáshoz.

A cég szerint a Kimi K2.7 Code a második egymást követő Kimi-modell, amelyet a CoreWeave csapata optimalizált és élesített. A vállalat ezt folyamatos fejlesztési ciklusként írja le, amelyben a modell tanítása, értékelése, kiszolgálása és mérése ugyanazon a platformon történik.

Kapcsolódó hírek

A CoreWeave több mint 3000 AI-szakembert hozott össze San Franciscóban
Chipek és infrastruktúra2026. október 2.

A CoreWeave több mint 3000 AI-szakembert hozott össze San Franciscóban

Több mint 3000 AI-szakember gyűlt össze San Franciscóban a CoreWeave első Fully Connected konferenciáján. A vállalat több új platformszolgáltatást is bemutatott, köztük…

A CoreWeave 512 H100 GPU-n tesztelte a torchforge RL-keretrendszert
Fejlesztőknek2026. október 2.

A CoreWeave 512 H100 GPU-n tesztelte a torchforge RL-keretrendszert

A CoreWeave támogatást jelentett be a torchforge nevű, PyTorch-ra épülő, elosztott megerősítéses tanulási keretrendszerhez. A vállalat a Meta és a Stanford Scaling…

A CoreWeave folyadékhűtésre épített adatközpontokkal készül
Chipek és infrastruktúra2026. október 2.

A CoreWeave folyadékhűtésre épített adatközpontokkal készül

A CoreWeave olyan adatközponti infrastruktúrát épít, amelyet kifejezetten mesterségesintelligencia-munkafolyamatokra és több tízezer GPU-s klaszterekre terveznek. A…