Kevesebb tokenből hozná a Kimi K3 szintjét a Fireworks Ember-1

A Fireworks Research bemutatta az Ember-1-et, egy Kimi K3-ra épülő specializált modellt, amely a vállalat szerint 40 százalékkal kevesebb tokenből hozza ugyanazt a minőséget. A modell kutatási előzetesként már elérhető a Fireworks Serverless szolgáltatásában.
- Az Ember-1 a Kimi K3-ra épülő specializált Fireworks-modell.
- A Fireworks szerint 40 százalékkal kevesebb tokennel tartja a K3 minőségét.
- A fejlesztés során több mint 50 tréningkísérletet és 200-nál több értékelést végeztek.
- Két ügyfél éles A/B tesztjeiben körülbelül 35 százalékos tokenmegtakarítást mértek.
- A modell Research Preview kiadásként elérhető a Fireworks Serverless platformján.
A cél a fölösleges gondolkodás visszavágása
Az Ember-1 fejlesztését az a gyakorlati probléma indította el, hogy a Kimi K3 hosszú gondolkodási nyomokat generál. A Fireworks szerint a reasoning modellek, vagyis a következtetési modellek, a létrehozott tokenek többségét belső gondolkodásra fordítják, ez az arány időnként a 90 százalékot is meghaladja.
Ez különösen költséges lehet többlépéses, ügynöki munkafolyamatokban. Ilyenkor minden új körben a korábbi következtetések is visszakerülnek a modell kontextusába, így a kontextus mérete a fordulók számával nagyjából négyzetesen növekedhet. A Fireworks kísérletei szerint a Kimi K3 gondolkodási nyomai gyakran hosszabbak a feladat megoldásához szükségesnél, és a fölösleges rész eltávolítható a válasz minőségének romlása nélkül.
A vállalat ugyanakkor azt írja, hogy a K3 minden következtetése nem fölösleges. Az önellenőrzés, egy korábbi feltételezés újravizsgálata vagy egy döntés következményeinek visszakövetése segíthet a hibák javításában. Az Ember-1 célja ezért az ilyen hasznos képességek megtartása, miközben csökkenti a terméketlen gondolkodást és az ismétlődő hurkokat.
Több mint 50 kísérlet után képezték ki
A Fireworks Research több mint 50 tréningkísérletet és 200-nál is több értékelést végzett az Ember-1 fejlesztése során. A csapat új tanítási algoritmusokat is kidolgozott annak érdekében, hogy rövidítse a következtetéseket az pontosság megőrzése mellett.
A modellt matematikai, programozási, utasításkövetési, beszélgetési, keresési, eszközhasználati és szoftverfejlesztési feladatokon tanították. A gyűjtemény önálló problémákat és hosszabb interakciókat is tartalmazott, hogy a modell képes legyen alkalmazkodni az új megfigyelésekhez és azok következményeihez. A Fireworks közlése szerint a tanításhoz saját adatokat használtak, ügyféladatokat nem.
A vállalat hét nyilvános benchmark és két ügyfél éles forgalma alapján azt állítja, hogy a Kimi K3 következtetései 35 és 50 százalék közötti mértékben rövidíthetők a pontosság feláldozása nélkül.
Benchmarkokon és éles forgalomban is tesztelték
Az Ember-1-et a Fireworks Specialized Intelligence Indexén belül a Doximity Bedside Bench teszten is vizsgálták. Ez egy orvosok által validált benchmark, amely 500 klinikai esetet fed le 10 specializált kategóriában. A Fireworks szerint a modell a költség és feladatonkénti teljesítmény Pareto-frontján új szintet ért el nyílt és zárt modellekkel összevetve, köztük a GPT-5.6 Sol, GPT-6 Astra és Claude Opus 5 rendszerekkel.
Öt további iparági benchmark összevetésében az Ember-1 a vállalat szerint minden, 50-nél több tesztmintát tartalmazó mérésben a Pareto-fronton vagy annak közelében helyezkedett el. A Kimi K3 maximális gondolkodási szintjének minőségét a Fireworks állítása szerint töredék költséggel érte el, és a K3 alacsony gondolkodási szintjét minden vizsgált összehasonlításban felülmúlta.
A két ügyféllel végzett élő A/B tesztekben az Ember-1 feladatonként körülbelül 35 százalékkal kevesebb tokent használt hasonló minőség mellett. A Fireworks szerint a feladatbefejezés, a sikerességi pontszámok és a hibaarányok a jelentősen alacsonyabb tokenköltség mellett is megmaradtak vagy javultak. Az egyik ügyfél már éles termelési környezetben futtatja a modellt, és a teljes átállást tervezi.
Kutatási előzetesként érhető el
A Fireworks belső kódolási és együttműködési munkafolyamataiban is kipróbálta az Ember-1-et. A cég szerint a fejlesztők nem vették észre a modellváltást, miközben lényegesen kevesebb tokent használtak.
Az Ember-1 a Kimi K3 alapmodell mellett választható szolgáltatási opcióként jelenik meg a Fireworks Serverless platformján, Research Preview kiadásban. A Fireworks közlése szerint az új kutatási modellekhez két hétig biztosítanak szerver nélküli hozzáférést, a későbbi állandó elérhetőségről pedig a közösségi igény alapján döntenek.
Fireworks AI: Introducing Ember-1


