Olcsóbb és specializáltabb modellekkel gyorsul az AI-verseny

Két nap alatt három jelentős AI-labor új modellt mutatott be: a SpaceXAI Grok 4.7-et, az Anthropic Claude Opus 5.5-öt, az OpenAI pedig a GPT-6 Sol és GPT-6 Luna modelleket. A Kilo Code szerint a fejlesztők egyre inkább feladatonként választhatnak modellt, miközben csökkenhet a kész feladatokra jutó költség.
- A SpaceXAI Grok 4.7, az Anthropic Claude Opus 5.5 és az OpenAI GPT-6 Sol és Luna két napon belül jelent meg.
- A GPT-6 Sol és Luna ára nagyjából a GPT-5.6 elődeik árának felére csökkent.
- Az Artificial Analysis szerint a GPT-6 Sol feladatonkénti költsége 1,06 dollár, a GPT-6 Lunáé 0,07 dollár.
- A Kilo szerint a modellválasztásnál a teljes feladatköltség fontosabb lehet a tokenárnál.
- A Grok 4.7, a Claude Opus 5.5 és a GPT-6 család eltérő feladatokra és költségszintekre helyezi a hangsúlyt.
Három labor, három eltérő irány
A Kilo Code szeptember 22-i elemzése szerint az új modellek már elérhetők a Kilo platformján. A vállalat úgy látja, hogy a mesterséges intelligencia élmezőnyét egyre kevésbé egyetlen modell, mérőszám vagy cég határozza meg.
Az új rendszerek a hosszú, több lépésből álló programozási feladatokban, az ügynöki végrehajtásban, a számítógépes használatban és a következtetésben fejlődnek. Közben egyre jobban elkülönülnek a céljaik szerint. A Kilo jellemzése alapján a Grok 4.7 a közvetlen végrehajtásra és az árra, a Claude Opus 5.5 a pontosságra, a nagy kontextusra és az önálló működésre, a GPT-6 család pedig az eltérő intelligencia-, számítási és költségszintekre helyezi a hangsúlyt.
Ez a megközelítés a „melyik a legjobb modell?” kérdést a „melyik modell a legjobb ehhez a feladathoz?” kérdéssel válthatja fel. A Kilo szerint a fejlesztők valójában nem tokeneket vásárolnak, hanem elkészült munkát, ezért a teljes feladat költsége fontosabb lehet a bemeneti és kimeneti tokenek önálló áránál.
Grok 4.7 és Claude Opus 5.5
A SpaceXAI Grok 4.7 2,1 ezermilliárd paraméteres architektúrára épül. A modell bemeneti ára 2 dollár, kimeneti ára 6 dollár egymillió tokenenként, és alacsonytól xhigh szintig több dinamikus következtetési szintet kínál. A Kilo tesztjei szerint nagy, több fájlból álló kontextusok kezelésében teljesít jól, és olyan ügynöki munkafolyamatoknál lehet hasznos, ahol a közvetlen, gyors végrehajtás számít.
A Kilo ugyanakkor arra is felhívja a figyelmet, hogy ismétlődő ügynöki munkafolyamatokban a tokenköltség gyorsan összeadódhat. Az elemzés szerint a Grok 4.7 nem kínálja ugyanazokat a gyorsítótárazási költségelőnyöket, mint egyes versenytársai.
Az Anthropic Claude Opus 5.5 egymillió tokenes kontextusablakot és Adaptive Thinking funkciót kapott, miközben az előző Opus-generációnál alacsonyabb áron érhető el. A modell célja a hosszú, ügynöki feladatok praktikusabbá tétele. A Kilo szerint az Anthropic egyre inkább a feladatonkénti költséget hangsúlyozza, vagyis azt, hogy mennyi emberi felügyeletre és újrapróbálkozásra van szükség a munka befejezéséhez.
A GPT-6 Sol és Luna az árakat is csökkenti
Az OpenAI GPT-6 Sol és GPT-6 Luna modellje a GPT-5.6 elődeihez képest nagyjából feleannyiba kerül. A Sol ára egymillió bemeneti tokenenként 4 dollárról 2 dollárra, kimeneti tokenenként pedig 20 dollárról 10 dollárra csökkent. A Luna bemeneti ára 0,20 dollárról 0,10 dollárra, kimeneti ára pedig 1,20 dollárról 0,50 dollárra esett.
A Kilo az Artificial Analysis adatait idézi. Ezek szerint a GPT-6 Sol Intelligence Index feladatának futtatása körülbelül 1,06 dollárba kerül, szemben a GPT-5.6 Sol 1,99 dolláros értékével. Ez nagyjából 47 százalékos csökkenés. A GPT-6 Luna esetében az érték körülbelül 0,07 dollár, míg a GPT-5.6 Lunánál 0,18 dollár volt.
A Kilo korai tesztjei alapján a GPT-6 Sol egy elkészült programozási feladatra vetítve lényegesen olcsóbbnak bizonyult a Claude Opus 5.5-nél. A vállalat jelezte, hogy a két modellcsaládot továbbra is egymás ellenőrzésére is használja, különösen kódellenőrzéseknél. Az elemzés szerint az új Opus futtatása az Opus 5-nél körülbelül 40 százalékkal olcsóbb.
A felhasználóknak a feladat teljes költsége számít
A Kilo szerint az ügynöki programozásban a tokenár, a kontextus, az újrapróbálkozások, az eszközhívások, a válasz hossza és a szükséges emberi beavatkozás együtt határozza meg, mennyibe kerül egy munka elvégzése. Egy olcsóbb tokenárú modell is drágább lehet, ha több körben kell utasítani, javítani és felügyelni.
Az elemzés következtetése szerint a fejlesztők és a vállalatok számára egyre fontosabbá válik, hogy szabadon válthassanak a különböző modellek között. A Kilo ezt „modell-szabadságnak” nevezi: egyetlen rendszer helyett az adott feladathoz illeszkedő, eltérő képességű és költségű modellek használata kerül előtérbe.

