A tokenköltséget nem mindig az olcsóbb modell csökkenti

Az AI-modellek tokenenkénti ára önmagában félrevezető lehet. A Writer szerint a teljes feladatköltséget gyakran inkább az dönti el, milyen hatékonyan működik a modell köré épített rendszer, vagyis a harness.
- A Snowflake tesztjében a frontier modell nagyjából 52 000 dollárba, a kisebb modell 900 dollárba került.
- A Databricks szerint az olcsóbb modell teljes feladatonkénti költsége magasabb is lehet.
- A tokenköltséget a modell köré épített harness is jelentősen befolyásolja.
- A Writer tesztjében a tokenhatékony harness több mint 40 százalékkal csökkentette az időt és a költséget.
- Az útválasztás mellett memóriára, márkakontrollra és irányításra is szükség van.
Az olcsó és a drága modell között nagy lehet a különbség
A Writer augusztus 31-én megjelent elemzése két, első látásra ellentétes vállalati kísérletet hasonlít össze. A Snowflake júniusban ismertetett egy belső tesztet, amelyben egymillió adatsoron kellett ugyanazt a műveletet elvégezni. A frontier modell és egy kisebb, olcsó, nyílt súlyú modell hasonló eredményt produkált, a drágább modell használata azonban nagyjából 52 000 dollárba került, szemben a 900 dolláros költséggel.
A Databricks későbbi vizsgálata más képet mutatott. A vállalat saját programozási feladatait több modellen tesztelte, és a teljes feladatonkénti költséget vizsgálta. Ebben a példában az Anthropic olcsóbb Sonnet 5 modellje többe került, mint a drágább Opus 4.8, miközben gyengébb minőségű eredményt adott. A Writer magyarázata szerint az olcsóbb modell több sikertelen próbálkozással és újrapróbálással érhette el a célt.
A tokenár csak a költség egyik része
A szolgáltatók tokenek alapján számláznak, a Writer szerint nagyjából egy token felel meg egy szónak. A felhasználók azonban nem tokeneket vásárolnak, hanem kész feladatokat szeretnének elvégeztetni. Ezért a tényleges kiadás attól is függ, hány token fogy el a cél eléréséig.
A vállalat ezt egy motor és egy autó különbségével szemlélteti. A modell képességei a motor teljesítményéhez hasonlíthatók, a valós költséget viszont az egész jármű működése határozza meg. Egyszerű feladatnál egy kisebb modell is elegendő lehet, így a magasabb tokenárú modell felesleges kiadást jelenthet. Összetett feladatnál ugyanakkor a gyengébb modell elakadhat, és a sok újrapróbálkozás miatt végül drágábbá válhat.
A harness kezeli a feladat végrehajtását
A Writer a modell köré épített harness alatt a promptokat, a meghívható eszközöket, a kapcsolódó adatokat és szolgáltatásokat, valamint a feldolgozás szabályait érti. Az ügynöki rendszerek egy feladat során többször is végrehajthatják ugyanazt a ciklust: lépnek egyet, eszközt hívnak, feldolgozzák az eredményt, majd szükség esetén újra próbálkoznak. Minden ilyen forduló újabb tokenköltséggel jár.
A Databricks vizsgálatában azonos minőség mellett több mint kétszeres költségkülönbség adódott attól függően, milyen harness futtatta ugyanazt a modellt. A Writer mérnöki csapata hat modellt és 22 feladatot tesztelt, és azt találta, hogy a tokenhatékonyságra hangolt harness több mint 40 százalékkal csökkentette az időt és a költséget. A vállalat ezt harness leverage-nek nevezi, és állítása szerint a megtakarítás a nagyobb képességű modelleknél is érvényesül.
A modellválasztás mellett irányításra is szükség van
A vállalatok különböző modellekhez irányíthatják az egyes feladatokat. A Writer szerint az OpenRouter ilyen átjárót épített, amely több mint 400 modellhez, 80 szolgáltatón keresztül biztosít hozzáférést, és a munkák optimalizálását is elvégzi. A forrás szerint az OpenRoutert a Stripe több mint 7 milliárd dollárért vásárolta fel.
A Writer ugyanakkor hangsúlyozza, hogy az útválasztás önmagában nem oldja meg a memóriával, a kontextussal, a márkahanggal és az irányítással kapcsolatos kérdéseket. A marketing- és bevételi vezetők számára ezért a cél az lehet, hogy minden feladathoz a sebesség, a költség és a minőség megfelelő arányát biztosító rendszert építsenek. A Writer szerint ebben a környezetben a modell köré épített harness közvetlenül befolyásolja, mennyire hatékonyan használható fel az AI-ra szánt keret.


