A Microsoft olcsóbb, feladatra szabott AI-modellekkel csökkentené a költségeket

A Microsoft a nagy általános modellek helyett egyre több termékéhez feladatra és rendszerre szabott MAI-modelleket fejleszt. A vállalat szerint ezekkel jelentősen csökkenthető a tokenfelhasználás és a GPU-költség, miközben a teljesítmény megmarad vagy javul.
- A Microsoft a feladatra szabott MAI-modellekkel csökkentené az AI-rendszerek költségét.
- A MAI-Cyber-1-Flash 96 százalékot ért el a CyberGym egyik pontszámán.
- A Microsoft szerint az új megoldás az MDASH-ben feleakkora költséggel működik.
- A MAI-Image-2.5-Flash PowerPointban akár 84 százalékkal csökkenti a GPU-költséget.
- A MAI-Transcribe-1.5 58 nyelven működik a Dragon Copilotban.
A költség és a teljesítmény egyensúlyát célozza a Microsoft
Mustafa Suleyman, a Microsoft vezetője a vállalat július 29-i bejegyzésében arról írt, hogy az iparág figyelme a tokenhatékonyság felé fordul. A cél az, hogy a lehető legjobb teljesítményt érjék el egy tokenre, illetve a lehető legjobb ügyfél-eredményt egy elköltött dollárra vetítve.
A Microsoft szerint nem minden feladathoz szükséges csúcsmodell. A vállalat ezért a modelleket, az őket használó keretrendszereket és a megerősítéses tanulási környezeteket együtt hangolja. Így egy adott termékhez igazított modell megtarthatja, sőt meghaladhatja a nagy általános modellek teljesítményét, miközben jóval kevesebb tokent használ.
Ennek része a Microsoft úgynevezett MAI hill-climbing machine rendszere, amelyen a vállalat az elmúlt negyedévben dolgozott. A most bemutatott irány lényege, hogy a vállalat a teljes rendszer költség és eredmény szerinti teljesítménygörbéjén keresi a megfelelő pontot.
A MAI-Cyber-1-Flash az MDASH rendszerben debütált
A Microsoft ezen a héten kiadta a MAI-Cyber-1-Flash modellt, amelyet az MDASH keretrendszerhez optimalizált. A cég állítása szerint a modell és a rendszer együtt a CyberGym benchmark bármely összeomlását mérő pontszámán 96 százalékot ért el, ezzel megelőzte a Mythost a CyberGym ranglistáján.
A Microsoft szerint a megoldás jelenlegi, legjobb MDASH-ajánlatához képest feleakkora költséggel működik, és H100-as gyorsítókon is kiszolgálható. A modellt úgy tervezték, hogy a feladatok legfeljebb 90 százalékát hatékonyan kezelje. Így a rendszer a legnagyobb és legdrágább modelleket, például a GPT-5.4-et, a vállalat szerint a különösen nehéz problémák nagyjából 10 százalékára tarthatja fenn.
Suleyman szerint a modellfüggetlen rendszer felépítése a költségcsökkentés mellett ellenállóbbá is teszi a termékeket. A Microsoft úgy látja, hogy egy üzletnek számolnia kell azzal, hogy egy használt modell biztonsági incidens, üzleti vagy szakpolitikai eltérés, illetve geopolitikai változás miatt elérhetetlenné válhat. Ezért a keretrendszernek, a kontextusnak, a memóriának és a végrehajtható műveleteknek függetlennek kell lenniük egyetlen modellcsaládtól.
A költségcsökkentés több Microsoft-termékben már megjelent
A vállalat közlése szerint az előző negyedév óta több mint egy tucat új modellt szállított képalkotásra, hangfeldolgozásra, átírásra, kódolásra és biztonsági feladatokra. Ezek a Microsoft több széles körben használt termékét működtetik, és sok esetben 50-90 százalékkal kevesebb GPU-költséggel járnak.
- MAI-Code-1-Flash: a GitHubbal közösen készült, és a Microsoft szerint június óta fejlesztők milliói használják napi munkájuk során. VS Code-ban 10 százalékkal magasabb kódelfogadási arányt és 10 százalékkal alacsonyabb medián tokenfelhasználást ért el a GPT-5.4 Minihez és a Claude Haiku 4.5-höz képest.
- Excel: ugyanazt az ellenőrzőpontot Excelhez készült megerősítéses tanulási környezetben is betanították. A Microsoft szerint a leggyakoribb feladatokban a GPT-5.6-hoz hasonló teljesítményt nyújt, miközben A100-as vagy H100-as gyorsítókon is kiszolgálható.
- MAI-Image-2.5-Flash: a Bing Image Creator végponttól végpontig használt alapértelmezett modellje, és PowerPointban akár 84 százalékkal csökkenti a GPU-költséget a GPT-Image-2-höz képest. OneDrive-ban a kulcsfontosságú szerkesztési helyzetekben 26 százalékkal növelte a mentési arányt, tokenhatékonysága pedig akár 2,5-szer nagyobb.
- MAI-Voice-2-Flash: a Dynamics 365 Contact Centerben működik, ahol a Microsoft szerint akár 89 százalékkal csökkenti a GPU-költséget.
- MAI-Transcribe-1.5: a Dragon Copilot többnyelvű munkafolyamatát szolgálja ki 58 nyelven. A megoldást 170 000 egészségügyi szolgáltató használja, és az előző negyedévben 28 millió betegtalálkozót dolgozott fel. A Microsoft tesztjei szerint az átírási és nyelvazonosítási hibák relatív aránya 50 százalékkal csökkent.
A felhasználóknak olcsóbb és rugalmasabb AI-rendszereket ígér az irány
A Microsoft szerint a saját chipekkel való közös tervezés további előnyt hoz. A vállalat MAI-modellei a Maia 200 rendszeren 40 százalékkal jobb wattankénti teljesítményt érnek el.
Ez a megközelítés a Microsoft termékeiben a vállalat állítása szerint úgy csökkenti az infrastruktúra terheit, hogy közben fenntartható vagy javuló minőséget kínál. A modellcsere lehetősége emellett azt célozza, hogy egy termék vagy ügynöki rendszer kevésbé függjön egyetlen modellcsaládtól. A Microsoft szerint ezzel jobb minőség, alacsonyabb költség és nagyobb választási lehetőség érhető el. A vállalat ugyanakkor hangsúlyozza, hogy a fejlesztés korai szakaszban jár, és továbbra is sokat kell tanulnia.
Microsoft: Optimizing the frontier performance curve

