Döntési modelleket támogat az Ollama, három modell már elérhető

Az Ollama 0.35-ös verziójától Jev API-alapú döntési modellek futtathatók helyben, az új /v1/systemone végponton keresztül. A vállalat szerint a megoldás gyors döntéseket tesz lehetővé jegyosztályozáshoz, modellválasztáshoz és tartalommoderáláshoz.
- Az Ollama 0.35-től elérhető a Jev API-alapú /v1/systemone végpont.
- Három döntési modell használható: nimble, tev1 és tev1:0.8b.
- A Nimble 9B helyben, M5 Maxon átlagosan 91 ms alatt hozott döntést a bemutatott példában.
- A rendszer egy kérésben több, névvel ellátott kérdésre is választ ad.
- Az Ollama további modelleket és Apple Siliconhoz gyorsabb MLX-támogatást ígér.
Egy kérésben több döntés
Az Ollama szeptember 29-i bejelentése szerint az új támogatás a TypeSafe Jev API-jára épül. A felhasználó szöveges állapotot, valamint névvel ellátott kérdések halmazát küldheti el a modellnek. A modellen futó rendszer ezekre egyetlen kérésben válaszol.
Az új API az Ollama 0.35-ös verziójától érhető el a /v1/systemone végponton. A kérdések különböző döntési formákat használhatnak. A forrás példája szerint egy ügyfélszolgálati jegynél kiválasztható a felelős csapat, megbecsülhető a sürgősség, valamint számszerűsíthető, hogy az ügyfél kifejezetten visszatérítést kér-e.
Az Ollama ilyen felhasználási területként említi a jegyek osztályozását, a modellek közötti útválasztást, továbbá a tartalom- és biztonsági moderálást. A helyi futtatás miatt a kéréseknek nem kell hálózaton keresztül utazniuk, így a vállalat szerint alacsony késleltetésű döntések hozhatók.
Három modell érhető el
Az Ollama három döntési modellt tett elérhetővé. A nimble egy nyílt forráskódú, 9 milliárd paraméteres modell, amelyet a Bespoke Labs fejlesztett. A tev1 a Together AI kísérleti, 4 milliárd paraméteres modellje, míg a tev1:0.8b ugyanennek a 0,8 milliárd paraméteres kísérleti modellnek a változata.
Az Ollama példája szerint a Nimble 9B egy M5 Max processzorral szerelt gépen, helyi futtatás mellett, a Pac-Man-példában döntésenként átlagosan 91 ezredmásodperces időt ért el. A bejelentés ezt elég gyorsnak tartja valós idejű tartalomfeldolgozáshoz és játék közbeni döntésekhez.
A vállalat egy 13 nyilvános adathalmazt és emberi címkéket használó értékelést is bemutatott. Ezek összesen 3880 döntést fedtek le. Az Ollama közlése szerint a Nimble és a Tev1 értékelése az Ollamán történt, a Jev 1.13 eredménye pedig a Bespoke Labs azonos döntéseken közzétett futtatásából származik.
Így lehet kipróbálni
A használathoz először az Ollama legfrissebb verzióját kell letölteni vagy frissíteni, majd egy döntési modellt, például a Nimble-t telepíteni az ollama pull nimble paranccsal. A kérések curl segítségével vagy a TypeSafe hivatalos Python SDK-ján keresztül küldhetők el.
A bemutatott példában a modell egy kettős terhelésről szóló ügyfélszolgálati jegyet dolgoz fel. A válasz szerint a billing csapatnak kell kezelnie az ügyet, a visszatérítési kérés valószínűsége 0,997, a sürgősségi pontszám pedig 0,815. A válasz a kiválasztott kategóriákhoz valószínűségeket és bizonyossági értékeket is ad.
Az Ollama szerint további döntési modellek is érkeznek, köztük az Ollama felhőszolgáltatásában futó modellek. A jövőbeli frissítések között szerepel az Apple Silicon chipeken elérhető, MLX-re épülő gyorsabb teljesítmény, valamint a különböző döntési feladatokra specializált modellek támogatása. A bejelentés szerint a mostani kiadás az ilyen fejlesztések sorozatának első lépése.
Ollama: Ollama now supports Jev-style decision models


