Az Ollama helyben futó döntési modelleket támogat

Az Ollama 0.35 verziója támogatja a TypeSafe Jev API-jára épülő döntési modelleket, amelyek egyetlen kérésben több, névvel ellátott kérdésre válaszolnak. A funkcióhoz három modell érhető el, helyi futtatás mellett további költség és hálózati késleltetés nélkül.
- Az Ollama 0.35 támogatja a /v1/systemone döntési API-t.
- Három modell érhető el: nimble, tev1 és tev1:0.8b.
- A helyi futtatás nem jár további költséggel, és csökkenti a hálózati késleltetést.
- A Nimble 9B átlagosan 91 ezredmásodperc alatt hozott döntést az Ollama Pac-Man-példájában.
- Az Ollama további modelleket és Apple Siliconra optimalizált gyorsítást tervez.
Egy kérésben több döntés
Az Ollama szeptember 29-i bejelentése szerint az új API a /v1/systemone végponton keresztül érhető el az Ollama 0.35 verziójától. A felhasználó szöveges állapotot küld a modellnek, amelyhez egy névvel ellátott kérdésekből álló készletet is megadhat. A modell ezután egyetlen kérésben válaszolja meg az összes kérdést.
A vállalat szerint a megoldás olyan feladatokra használható, ahol gyors döntésekre van szükség. Ilyen lehet az ügyfélszolgálati jegyek osztályozása, a modellválasztás, valamint a tartalom- és biztonsági moderáció. Az Ollama szerint a helyi futtatás miatt a kéréseknek nem kell hálózaton keresztül utazniuk.
Három modell érhető el
Az Ollama három döntési modellt tett elérhetővé:
- nimble, a Bespoke Labs által fejlesztett, nyílt forráskódú, 9 milliárd paraméteres modell;
- tev1, a Together AI kísérleti, 4 milliárd paraméteres modellje;
- tev1:0.8b, a Together AI kísérleti, 0,8 milliárd paraméteres modellje.
Az Ollama példájában a Nimble 9B egy M5 Max processzorral működő helyi környezetben átlagosan 91 ezredmásodperc alatt hozott meg egy döntést a Pac-Man-példában. A közlemény ezt elég gyorsnak tartja valós idejű játékmenethez és tartalomfeldolgozáshoz.
A bejelentés az Ollama értékelési eredményeire is hivatkozik. A Nimble és a Tev1 teljesítményét 13 nyilvános, emberi címkéket használó adathalmazon vizsgálták, amelyek összesen 3880 döntést tartalmaztak. Összehasonlításként a Bespoke Labs Jev 1.13 modelljének ugyanazokon a döntéseken közzétett futását szerepeltették.
Így próbálható ki
A használathoz először az Ollama legújabb verzióját kell letölteni vagy frissíteni, majd például a nimble modellt lehet letölteni az ollama pull nimble paranccsal. A kérések közvetlenül a helyi API-n vagy a TypeSafe hivatalos Python SDK-ján keresztül küldhetők.
Az Ollama mintakérése egy ügyfélszolgálati jegyet vizsgál, amelyben az ügyfél azt írja, hogy kétszer terhelték meg, és kéri a többletfizetés visszatérítését. A kérdések között szerepel, melyik csapat kezelje az ügyet, kifejezetten kér-e az ügyfél visszatérítést, illetve mennyire sürgős a jegy. A válaszban a modell a billing csapatot választja, a visszatérítési kérés értékét 0,997-re adja, a sürgősségi pontszámot pedig 0,815-re állítja.
Az Ollama szerint további döntési modellek is érkeznek, köztük az Ollama felhőszolgáltatásán elérhető modellek. A későbbi frissítések között az Apple Silicon chipeken futó, MLX-re épülő gyorsítás, valamint különböző döntési feladatokra specializált modellek támogatása szerepel.
Ollama: Ollama now supports Jev-style decision models


