Az Aleph Alpha bemutatta a Kolibri nevű, nyílt súlyú AI-modellt

Az Aleph Alpha bemutatta a Kolibrit, egy német és angol nyelvre fejlesztett, nyílt súlyú Mixture-of-Experts modellt. A 78 milliárd teljes és 3 milliárd aktív paraméterrel működő rendszer akár 1 millió tokenes kontextust is kezel.
- A Kolibri 78 milliárd teljes és 3 milliárd aktív paraméterrel rendelkezik.
- A modell akár 1 millió tokenes kontextust támogat.
- Teljes súlyai letölthetők a Hugging Face-ről Apache 2.0 licenc alatt.
- A Kolibrit német és angol nyelvre, valamint szabályozott iparági feladatokra optimalizálták.
- Az Aleph Alpha szerint a modellt Németországban és Finnországban, európai és német jogi környezetben tanították.
Német és angol nyelvre készült
Az Aleph Alpha október 3-án, a német újraegyesítés napján tette közzé a Kolibrit. A modell teljes súlyai letölthetők a Hugging Face-ről, használata pedig az Apache 2.0 licenc feltételei szerint lehetséges.
A Kolibri egy angol és német nyelvű Mixture-of-Experts Transformer. A teljes modell 78 milliárd paraméterből áll, ezek közül egy válasz létrehozásakor 3 milliárd aktív. A rendszer legfeljebb 1 millió token hosszúságú kontextust támogat.
A fejlesztő szerint a modellt eleve kétnyelvűnek tervezték. A tanítás során használt előtanítási tokenek 21,3 százaléka német volt, a fordítás aránya pedig összesen 6 százalékot tett ki. Az Aleph Alpha ehhez kétnyelvű német és angol tokenizálót is fejlesztett.
Iparági és közigazgatási felhasználásra szánják
Az Aleph Alpha a Kolibrit szabályozott, kritikus fontosságú területekre szánt speciális nyelvi modellként mutatja be. A célterületek között a közigazgatás, az ipar és a repülőgépipar szerepel. A modellnél külön figyelmet fordítottak a német nyelvre, a következtetésre, a matematikára és az ügynöki működésre.
A vállalat saját, belső ügyfél-proxy értékeléseket is készített a német közszféra, a repülés, a gyártás és az autóipar igényeire. Ezeken a teszteken a Kolibri teljesítménye az autóipari beszállítói feladatoknál 0,72-ről 0,99-re, a félvezetőipari feladatoknál 0,35-ről 0,80-ra, a német közszféra feladatainál pedig 0,54-ről 0,75-re emelkedett az egymást követő utólagos tanítási futások során. Az ipari hajtástechnikai értékelés 0,31-ről 0,60-ra, a repülőgépipari pedig 0,14-ről 0,59-re javult.
A modellt olyan adatokkal is tanították, amelyek az elutasító válaszokat támogatják. A Merlin-Arthur protokoll segítségével a Kolibri a vállalat szerint képes azt mondani, hogy „nem tudom”, ha a válasz nem szerepel a rendelkezésére álló kontextusban.
Teljes fejlesztési folyamatot és helyi üzemeltetést ígérnek
Az Aleph Alpha a szuverenitást két tényezőhöz köti: ahhoz, hogyan építették fel a modellt, és ahhoz, milyen szabadságot kapnak az ügyfelek a használatában. A vállalat közlése szerint a teljes ellátási láncot ellenőrizte, az adatbeviteltől és az adatok válogatásától kezdve az elő- és utólagos tanításon át a végső értékelésekig.
A fejlesztő szerint a Kolibrit Németországban építették, németországi és finnországi infrastruktúrán tanították, európai és német jog alapján, külföldi irányítás nélkül. A modell súlyairól és a tanítási adatok válogatásáról is átláthatóságot ígérnek. A Kolibri teljes súlyú, nyílt kiadása lehetővé teszi a vállalatok számára a saját üzemeltetést, így a belső adatokat nem kell harmadik fél következtetési szolgáltatásába küldeni.
A fejlesztési folyamatot kódba foglalt tanítási csővezetékkel működtették. Ennek korábbi eredménye volt a Kolibri Origin, amely 30 milliárd teljes és 3 milliárd aktív paraméterrel, valamint 65 ezer tokenes kontextusablakkal rendelkezett. A Kolibri előtanítása szeptember 11-én fejeződött be, három hónappal a Kolibri Origin június 11-i befejezése után. Ez idő alatt a tanítási tokenek mennyisége 7,5 billióról 20 billióra, a kontextusablak pedig 65 ezerről akár 1 millió tokenre nőtt.
Az Aleph Alpha szerint a Kolibri kisebb aktív mérete a teljesítmény és az üzemeltetési költség közötti egyensúlyt javítja, miközben a modell helyben is futtatható. Ez a vállalat célcsoportjában, a szabályozott területeken működő szervezeteknél a telepítés feletti kontrollt és az AI-használat gazdasági hatásának mérhetőségét szolgálhatja.
Aleph Alpha: Kolibri Has Landed: A Sovereign Open-Weight Model — Aleph Alpha


