A Hugging Face három multimodális open d1 modellt listázott

A Hugging Face oldalán megjelent a „Multimodal open d1 decision models for the edge” című bejegyzés, amely három, képet és szöveget kezelő modellt sorol fel. A felsorolt modellek mérete 0,6 és 3 milliárd paraméter között van.
- A Hugging Face egy multimodális open d1 modellekről szóló bejegyzést közölt.
- A felsorolásban három Image-Text-to-Text modell szerepel.
- A modellek mérete 0,4, 0,6 és 3 milliárd paraméter.
- A forrás peremhálózati használatra szánt döntési modellekként hivatkozik rájuk.
Három modell szerepel a listán
A Hugging Face oldalán elérhető bejegyzés három, az „Image-Text-to-Text” kategóriába sorolt modellt említ. A forrásban a modellek neve nem jelenik meg, a kártyákon a paraméterszám és a használati kategória látható.
A felsorolásban egy 3 milliárd paraméteres modell szerepel, amelyet 13 nappal az oldal megtekintése előtt frissítettek. Ugyanebben a listában egy 0,6 milliárd paraméteres modell is található, amelyet 4 perccel korábban frissítettek. A harmadik modell mérete 0,4 milliárd paraméter, frissítésének dátumaként július 28. szerepel.
Képeket és szöveget kezelő modellek
Az „Image-Text-to-Text” megjelölés arra utal, hogy a felsorolt rendszereket a Hugging Face képet és szöveget egyaránt kezelő modellek között jeleníti meg. A bejegyzés címe az open d1 modelleket multimodális, vagyis többféle adattípust használó döntési modellekként, valamint peremhálózati használatra szánt rendszerekként nevezi meg.
A forrásrészlet nem közöl részletes technikai leírást a modellek működéséről, betanításáról, licencéről vagy teljesítményéről. Azt sem részletezi, hogy az egyes modellek milyen konkrét eszközökön futtathatók. A biztosan megállapítható információ a kategória, a paraméterszám és a Hugging Face-en feltüntetett frissítési idő.
A Hugging Face oldalán látható aktivitás
A modellkártyák mellett a Hugging Face használati mutatókat is megjelenít. A 0,4 milliárd paraméteres modellnél 33,1 ezer megtekintés és 149 érték szerepel, a 3 milliárd paraméteres modellnél 25,4 ezer megtekintés és 218 érték látható. A 0,6 milliárd paraméteres modell kártyája 28 megtekintést és 2 értéket mutat.
Az oldalon további, ugyanahhoz a szerzőhöz kapcsolódó bejegyzések is megjelennek. Ezek között szerepel egy, a „LFM2.5-VL-DSpark” vision-language modellekről szóló, szeptember 24-i bejegyzés, valamint egy „LFM2.5-DSpark” inferenciagyorsításról szóló, augusztus 20-i anyag. A megadott forrás nem állít közvetlen kapcsolatot e bejegyzések és a három felsorolt modell között.
Hugging Face: Multimodal open d1 decision models for the edge


