Jina-OCR-v1: olcsó GPU-kra optimalizált dokumentumfeldolgozó modell

A Jina AI bemutatta a Jina-OCR-v1 nevű dokumentumfeldolgozó modelljét, amelyet alacsony költségű GPU-kra terveztek. A 3,4 milliárd paraméteres rendszer Markdown-kimenetet készít, és a vállalat mérése szerint NVIDIA L4 GPU-n közel kétszeresére gyorsítja a dekódolást.
- A Jina-OCR-v1 3,4 milliárd paraméteres dokumentumfeldolgozó modell.
- Tokenenként körülbelül 570 millió dekóderparaméter aktív.
- Az OmniDocBench v1.6 teszten 91,14, az olmOCR-Benchen 83,4 pontot ért el.
- A vállalat mérése szerint a modell 2,57 oldalt dolgozott fel másodpercenként.
- NVIDIA L4 GPU-n a FastMTP közel kétszeres dekódolási sebességet biztosított.
Tömörített látás és spekulatív dekódolás
A Jina-OCR-v1 egy végponttól végpontig működő dokumentumfeldolgozó modell. A Jina AI szerint a rendszer a DeepSeek-OCR tömörített látási kódolójára és 3 milliárd paraméteres, szakértőkeverékes dekóderére épül. Tokenenként körülbelül 570 millió dekóderparaméter aktív.
A modellhez a vállalat FastMTP nevű spekulatív dekódolófejet adott. Ez egyetlen, közösen használt sűrű blokkot alkalmaz ismételten három előrejelzési lépésben. A dekóder minden javaslatot mohó ellenőrzéssel vizsgál meg, így a Jina AI állítása szerint a spekulatív működés nem változtatja meg a kimenetet, csak annak elkészítési idejét.
A dokumentumok feldolgozásakor a modell Markdown-formátumot állít elő, a táblázatokat HTML-ként, a képleteket pedig LaTeX-ként jeleníti meg.
Benchmarkok és feldolgozási sebesség
A Jina AI közlése szerint a Jina-OCR-v1 az OmniDocBench v1.6 teszten 91,14 pontot, az olmOCR-Bench mérésén pedig 83,4 pontot ért el. A vállalat tizennégy rendszer összehasonlításában másodpercenként 2,57 oldalas teljesítményt mért, ami ebben az összeállításban a legmagasabb oldalankénti áteresztőképesség volt.
Az olmOCR-Bench egyik összevetésében a modell 2792 kimeneti tokent dolgozott fel másodpercenként, miközben egy oldalra átlagosan 1085 token jutott. Összehasonlításként a Surya OCR 2 másodpercenként 3760 tokent ért el, de oldalanként 3568 tokent állított elő, így a mért oldalankénti sebessége 1,05 oldal volt.
Az OmniDocBench v1.6 eredménye alapján a Jina-OCR-v1 megelőzte a DeepSeek-OCR-2-t minden felsorolt oszlopban. A Jina AI azt is közölte, hogy a modell 570 millió aktív paraméter mellett a jóval nagyobb, 235 milliárd paraméteres Qwen3-VL-235B-nél is magasabb összpontszámot ért el ezen a mérésen. A 83,4 pontos olmOCR-Bench-eredmény 7,4 ponttal haladta meg a modell alapjául szolgáló DeepSeek-OCR értékét.
Speciális tanítás dokumentumokhoz
A tanítás során nyilvános OCR-adatkészleteket használtak, köztük az olmOCR-mix, FinePDFs, LightOnOCR, MMTab és UniMER gyűjteményeket. A nehezebb példák között szerepeltek az Europeana újságai, a Library of Congress átiratai és a NARA nyugdíjügyi iratai.
A Jina AI célzottan szintetikus oldalakat is készített, mivel a természetes dokumentumoknak csak kis részén található olyan képlet vagy táblázat, amelyhez szerkezeti jutalmazás kapcsolható. A JinaOCRSynth minden oldalhoz értékelhető képleteket és táblázatokat csomagol, valamint egységteszteket is tartalmaz.
Az utólagos tanítás része volt az utasításkövetés összehangolása, a sérült vagy gyenge minőségű oldalakon végzett robusztussági finomhangolás, valamint a GRPO. A jutalmazás determinisztikus ellenőrzéseket használ a szöveghűség, a képletek, a táblázatok és a dokumentum szerkezete alapján. A modell nyilvánosan elérhető a Hugging Face-en, a Jina AI közleménye 2026. szeptember 14-én jelent meg.
Mit jelent ez a felhasználóknak?
A Jina-OCR-v1 azoknak lehet érdekes, akik dokumentumokat szeretnének feldolgozni korlátozott GPU-erőforrás mellett. A modell célja, hogy a képekből, táblázatokból és képletekből szerkezetileg használható Markdown-kimenetet készítsen, miközben a FastMTP csökkenti az autoregresszív dekódolás költségét.
A Jina AI mérései szerint az NVIDIA L4 kategóriájú GPU-n a FastMTP közel megduplázta a dekódolás sebességét a mohó autoregresszív dekódoláshoz képest. A modell nyíltan elérhető a jinaai/jina-ocr-v1 néven a Hugging Face platformon.
Jina AI: jina-ocr-v1: Faster Document Parsing on Low-Budget GPUs

