Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Jina-OCR-v1: olcsó GPU-kra optimalizált dokumentumfeldolgozó modell

2026. szeptember 14.Forrás: Jina AI
Jina-OCR-v1: olcsó GPU-kra optimalizált dokumentumfeldolgozó modell
Kép: Jina AI

A Jina AI bemutatta a Jina-OCR-v1 nevű dokumentumfeldolgozó modelljét, amelyet alacsony költségű GPU-kra terveztek. A 3,4 milliárd paraméteres rendszer Markdown-kimenetet készít, és a vállalat mérése szerint NVIDIA L4 GPU-n közel kétszeresére gyorsítja a dekódolást.

A lényeg röviden
  • A Jina-OCR-v1 3,4 milliárd paraméteres dokumentumfeldolgozó modell.
  • Tokenenként körülbelül 570 millió dekóderparaméter aktív.
  • Az OmniDocBench v1.6 teszten 91,14, az olmOCR-Benchen 83,4 pontot ért el.
  • A vállalat mérése szerint a modell 2,57 oldalt dolgozott fel másodpercenként.
  • NVIDIA L4 GPU-n a FastMTP közel kétszeres dekódolási sebességet biztosított.

Tömörített látás és spekulatív dekódolás

A Jina-OCR-v1 egy végponttól végpontig működő dokumentumfeldolgozó modell. A Jina AI szerint a rendszer a DeepSeek-OCR tömörített látási kódolójára és 3 milliárd paraméteres, szakértőkeverékes dekóderére épül. Tokenenként körülbelül 570 millió dekóderparaméter aktív.

A modellhez a vállalat FastMTP nevű spekulatív dekódolófejet adott. Ez egyetlen, közösen használt sűrű blokkot alkalmaz ismételten három előrejelzési lépésben. A dekóder minden javaslatot mohó ellenőrzéssel vizsgál meg, így a Jina AI állítása szerint a spekulatív működés nem változtatja meg a kimenetet, csak annak elkészítési idejét.

A dokumentumok feldolgozásakor a modell Markdown-formátumot állít elő, a táblázatokat HTML-ként, a képleteket pedig LaTeX-ként jeleníti meg.

Benchmarkok és feldolgozási sebesség

A Jina AI közlése szerint a Jina-OCR-v1 az OmniDocBench v1.6 teszten 91,14 pontot, az olmOCR-Bench mérésén pedig 83,4 pontot ért el. A vállalat tizennégy rendszer összehasonlításában másodpercenként 2,57 oldalas teljesítményt mért, ami ebben az összeállításban a legmagasabb oldalankénti áteresztőképesség volt.

Az olmOCR-Bench egyik összevetésében a modell 2792 kimeneti tokent dolgozott fel másodpercenként, miközben egy oldalra átlagosan 1085 token jutott. Összehasonlításként a Surya OCR 2 másodpercenként 3760 tokent ért el, de oldalanként 3568 tokent állított elő, így a mért oldalankénti sebessége 1,05 oldal volt.

Az OmniDocBench v1.6 eredménye alapján a Jina-OCR-v1 megelőzte a DeepSeek-OCR-2-t minden felsorolt oszlopban. A Jina AI azt is közölte, hogy a modell 570 millió aktív paraméter mellett a jóval nagyobb, 235 milliárd paraméteres Qwen3-VL-235B-nél is magasabb összpontszámot ért el ezen a mérésen. A 83,4 pontos olmOCR-Bench-eredmény 7,4 ponttal haladta meg a modell alapjául szolgáló DeepSeek-OCR értékét.

Speciális tanítás dokumentumokhoz

A tanítás során nyilvános OCR-adatkészleteket használtak, köztük az olmOCR-mix, FinePDFs, LightOnOCR, MMTab és UniMER gyűjteményeket. A nehezebb példák között szerepeltek az Europeana újságai, a Library of Congress átiratai és a NARA nyugdíjügyi iratai.

A Jina AI célzottan szintetikus oldalakat is készített, mivel a természetes dokumentumoknak csak kis részén található olyan képlet vagy táblázat, amelyhez szerkezeti jutalmazás kapcsolható. A JinaOCRSynth minden oldalhoz értékelhető képleteket és táblázatokat csomagol, valamint egységteszteket is tartalmaz.

Az utólagos tanítás része volt az utasításkövetés összehangolása, a sérült vagy gyenge minőségű oldalakon végzett robusztussági finomhangolás, valamint a GRPO. A jutalmazás determinisztikus ellenőrzéseket használ a szöveghűség, a képletek, a táblázatok és a dokumentum szerkezete alapján. A modell nyilvánosan elérhető a Hugging Face-en, a Jina AI közleménye 2026. szeptember 14-én jelent meg.

Mit jelent ez a felhasználóknak?

A Jina-OCR-v1 azoknak lehet érdekes, akik dokumentumokat szeretnének feldolgozni korlátozott GPU-erőforrás mellett. A modell célja, hogy a képekből, táblázatokból és képletekből szerkezetileg használható Markdown-kimenetet készítsen, miközben a FastMTP csökkenti az autoregresszív dekódolás költségét.

A Jina AI mérései szerint az NVIDIA L4 kategóriájú GPU-n a FastMTP közel megduplázta a dekódolás sebességét a mohó autoregresszív dekódoláshoz képest. A modell nyíltan elérhető a jinaai/jina-ocr-v1 néven a Hugging Face platformon.

Kapcsolódó hírek

Az Aleph Alpha bemutatta a Kolibri nevű, nyílt súlyú AI-modellt
Modellek2026. október 3.

Az Aleph Alpha bemutatta a Kolibri nevű, nyílt súlyú AI-modellt

Az Aleph Alpha bemutatta a Kolibrit, egy német és angol nyelvre fejlesztett, nyílt súlyú Mixture-of-Experts modellt. A 78 milliárd teljes és 3 milliárd aktív…

Az Allen Institute nyílt forrásúvá tette az AstaBrief modellt
Modellek2026. október 2. 17:19

Az Allen Institute nyílt forrásúvá tette az AstaBrief modellt

Nyílt forrású modellként jelent meg a Hugging Face-en az AstaBrief, amelyet az Asta gyors jelentéskészítő modelljeként mutatnak be. A bejelentéshez a teljes képzési…

Modellek
Modellek2026. augusztus 3.

Jina AI: kisebb és gyorsabb reranker érkezett listwise kereséshez

A Jina AI kiadta a jina-reranker-v3.5 modellt, egy 0,6 milliárd paraméteres listwise rerankert, amely a vállalati keresésben gyakori, félig strukturált adatokon is…