Az Elastic új OCR-modellt, fejlesztői CLI-t és AI-indexeket mutatott be

Az Elastic szeptemberi DevRel-hírlevele több fejlesztői és mesterségesintelligencia-eszköz újdonságát mutatja be. A jina-ocr-v1 dokumentumfeldolgozó modellként, az Elastic CLI egységes parancssori felületként, az AI-indexek pedig a tudásindikátorok tárolójaként váltak elérhetővé.
- A jina-ocr-v1 több mint 100 nyelven dolgoz fel strukturált dokumentumokat.
- Az Elastic CLI egy felületen kezeli az Elasticsearch, Kibana és Elastic Cloud API-kat.
- Az Agent Skills mostantól az Elastic CLI-t használják a műveletek végrehajtásához.
- A tudásindikátorokra épülő teszt 93 százalékkal kevesebb tokent használt.
- A jina-ocr-v1 az OmniDocBench teszten 91,14 pontot ért el.
A jina-ocr-v1 szerkezetet is értelmez
Az Elastic szeptember 25-én közzétett hírlevele szerint a jina-ocr-v1 már használható az Elastic Inference Service-ben, emellett helyben vagy saját infrastruktúrán is futtatható. A modell szkennelt oldalakat, dokumentumfotókat, prezentációs diákat és kézzel írt jegyzeteket dolgoz fel, majd egyetlen lépésben strukturált Markdown-kimenetet készít.
A hagyományos optikai karakterfelismeréstől eltérően a modell először az oldal elrendezését értelmezi, így a többhasábos oldalak, oldalsávok és vegyes tartalmú dokumentumok feldolgozásakor is az emberi olvasási sorrendet követi. A táblázatokat HTML-ként, a matematikai képleteket LaTeX formátumban adja vissza. A beágyazott képekben, például könyvborítókon és logókon található szöveget felismeri, de kihagyja a kimenetből.
A modell összesen 3,4 milliárd paramétert tartalmaz, a kevert szakértői felépítés miatt azonban következtetéskor 570 millió aktív paramétert használ. Az Elastic közlése szerint az olmOCR-bench teszten 83,4 pontot ért el, ami a 600 milliónál kevesebb aktív paramétert használó modellek között a legmagasabb eredmény. Az OmniDocBench teszten 91,14 pontot kapott, szemben a GPT-5.2 86,59 pontjával. A nyelvi támogatás több mint 100 nyelvre terjed ki, a vegyes nyelvű oldalak feldolgozásához pedig nincs szükség külön beállításra.
Egységes parancssori felület az Elastic API-khoz
Az Elastic CLI technikai előzetesként jelent meg, és egyetlen belépési pontot kínál a nyilvános Elasticsearch, Kibana és Elastic Cloud API-khoz. Telepítése az npm install -g @elastic/cli paranccsal történik. A parancsok JSON-bemenetet és JSON-kimenetet támogatnak, a bemeneteket JSON Schema alapján ellenőrzik, hibánál pedig nem nulla kilépési kódot adnak.
A hitelesítési adatok az operációs rendszer kulcstartójában maradnak. Az eszköz macOS Keychain, Linux Secret Service és Windows Credential Manager használatára képes, így a kulcsok nem jelennek meg a parancssori előzményekben vagy az AI-ügynökök beszélgetéseiben. Engedélyezési és tiltási listákkal korlátozhatók a futtatható parancsok, a módosító műveletekhez pedig interaktív környezetben jóváhagyás szükséges. Nem interaktív munkamenetben az ilyen parancsok csak a --yes kapcsolóval hajthatók végre.
Az Elastic Agent Skills mostantól ezt a CLI-t használják szállítási rétegként. Ezek az eszközök többek között a Claude Code, a Cursor, a Copilot és a Gemini CLI használatát segítik Elasticsearch- és Kibana-műveletekben. Elérhetők készségek az Elastic Cloud beállításához, az Elastic Workflows használatához és Kubernetes-vizsgálatokhoz is.
Tudásindikátorokkal csökkenthető az ügynökök terhelése
Az Elastic egy olyan megközelítést is bemutatott, amelyben a rendszer előre feldolgozza a dokumentumokat. A Kibana Workflow minden dokumentumból egy Knowledge Indicatort, vagyis tudásindikátort készít. Ez tömör, a forráshoz kötött összefoglalót, címet, közérthető leírást, entitáslistát, megválaszolható kérdéseket és egy rövid jelmondatot tartalmaz.
A tudásindikátorok egy AI Indexbe kerülnek, a kérdések megválaszolásakor pedig az ügynök hibrid BM25 és szemantikus keresést futtat rajtuk ES|QL segítségével. Az Elastic által ismertetett Wikipedia-teszten egy kérdés megválaszolásához a hagyományos RAG 8 eszközhívást, 386 187 tokent és 44,86 másodpercet használt. A tudásindikátoros megoldás 2 eszközhívással, 27 625 tokennel és 15,22 másodperces késleltetéssel adott a forrással azonosan megalapozott választ.
Az Elastic szerint a módszer változtatás nélkül használható a LangChain, az Elastic Agent Builder és a Claude Code környezetében. A hírlevél felhasználói szempontból azt emeli ki, hogy az új eszközök egységesebb API-hozzáférést, strukturáltabb dokumentumfeldolgozást és kisebb kontextusterhelést kínálnak az AI-ügynököket fejlesztő csapatoknak.
Elastic: DevRel newsletter — September 2026


