Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

26-szorosára nőtt a Harvey heti dokumentumfeldolgozási volumene

2026. július 27.Forrás: Harvey
26-szorosára nőtt a Harvey heti dokumentumfeldolgozási volumene
Kép: Harvey

A Harvey egy év alatt 0,94 millióról 24,8 millióra növelte az egy teljes héten feldolgozott dokumentumok számát. A jogi mesterségesintelligencia-platform ehhez tartós munkafolyamatokat, külön skálázott feldolgozási szakaszokat és új belső dokumentumformátumot vezetett be.

A lényeg röviden
  • A heti feldolgozott dokumentumok száma 0,94 millióról 24,8 millióra nőtt.
  • A feldolgozott eredeti fájladat mennyisége 1,44 terabájtról 56 terabájtra emelkedett.
  • A Harvey különválasztotta a kinyerési, beágyazási és indexelési szakaszokat.
  • Az új Job Framework tartós állapotkezelést és fájlszintű hibaszigetelést biztosít.
  • Az UDF a Harvey mérései szerint csökkentette a kinyerési késleltetést.

Heti több tízmillió dokumentum

A Harvey közlése szerint a dokumentumfeldolgozás a Vault, az Assistant és az ügyféladatokkal dolgozó munkafolyamatok alapja. A jogi felhasználók lekérdezései egyetlen fájltól akár több száz vagy több ezer dokumentumig terjedhetnek. A rendszer szerződéseket, zárási dokumentumcsomagokat, kihallgatási jegyzőkönyveket, e-mail-archívumokat, szkennelt PDF-eket és teljes adat­tér-exportokat dolgoz fel.

A 2026. július 27-én közzétett bejegyzés szerint egy évvel korábban egy mozgalmas héten valamivel kevesebb mint egymillió dokumentumot kezeltek. A legutóbbi teljes héten 24,8 millió dokumentum és 56 terabájt eredeti fájladat feldolgozása történt, szemben az egy évvel korábbi 0,94 millió dokumentummal és 1,44 terabájttal. Ez 26-szor több dokumentumot és 39-szer több adatot jelentett. A legutóbbi teljes hét napi átlaga körülbelül 3,5 millió dokumentum volt.

A feldolgozás több különálló rendszerré vált

A növekedést a Harvey szerint az okozta, hogy az ügyfelek egyedi feltöltések helyett egyre inkább központi rendszerként használják a platformot nagy dokumentumgyűjteményekhez. A Vault mellett a csatlakozók is fontos szerepet kapnak. A vállalat az iManage, a SharePoint, a Box, a Google Drive és a NetDocuments rendszereit, valamint helyben működő telepítéseket említ.

A feldolgozási folyamat három fő szakaszból áll. Az első a fájl és a metaadatok kinyerése, amelybe a fájltípus felismerése, a szöveg és a szerkezet kinyerése, az optikai karakterfelismerés (OCR), valamint a fájltípus, a méret, az oldalszám, a forrás és az állapot rögzítése tartozik. A második szakaszban a rendszer kereshető részekre bontja a szöveget, majd beágyazásokat készít. A harmadikban a részek, a metaadatok és a beágyazások a keresési rétegbe kerülnek, hogy a Vault, az Assistant és a munkafolyamatok keresni, hivatkozni és következtetni tudjanak az ügyfél dokumentumaira.

A Harvey ezeket a szakaszokat különválasztotta, mert eltérő szűk keresztmetszetekkel működnek. A kinyerést a fájlformátum, az OCR és a konvertálás terheli, a darabolást és a beágyazást a részek száma és a beágyazási modell áteresztőképessége, az indexelést pedig a vektortároló írási kapacitása és a háttérterhelés. A vállalat szerint így egy OCR-ben gazdag feltöltés lassíthatja a kinyerési szakaszt anélkül, hogy az indexelést is leállítaná.

Tartós munkafolyamatok és új belső formátum

A korábbi rendszer egy régebbi feladatsorra épült. A növekvő és egyre több kiugrást tartalmazó terhelés mellett a dolgozók újraindulhatottak egy hosszú feladat közepén, a telepítések megszakíthatták a feldolgozást, a későbbi korlátok pedig széles körű újrapróbálkozásokat kényszeríthettek ki. A Harvey ezért a dokumentumfeldolgozást az új Job Frameworkre építette át.

A keretrendszerben a munkafolyamat állapota tartós. Ha egy dolgozó összeomlik vagy telepítés történik egy feldolgozási köteg közben, a rendszer folytatni tudja a munkát a teljes köteg újrakezdése helyett. Az egyes tevékenységekhez külön időkorlát és újrapróbálkozási szabály tartozik. A hibás, jelszóval védett, nem támogatott vagy üres fájlokat a folyamat megjelöli, majd a többi dokumentum feldolgozását folytatja.

A vállalat a Unified Document Format, röviden UDF bevezetéséről is beszámolt. A verziózott belső formátum a korábbi, egyetlen nagy dokumentumobjektum helyett típusos részekre bontja a dokumentumot. A Harvey mérései szerint az új megoldással a kinyerési késleltetés mediánja körülbelül 19, a 90. percentilis 17, a 99. percentilis pedig 11 százalékkal csökkent, a közlés szerint megfigyelt minőségromlás nélkül.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Így védi a Harvey az ügynökeit a külső eszközök használata közben
Fejlesztőknek2026. október 1.

Így védi a Harvey az ügynökeit a külső eszközök használata közben

A Harvey részletesen bemutatta Connector Library rendszerét, amely külső szolgáltatásokat, például az Outlookot, a Gmailt és az iManage-et teszi elérhetővé jogi…

Ügynöki keresést indított jogi dokumentumrendszerekhez a Harvey
Termékek és eszközök2026. szeptember 30.

Ügynöki keresést indított jogi dokumentumrendszerekhez a Harvey

A Harvey ügynöki keresési funkciót indított, amellyel a jogászok természetes nyelven írhatják le, milyen dokumentumokat keresnek az iManage, a SharePoint és a Google…

A Harvey természetes nyelvű keresést hozott a jogi dokumentumrendszerekbe
Termékek és eszközök2026. szeptember 30.

A Harvey természetes nyelvű keresést hozott a jogi dokumentumrendszerekbe

A Harvey új Agentic Search funkciója természetes nyelvű leírások alapján keres releváns dokumentumokat az iManage, a SharePoint és a Google Drive csatlakoztatott…