A Harvey bemutatta első utótréningezett, nyílt súlyú modelljét

A Harvey bemutatta a Harvey Tenet kutatási előzetesét, a vállalat első utótréningezett, nyílt súlyú modelljét. A Kimi K3 alapjaira épülő rendszert hosszú, ügynöki jellegű jogi feladatokra fejlesztették, és a cég szerint a teljesítmény, valamint a költséghatékonyság terén is ígéretes eredményeket mutat.
- A Harvey Tenet a Harvey első utótréningezett, nyílt súlyú modellje.
- A modell a Kimi K3 alapjaira épül, és hosszú távú jogi feladatokra hangolták.
- A Harvey szerint a modell közel kétszer annyi LAB feladatot teljesített, mint az alap Kimi K3.
- A LAB Contracts benchmarkon 20 százalékkal több feladatot oldott meg.
- A LAB Diligence feladatain az RLM-környezet és az utótréning 60,1 százalékos kritériumteljesítést hozott.
Jogi feladatokra hangolták a Kimi K3-at
A Harvey augusztus 20-án ismertette az elmúlt hat hónap kutatási munkájának első eredményeit. A vállalat két fő célra összpontosított: nyílt súlyú modellek használatával fejlett jogi intelligencia létrehozására, valamint olyan rendszerek kialakítására, amelyekkel az ügyvédi irodák saját, specializált modelleket építhetnek és birtokolhatják az azokban létrehozott tudást.
A Harvey Tenet a Kimi K3 alapmodelljére épül. A Harvey a Fireworks kutatóival együtt utótréningezte a modellt hosszú távú jogi munkára, emellett a tréninget és a feladatvégrehajtást támogató környezeten, az úgynevezett harnessen is javított.
A tréninghez szintetikus adatokat, nyilvánosan elérhető jogi adatokat és emberi szakértők által készített adatokat kombináltak. A vállalat közlése szerint ügyféladatokat egyik utótréningezési folyamatban sem használtak.
Jelentős javulást mértek a jogi benchmarkokon
A cél a hosszú távú, ügynöki jellegű jogi feladatok megoldási képességének javítása volt. A Harvey szerint az utótréning hatására a Harvey Tenet a LAB visszatartott feladatain közel kétszer annyi feladatot teljesített sikeresen, mint az alap Kimi K3. A LAB Contracts feladatain 20 százalékkal több feladatot oldott meg.
Az összes kritériumot teljesítő feladatok aránya a LAB benchmarkon 9 százalékponttal, a LAB Contracts esetében pedig 2 százalékponttal nőtt. A vállalat szerint a javulás különösen a válaszok részletességében és a hivatkozásokban jelent meg. A Harvey Tenet a Harvey értékelése alapján a LAB Contracts benchmarkon a legjobb eredményt érte el, a LAB-on pedig második lett.
A fejlesztők más ügynöki benchmarkokon, köztük a Mercor APEX Agents Corporate Law feladatain és a Crosby Redline Benchen is jelentős előrelépést mértek a Kimi K3 alapmodellhez képest. A Harvey kiemelte, hogy a modellt ezekkel a benchmarkokkal nem tanították, ezért az eredményeket a megtanult viselkedések több értékelési környezetre való átvihetőségének jeleként értelmezi.
A jogi tudást mérő teszteken is erős teljesítményt tartott fenn. Ide sorolták a Mercor APEX v1 és a Scale Professional Reasoning Benchmark jogi paraméteres következtetési feladatait, valamint a LegalBench, a CUAD és a MAUD jogi tudásbenchmarkokat. A Harvey szerint az ügynöki képességek javítása nem rontotta a modell tankönyvi jogi fogalmakhoz kapcsolódó szélesebb körű ismereteit.
A tréning során a költségekre is figyeltek
A Harvey Tenet fejlesztésénél a teljesítmény mellett a költséghatékonyságot is optimalizálták. A vállalat szerint a nyílt súlyú modellek eleve alacsonyabb tokenenkénti árat tesznek lehetővé, de a költséget az is meghatározza, hogy a modell hány tokent használ fel.
Az utótréning során jutalmazták a hatékony eszközhasználatot és következtetést. Azokat a működési folyamatokat részesítették előnyben, amelyek azonos teljesítmény mellett kevesebb tokent fogyasztottak a futtatáskor. A Harvey közlése szerint ezzel egyszerre tudtak teljesítménynövekedést elérni és stabilan tartani a költséget.
A tréninget aszinkron megerősítéses tanulással végezték valósághű jogi munkakörnyezetekben, a Fireworks közreműködésével. Az ügynök egy partner által megfogalmazott feladatot, egy ügyhöz tartozó dokumentumokat és anyagokat, valamint a jó minőségű munka kötelező tartalmi elemeit rögzítő szakértői értékelési szempontokat kapott. A munkát elkülönített munkaterületen, keresési, dokumentumolvasási és szövegalkotási eszközökkel végezte.
Külön képességeket is fejlesztenek
A Harvey a modell alapvető jogi feladatvégzése mellett olyan képességeket is vizsgál, amelyek egy hagyományos ügynöki környezetben nem feltétlenül érhetők el. Ezeket külön tréningezett eszközökként és alügynökökként lehet a modell rendelkezésére bocsátani.
Az egyik terület az egyesülési és felvásárlási átvilágítás. A LAB Diligence egyetlen feladata akár 80 millió tokennyi dokumentumkörnyezet feldolgozását is megkövetelheti. A Harvey szerint az alapmodellek és a kész kódoló ügynökök ezen a területen nehezen teljesítenek, és egyik kiinduló modell sem teljesítette a rubrikában szereplő kritériumok több mint 43,8 százalékát.
A Baseten kutatóival együtt a Harvey Recursive Language Models, vagyis rekurzív nyelvi modellek használatával bővítette az ügynöki környezetet. Ebben a gyökérügynök programozható környezetben kezeli az adatbázist, kereshet és feldarabolhatja az anyagokat, valamint saját kontextusablakkal rendelkező alügynökökre bízhat kutatási és elemzési feladatokat.
A Harvey szerint a GLM-5.2 modell RLM-környezetbe helyezése önmagában 46,1 százalékra emelte a teljesített kritériumok arányát. A magas lefedettségű munkafolyamatok alapján végzett ön-desztillációs utótréning ezt 60,1 százalékra javította. A vállalat szerint a növekedés fő oka az volt, hogy a modell megtanulta jobban delegálni az adatbázis átvizsgálását.
A Harvey Tenet egyelőre kutatási előzetes. A bemutatott eredmények alapján a vállalat a jövőben további, külön tréningezett képességeket szeretne beépíteni a Harvey termékbe, miközben részletesebb technikai beszámolókat is ígér.
Harvey: Harvey Tenet Research Preview


