A Harvey Tenet modellje közel kétszer több jogi feladatot teljesített

A Harvey és a Fireworks AI bemutatta a Tenet nevű modellt, amelyet Kimi K3 alapmodellből, aszinkron megerősítéses tanulással fejlesztettek hosszú, összetett jogi feladatokra. A modell a Legal Agent Benchmark tesztjein közel kétszer annyi feladatot teljesített, mint az alapmodell, miközben a feladatonkénti költség csak kis mértékben nőtt.
- A Tenet a Harvey és a Fireworks AI együttműködésében, Kimi K3 alapokon készült.
- A modell 19,7 százalékos LAB all-pass eredményt ért el a Kimi K3 10,8 százalékával szemben.
- A Tenet a fejlesztésben nem látott agentikus teszteken is javított.
- A LAB-feladatonkénti költség 5,92 dollár volt, szemben a Kimi K3 5,62 dollárjával.
- A részletes technikai beszámoló később érkezik.
A Tenetet hosszú jogi munkafolyamatokra tanították
A Harvey a Fireworks AI-jal együttműködésben készítette el első modelljét, a Tenetet. A fejlesztés alapja a Kimi K3 volt, a modellt pedig a Fireworks Training API-ján, aszinkron megerősítéses tanulással képezték tovább.
A cél a hosszú időhorizontú jogi munka támogatása volt. A Legal Agent Benchmark, röviden LAB, olyan elkülönített munkakörnyezetekbe helyezi az ügynököket, ahol valódi jogi dokumentumokkal és eszközökkel dolgoznak. A feladatok között jogi feljegyzések, szerződésmódosítások és átvilágítási összefoglalók elkészítése szerepel.
A kész anyagokat egy nyelvi modellből álló értékelő vizsgálja, több tucat konkrét szempont alapján. A LAB az úgynevezett all-pass mutatót használja, amely azt méri, hogy a feladatok mekkora része felel meg minden követelménynek. Egyetlen hiányzó szempont is elég ahhoz, hogy egy teljesítmény ne számítson sikeresnek.
A teszteken javult a teljesítmény, és a fejlődés más feladatokra is átkerült
A Fireworks AI adatai szerint a Tenet 19,7 százalékos all-pass eredményt ért el a LAB teszten, szemben a Kimi K3 10,8 százalékával. A LAB Contracts részteszten a Tenet 11,3 százalékot, az alapmodell 9,3 százalékot ért el. A vállalat szerint ez 9, illetve 2 százalékpontos javulást jelent, és a Tenet közel kétszer annyi, a fejlesztés során nem látott LAB-feladatot teljesített.
A javulás olyan feltételekre is kiterjedt, amelyek nem szerepeltek a tanításban. A Mercor Apex Agents, Corporate Law tesztjén a Tenet eredménye 58,8 százalékról 74,0 százalékra nőtt a Kimi K3-hoz képest. A Crosby Redline Bench teszten 49,3 százalékról 55,5 százalékra javult. A Redline Bench ráadásul eltérő tesztelési környezetben futott.
A jogi tudást és a paraméteres következtetést mérő LegalBench, CUAD, MAUD és Mercor Apex-v1 teszteken a Tenet megtartotta az alapmodell teljesítményét. A Fireworks közlése szerint az ügynökös képességek javítása így nem járt a jogi ismeretek számottevő romlásával.
A költség közel változatlan maradt
A Tenet egy LAB-feladat lefuttatása esetén 5,92 dollárba került, míg a Kimi K3 esetében ez az érték 5,62 dollár volt. A Fireworks ezt gyakorlatilag változatlan költségszintként írja le, miközben a Tenet csaknem kétszer annyi feladatot teljesített.
A vállalat szerint ebben az open-weight modellek tokenenkénti árazása és az alkalmazott jutalmazási kialakítás játszott szerepet. A fejlesztéshez tízezres nagyságrendben futtattak hosszú munkameneteket minden ellenőrzési pontnál. Ezek a futások több mint 50 fordulón és 100 000 generált tokenen is áthaladtak egy élő, elkülönített munkakörnyezetben.
A Fireworks közös tanítási és kiszolgálási infrastruktúrát használ. A cég szerint így a modell tanítás és használat közben azonos numerikus működést kap, ami segít alacsonyan tartani a két folyamat közötti eltérést. A kérések eredménye a vállalat leírása alapján attól függetlenül azonos marad, hogy mi kerül ugyanabba a kötegbe.
A Tenet bemutatása egy későbbi, részletes technikai beszámoló bevezetése. A Harvey és a Fireworks AI azt tervezi, hogy külön ismerteti a jutalmazás kialakítását, az aszinkron megerősítéses tanulási rendszert és a hosszú futások tapasztalatait. A felhasználók számára a mostani eredmények azt mutatják, hogy a Kimi K3-ra épített modell hosszabb jogi munkafolyamatokban is használható, a közölt teszteken magasabb teljesítménnyel és csaknem változatlan feladatonkénti költséggel.
Fireworks AI: Post-training Kimi K3 with Harvey for long-horizon legal work


