Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Harvey Tenet modellje közel kétszer több jogi feladatot teljesített

2026. augusztus 26.Forrás: Fireworks AI
A Harvey Tenet modellje közel kétszer több jogi feladatot teljesített
Kép: Fireworks AI

A Harvey és a Fireworks AI bemutatta a Tenet nevű modellt, amelyet Kimi K3 alapmodellből, aszinkron megerősítéses tanulással fejlesztettek hosszú, összetett jogi feladatokra. A modell a Legal Agent Benchmark tesztjein közel kétszer annyi feladatot teljesített, mint az alapmodell, miközben a feladatonkénti költség csak kis mértékben nőtt.

A lényeg röviden
  • A Tenet a Harvey és a Fireworks AI együttműködésében, Kimi K3 alapokon készült.
  • A modell 19,7 százalékos LAB all-pass eredményt ért el a Kimi K3 10,8 százalékával szemben.
  • A Tenet a fejlesztésben nem látott agentikus teszteken is javított.
  • A LAB-feladatonkénti költség 5,92 dollár volt, szemben a Kimi K3 5,62 dollárjával.
  • A részletes technikai beszámoló később érkezik.

A Tenetet hosszú jogi munkafolyamatokra tanították

A Harvey a Fireworks AI-jal együttműködésben készítette el első modelljét, a Tenetet. A fejlesztés alapja a Kimi K3 volt, a modellt pedig a Fireworks Training API-ján, aszinkron megerősítéses tanulással képezték tovább.

A cél a hosszú időhorizontú jogi munka támogatása volt. A Legal Agent Benchmark, röviden LAB, olyan elkülönített munkakörnyezetekbe helyezi az ügynököket, ahol valódi jogi dokumentumokkal és eszközökkel dolgoznak. A feladatok között jogi feljegyzések, szerződésmódosítások és átvilágítási összefoglalók elkészítése szerepel.

A kész anyagokat egy nyelvi modellből álló értékelő vizsgálja, több tucat konkrét szempont alapján. A LAB az úgynevezett all-pass mutatót használja, amely azt méri, hogy a feladatok mekkora része felel meg minden követelménynek. Egyetlen hiányzó szempont is elég ahhoz, hogy egy teljesítmény ne számítson sikeresnek.

A teszteken javult a teljesítmény, és a fejlődés más feladatokra is átkerült

A Fireworks AI adatai szerint a Tenet 19,7 százalékos all-pass eredményt ért el a LAB teszten, szemben a Kimi K3 10,8 százalékával. A LAB Contracts részteszten a Tenet 11,3 százalékot, az alapmodell 9,3 százalékot ért el. A vállalat szerint ez 9, illetve 2 százalékpontos javulást jelent, és a Tenet közel kétszer annyi, a fejlesztés során nem látott LAB-feladatot teljesített.

A javulás olyan feltételekre is kiterjedt, amelyek nem szerepeltek a tanításban. A Mercor Apex Agents, Corporate Law tesztjén a Tenet eredménye 58,8 százalékról 74,0 százalékra nőtt a Kimi K3-hoz képest. A Crosby Redline Bench teszten 49,3 százalékról 55,5 százalékra javult. A Redline Bench ráadásul eltérő tesztelési környezetben futott.

A jogi tudást és a paraméteres következtetést mérő LegalBench, CUAD, MAUD és Mercor Apex-v1 teszteken a Tenet megtartotta az alapmodell teljesítményét. A Fireworks közlése szerint az ügynökös képességek javítása így nem járt a jogi ismeretek számottevő romlásával.

A költség közel változatlan maradt

A Tenet egy LAB-feladat lefuttatása esetén 5,92 dollárba került, míg a Kimi K3 esetében ez az érték 5,62 dollár volt. A Fireworks ezt gyakorlatilag változatlan költségszintként írja le, miközben a Tenet csaknem kétszer annyi feladatot teljesített.

A vállalat szerint ebben az open-weight modellek tokenenkénti árazása és az alkalmazott jutalmazási kialakítás játszott szerepet. A fejlesztéshez tízezres nagyságrendben futtattak hosszú munkameneteket minden ellenőrzési pontnál. Ezek a futások több mint 50 fordulón és 100 000 generált tokenen is áthaladtak egy élő, elkülönített munkakörnyezetben.

A Fireworks közös tanítási és kiszolgálási infrastruktúrát használ. A cég szerint így a modell tanítás és használat közben azonos numerikus működést kap, ami segít alacsonyan tartani a két folyamat közötti eltérést. A kérések eredménye a vállalat leírása alapján attól függetlenül azonos marad, hogy mi kerül ugyanabba a kötegbe.

A Tenet bemutatása egy későbbi, részletes technikai beszámoló bevezetése. A Harvey és a Fireworks AI azt tervezi, hogy külön ismerteti a jutalmazás kialakítását, az aszinkron megerősítéses tanulási rendszert és a hosszú futások tapasztalatait. A felhasználók számára a mostani eredmények azt mutatják, hogy a Kimi K3-ra épített modell hosszabb jogi munkafolyamatokban is használható, a közölt teszteken magasabb teljesítménnyel és csaknem változatlan feladatonkénti költséggel.

Kapcsolódó hírek

Kimi K3: Claude-klón vagy önálló fejlesztés?
Modellek2026. október 2.

Kimi K3: Claude-klón vagy önálló fejlesztés?

A Moonshot AI Kimi K3 modellje 2,8 billió paraméterével az első nyílt súlyú modell ezen a méreten. A megjelenés után felmerült, hogy a fejlesztés Anthropic-modellből…

Kevesebb tokenből hozná a Kimi K3 szintjét a Fireworks Ember-1
Modellek2026. szeptember 23.

Kevesebb tokenből hozná a Kimi K3 szintjét a Fireworks Ember-1

A Fireworks Research bemutatta az Ember-1-et, egy Kimi K3-ra épülő specializált modellt, amely a vállalat szerint 40 százalékkal kevesebb tokenből hozza ugyanazt a…

A Fireworksre érkezett a 2,8 ezermilliárd paraméteres Kimi K3
Modellek2026. július 27.

A Fireworksre érkezett a 2,8 ezermilliárd paraméteres Kimi K3

A Fireworks elérhetővé tette a Moonshot AI nyílt súlyú Kimi K3 modelljét következtetésre és tanításra. A vállalat szerint a 2,8 ezermilliárd paraméteres rendszer több…