Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Hilbert: így épít formális matematikai bizonyításokat az Apple rendszere

2026. július 16.Forrás: Apple
Hilbert: így épít formális matematikai bizonyításokat az Apple rendszere
Kép: Apple

Az Apple bemutatta a Hilbert nevű ügynöki keretrendszert, amely informális matematikai érvelést kapcsol össze a Lean 4 formális bizonyítás-ellenőrzésével. A rendszer a sikertelenül megoldott feladatokat részproblémákra bontja, majd a verifikátor visszajelzése alapján javítja a bizonyításokat.

A lényeg röviden
  • A Hilbert informális érvelést és Lean 4-es formális bizonyítást kapcsol össze.
  • A rendszer négy komponenst használ, köztük bizonyításgeneráló modellt és verifikátort.
  • A miniF2F benchmarkon 99,2 százalékos eredményt ért el.
  • A PutnamBench 660 feladatából 462-t oldott meg, ez 70,0 százalék.
  • A tanulmányt elfogadták a NeurIPS 2025 MATH-AI workshopjára.

A természetes nyelvű gondolkodás és a formális ellenőrzés összekapcsolása

Az Apple kutatói szerint a nagy nyelvi modellek jelentős matematikai érvelési képességeket mutatnak, megoldásaik azonban gyakran olyan hibákat tartalmaznak, amelyek automatikusan nem ellenőrizhetők. A formális tételbizonyító rendszerek, köztük a Lean 4, ezzel szemben teljes pontosságú automatikus ellenőrzést tesznek lehetővé.

Ez a különbség egyben korlátot is jelent. Az Apple leírása szerint a jelenlegi, bizonyításokra specializált nyelvi modellek lényegesen kevesebb feladatot oldanak meg, mint az általános célú modellek természetes nyelven. A Hilbert ezt a különbséget próbálja csökkenteni az informális érvelés és a formális verifikáció együttes használatával.

Négy komponens dolgozik együtt

A Hilbert négy fő összetevőt hangol össze. Az egyik egy informális nyelvi modell, amely matematikai érvelésben erős. Ezt egy Lean 4-es taktikákra optimalizált, specializált bizonyításgeneráló modell egészíti ki. A rendszerhez tartozik továbbá egy formális verifikátor és egy szemantikus tételkereső.

Ha a bizonyításgeneráló modell nem tud megoldani egy feladatot, a Hilbert rekurzív felbontást alkalmaz. A problémát részfeladatokra, vagyis részgólokra bontja, amelyeket a bizonyításgeneráló vagy az érvelő modell oldhat meg. A formális verifikátor visszajelzései alapján a rendszer szükség esetén módosítja a hibás bizonyításokat.

99,2 százalék a miniF2F teszten

Az Apple közlése szerint a Hilbert a kulcsfontosságú teszteken jelentősen felülmúlta a korábbi megközelítéseket. A miniF2F benchmarkon 99,2 százalékos eredményt ért el, ami 6,6 százalékponttal jobb a legjobb nyilvánosan elérhető módszernél.

A rendszer a PutnamBench teszten is a közlés szerint a legjobb ismert eredményt hozta. A 660 feladatból 462-t oldott meg, ami 70,0 százalékos teljesítmény. Ez meghaladta a SeedProver 50,4 százalékos eredményét, és 422 százalékos javulást jelentett a legjobb nyilvánosan elérhető alapvonalhoz képest.

Kutatási eredmény, nem felhasználói termékbejelentés

A Hilbertről szóló tanulmányt 2025 októberében publikálták, és elfogadták a NeurIPS 2025 MATH-AI workshopjára. A szerzők között Sumanth Varambally, Thomas Voice, Yanchao Sun, Zhifeng Chen, Rose Yu és Ke Ye szerepel. Rose Yu a UC San Diegóhoz kötődik, Sumanth Varambally munkája pedig az Apple-nél készült.

A közölt eredmények alapján a Hilbert azt mutatja meg, hogyan lehet az informális matematikai gondolkodás szélesebb problémamegoldó képességét a Lean 4 ellenőrizhetőségével kombinálni. A hír közvetlenül egy kutatási keretrendszerről szól, amely formális bizonyítások generálását vizsgálja.

AppleHilbertLean 4SeedProverPutnamBenchnyelvi modellekAI-ágensektudománybenchmark
Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…

Az Apple kutatása szerint kevésbé számít az ügynökök körítése
Kutatás2026. október 1.

Az Apple kutatása szerint kevésbé számít az ügynökök körítése

Az Apple kutatói szerint a gépi tanulási feladatokra fejlesztett ügynököknél az alapul szolgáló nagy nyelvi modell teljesítménye fontosabb lehet az ügynök köré épített…

Apple-kutatás: közös, szelektív memória segítheti az LLM-ügynököket
Kutatás2026. szeptember 30.

Apple-kutatás: közös, szelektív memória segítheti az LLM-ügynököket

Közös, szelektív tartós memóriát mutat be az Apple kutatási anyaga az ügynökalapú LLM-rendszerekhez, amelyek több lépésben, eszközhasználattal állítanak elő kódot. A…