Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az érvelési nyom hossza jelezheti, mennyire biztos egy AI-válasza

2026. július 20.Forrás: Apple
Az érvelési nyom hossza jelezheti, mennyire biztos egy AI-válasza
Kép: Apple

A nagy érvelési modellek által létrehozott gondolkodási nyom hossza egyszerű módszer lehet a válaszok megbízhatóságának becslésére. Az Apple kutatása szerint a jelzés több modellen, adathalmazon és felszólításon végzett kísérletekben is használhatónak bizonyult.

A lényeg röviden
  • Az érvelési nyom hossza egyszerű bizonytalansági jelzés lehet.
  • A módszert több modellen, adathalmazon és felszólításon tesztelték.
  • A jelzés a verbalizált biztosságot kiegészítve működhet.
  • A nagy entrópiájú, „elágazó” tokenek fontos szerepet játszhatnak.
  • A tanulmányt 2026 februárjában publikálták, és elfogadták az ICML 2026 egyik workshopjára.

A hosszabb gondolkodási nyom bizonytalanságot jelezhet

Az Apple Machine Learning Research oldalán bemutatott tanulmány a nagy érvelési modellek (Large Reasoning Models, LRM-ek) bizonytalanságának számszerűsítését vizsgálja. Ezek a rendszerek a végső válasz előtt részletes gondolkodási folyamatot, úgynevezett érvelési nyomot (reasoning trace) generálnak.

A kutatók azt állítják, hogy ennek a nyomnak a hossza egyszerű, mégis hasznos bizalmassági becslő lehet. A megközelítés azt próbálja jelezni, mennyire magabiztos a modell a válaszában, ami az Apple szerint fontos az olyan problémák kezeléséhez, mint a hallucináció, vagyis a modell által előállított hibás információ.

Több modellel és adathalmazzal tesztelték a módszert

A Siddhartha Devic, Charlotte Peale, Arwen Bradley, Sinead Williamson, Preetum Nakkiran és Aravind Gollakota által jegyzett munka több modellen, adathalmazon és felszólításon alapuló kísérletekre támaszkodik. Az eredmények szerint az érvelési nyom hossza más, nulla példás bizalmassági becslőkhöz hasonlóan teljesít, miközben kiegészítő információt is adhat.

A tanulmány külön összeveti ezt a módszert a verbalizált biztossággal. Ilyenkor a modell szövegesen fejezi ki, mennyire biztos a válaszában. A kutatók szerint a nyom hossza ehhez mérhető, de attól kiegészítő módon működő jelzés.

A kutatás egyik megállapítása, hogy az érvelési utótréning alapvetően megváltoztatja a nyomhossz és a pontosság kapcsolatát. Korábbi munkák már azt mutatták, hogy az utótréning általában hosszabbá teszi ezeket a nyomokat, ezt a jelenséget gyakran túlgondolásként írják le. Az Apple kutatása szerint azonban a hossz nem pusztán a több szöveg miatt lehet érdekes a bizonytalanság becslésében.

A kutatók a működés lehetséges okait is vizsgálták

A szerzők elemezték, milyen mechanizmus állhat a nyomhossz jelzőértéke mögött. Megfigyelésük szerint a hatás akkor is fennmarad, amikor figyelembe veszik az olyan zavaró tényezőket, mint a feladat nehézsége és a GRPO által előidézett hosszúsági torzítás.

A vizsgálat kiemelt szerepet tulajdonít a nagy entrópiájú, vagyis „elágazó” tokeneknek. Ezek a tokenek a kutatók értelmezése szerint fontos részei lehetnek annak a mechanizmusnak, amely a gondolkodási nyom hosszát a bizonytalanság jelzésévé teszi.

A tanulmányt 2026 februárjában publikálták, és elfogadták az ICML 2026 Statistical Frameworks for Uncertainty in Agentic Systems Workshopjára. A kutatás az Apple szerint arra utal, hogy az érvelési utótréning a verbalizált kijelentéseken túl is javíthatja a bizonytalanság számszerűsítését.

Gyakorlati jelzés lehet a nagy érvelési modellek mellett

A kutatás felhasználói szempontból azért lehet fontos, mert a modell válaszának hossza egy további, közvetlenül vizsgálható jelzést adhat a megbízhatóság becsléséhez. Az Apple megfogalmazása szerint a gondolkodási nyom hossza praktikus bizalmassági mérőszámként használható a nagy érvelési modelleknél.

A forrás ugyanakkor a módszert kutatási eredményként mutatja be, és nem közöl konkrét termékbevezetést vagy felhasználói funkciót. A tanulmány fő állítása az, hogy a modell által generált érvelési folyamat hossza a pontossággal és a bizonytalansággal kapcsolatban is értelmezhető információt hordozhat.

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói képzés nélküli, ABX-alapú feladatokat mutattak be a többnyelvű nyelvi modellek vizsgálatára. Az XLM-R elemzése szerint a nyelvazonosításhoz kapcsolódó…

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…