Az Apple kutatói adaptív gondolkodási módszert mutattak be LLM-ekhez

Az Apple kutatói olyan módszert ismertettek, amely előre megbecsüli, mennyi köztes gondolkodásra van szüksége egy nagy nyelvi modellnek egy adott kérdésnél. A Sonata nevű megközelítés célja, hogy javítsa a pontosság és a számítási költség közötti egyensúlyt.
- Az Apple kutatói a Sonata nevű adaptív gondolkodáselosztási módszert ismertették.
- A módszer az önkonzisztenciát használja annak becslésére, mennyi gondolkodás kell egy kérdéshez.
- A Sonata offline tanított adapterrel dolgozik, az utolsó réteg rejtett reprezentációiból.
- A kísérletekben 20% és 80% közötti gondolkodásitoken-csökkenést értek el azonos pontosság mellett.
- Azonos tokenköltségnél a forrás szerint legfeljebb 5% pontosságjavulást mértek.
A kérdés nehézségéhez igazítaná a gondolkodási keretet
Az Apple gépi tanulási kutatási oldalán szereplő, Adaptive Thinking: Large Language Models Know When to Think in Latent Space című publikáció 2026 áprilisában jelent meg, ICLR konferenciacikként. A szerzők között Pingzhi Li, Bairu Hou, Yun Zhu, Yihao Feng, Ke Ye, Tao Lei, Zhifeng Chen, Tianlong Chen és Xianzhi Du szerepel. A forrás szerint a munka egy része az Apple-nél készült, több szerző a The University of North Carolina at Chapel Hillhez is kötődik.
A kutatás abból indul ki, hogy a nagy nyelvi modellek tesztelési időben, a válaszadás előtt köztes chain-of-thought, vagyis gondolatmenet alapú következtetést végezhetnek. A nagyobb gondolkodási keret a forrás szerint simább teljesítményjavulást hozhat következtetés közben, de továbbra sem egyértelmű, hogyan függ össze a modell képessége, a kérdés bonyolultsága és az optimális számítási keret.
A kutatók ezért az önkonzisztenciát használták jelzésként. Ez azt méri, mennyire egyeznek egymással a különböző következtetési utak. Megfigyelésük szerint az alacsonyabb önkonzisztencia arra utal, hogy egy kérdés hosszabb gondolkodást igényelhet a helyes válasz eléréséhez.
Mit csinál a Sonata?
A bemutatott módszer neve Sonata, teljes nevén Self-Consistency-Guided Adapter for Thinking Allocation. Az Apple leírása szerint ez egy könnyű megközelítés, amely adaptívan osztja ki a gondolkodási keretet a teljesítmény és a hatékonyság közötti kompromisszum javítására.
A Sonata része egy offline, kalibrációs adathalmazon tanított adapter. Ez a lekérdezés előfeldolgozási szakaszában, az utolsó réteg rejtett reprezentációiból közvetlenül becsüli az önkonzisztenciát. A becslés ezután még a gondolkodási lépés előtt irányítja, hogy a modell mennyi keretet kapjon az adott kérdéshez.
A forrás szerint az adapter általános, a betanítás után különböző feladatok között átvihető, és következtetés közben szinte nulla számítási többletterhet ad hozzá. A kutatók azt is kiemelik, hogy a Sonata független a meglévő CoT-tömörítési módszerektől, ezért azokkal együtt további hatékonysági nyereséget adhat a gondolkodási keretek kezelésében.
Kísérletek több modellen és benchmarkon
A módszert több modellen és tesztkészleten vizsgálták. A felsorolt modellek: Qwen3-8B, GPT-OSS-120B, Qwen3-235B-A22B és Intern-S1-mini. A benchmarkok között az AIME24, AIME25, GSM8K, MATH500 és GPQA szerepel.
Az Apple kutatási összefoglalója szerint a Sonata 20% és 80% közötti csökkenést ért el a gondolkodási tokenek számában úgy, hogy közben megtartotta ugyanazt a pontosságot. Alternatív beállításban, azonos tokenköltség mellett, legfeljebb 5% pontosságjavulást mutattak ki.
Ezek az eredmények a forrás alapján arra utalnak, hogy nem minden kérdéshez érdemes azonos gondolkodási keretet adni. A módszer lényege, hogy a modell a kérdés feldolgozásakor kapjon jelzést arról, várhatóan szüksége van-e hosszabb következtetésre.
Mit jelenthet ez a felhasználóknak és a piacnak?
A nagy nyelvi modellek használatánál a gondolkodási tokenek száma közvetlenül kapcsolódik a következtetési erőforrásokhoz. Ha egy rendszer az egyszerűbb kérdéseknél kevesebb köztes lépést használ, a forrásban leírt cél szerint hatékonyabbá teheti a válaszadást anélkül, hogy a pontosság csökkenne.
A Sonata piaci jelentősége abból következik, hogy a módszer több modellre és több feladattípusra készült kísérletekben szerepelt, valamint az Apple szerint szinte nulla extra következtetési költséggel működik. A publikáció ugyanakkor kutatási eredményt mutat be, a forrás nem közöl termékbevezetést, elérhetőséget vagy felhasználói funkciót.


