Az annotációk mérsékelhetik a nyelvi modellek sokféleségének összeomlását

Az annotációkra épülő tanítás mérsékelheti azt a sokféleségvesztést, amely a nyelvi modellek felügyelt finomhangolása után jelentkezik. Az Apple kutatói szerint módszerük a hagyományos felügyelt finomhangolásnál hatszor kisebb diverzitás-összeomlást eredményezhet, és a méretnöveléssel javul.
- A felügyelt finomhangolás javítja az utasításkövetést, de szemantikai mód-összeomlást okozhat.
- A kutatók annotációkkal őriznék meg az előtanítás változatosságát.
- A módszer következtetéskor változatos annotációkat használhat horgonyként.
- Az Apple szerint az eljárás hatszor kisebb diverzitás-összeomlást eredményezhet.
- A kutatók szerint a módszer a modell méretének növelésével javul.
A finomhangolás szűkítheti a modellek választerét
Az Apple gépi tanulási kutatási oldalán 2026 júliusában közzétett tanulmány a modellek utólagos tanítását, azon belül a felügyelt finomhangolást vizsgálja. Ez az eljárás javítja a modellek utasításkövetését, a kutatók szerint azonban gyakran úgynevezett szemantikai mód-összeomláshoz vezet.
A jelenség során a modell a finomhangolási adatok alacsony entrópiájú, vagyis kevésbé változatos eloszlásához igazodik. Eközben háttérbe szorulhat az előtanításból származó, nagyobb entrópiájú eloszlás sokfélesége. A tanulmány egyik fontos megállapítása, hogy ez a kompromisszum a modell méretének növekedésével tovább romlik.
Annotációkkal őriznék meg az előtanítás sokféleségét
A szerzők az annotációkra támaszkodó tanítást javasolják a szemantikai sokféleség megőrzésére. A módszerben a modellt olyan dokumentumokon tanítják elő, amelyekhez szemantikai annotációk, vagyis jelentést leíró címkék is tartoznak.
Az eljárás célja, hogy az annotációk eloszlása tükrözze az előtanítási adatok teljes változatosságát. Ezt az eloszlást a kutatók az utólagos tanítás során is megőrzik. A modell így követheti a felhasználói preferenciákat és az utasításokat, miközben nem veszíti el teljesen az előtanítás során megszerzett szemantikai gazdagságot.
A módszer a következtetés, vagyis az inference során többféle annotáció mintavételezését teszi lehetővé. Ezek az annotációk horgonyként irányítják a szöveggenerálást, így az előtanításból származó változatosság beépülhet az utólag tanított modell válaszaiba.
A kutatók szerint méretnöveléssel is javul a módszer
A tanulmány szerint az annotációkra épülő tanítással létrehozott modellek hatszor kisebb diverzitás-összeomlást érhetnek el, mint a felügyelt finomhangolással tanított modellek. A kutatók azt is megállapították, hogy az általuk javasolt megközelítés a modell méretének növelésével javul, miközben a hagyományos utólagos tanításnál a sokféleségvesztés erősödik.
A tanulmány címe Annotations Mitigate Post-Training Mode Collapse, és az ICML konferencia anyagai között szerepel. Szerzői Jacob Mitchell Springer, Madhu Advani, Lukas Aichberger, Arwen Bradley, Eran Malach, Omid Saremi, Sinead Williamson, Preetum Nakkiran, Etai Littwin és Aditi Raghunathan. A forrás szerint a szerzők egy része a Carnegie Mellon Universityhez, illetve a Johannes Kepler University Linzhez kötődik, a munkát pedig többen az Apple-nél végezték.
Mit jelenthet ez a modellek használatában?
A kutatás olyan modellek fejlesztéséhez kínál módszert, amelyeknek egyszerre kell követniük az utasításokat és változatos válaszokat adniuk. A forrás alapján az annotációk az előtanítás sokféleségének megőrzésére szolgálnak az utólagos tanítás után, miközben a módszer a skálázással is kedvezőbb eredményt mutat.
Az Apple tanulmánya ezzel az utólagos tanítás egyik központi kompromisszumára ad javaslatot: az utasításkövetés javulása ne járjon szükségszerűen a szemantikai változatosság ilyen mértékű csökkenésével.
Apple: Annotations Mitigate Post-Training Mode Collapse


