Az Apple kutatói képpel és szöveggel is vezérelhető szegmentáló modellt mutattak be

Az Apple kutatói a COSINE nevű, nyílt világú képszegmentáló modellt mutatták be, amely képeket és szöveget is használhat bemenetként. A rendszer az eltérő szegmentálási feladatokat egy közös, utasításokkal vezérelhető keretben kezeli.
- Az Apple kutatói bemutatták a COSINE nyílt világú képszegmentáló modellt.
- A rendszer képi és szöveges bemeneteket is támogat.
- A COSINE egy közös keretben kezeli a nyílt szókészletű és a kontextuson belüli szegmentálást.
- A modell egy modellkészletből és egy szegmentáló dekóderből áll.
- A kutatók több szegmentálási feladaton vizsgálták a módszer hatékonyságát.
Egy modell két szegmentálási megközelítéshez
A tanulmány a nyílt világú képszegmentálás fejlődésére épít. Ezen belül az egyik irány a nyílt szókészletű szegmentálás, amelynél a rendszer szöveges fogalmak alapján keresi meg és jelöli ki a kép releváns részeit. A másik az úgynevezett kontextuson belüli szegmentálás, ahol egy megadott példakép segít meghatározni, melyik objektumot kell elkülöníteni.
Az Apple kutatói szerint a korábbi módszerek jellemzően egyetlen modalitásból származó utasításra támaszkodtak. Ez korlátozhatja a rugalmasságot és a pontosságot összetett, objektumközpontú feladatoknál. A COSINE ezt a két feladattípust egységesen, utasítással vezérelhető szegmentálási problémaként kezeli.
Képek és szöveg lehet a bemenet
A COSINE neve a Consolidates Open-vocabulary Segmentation and IN-context sEgmentation kifejezésből származik. A modell különböző típusú bemeneteket támogat, köztük képeket és szöveget. Ez lehetővé teszi, hogy a felhasználó a feladat jellegéhez illő modalitással adja meg, milyen konkrét fogalmat vagy objektumot kell megtalálni a képen.
A rendszer két fő elemet tartalmaz: egy modellkészletet és egy szegmentáló dekódert, vagyis segdecoder komponenst. A kutatók leírása szerint a COSINE az alapmodellek reprezentációs képességére támaszkodik. Ennek segítségével különböző bemenetek alapján képes meghatározott fogalmak pontos szegmentálására.
A megközelítés lényege, hogy a képi és szöveges promptok egy közös rendszerben jelennek meg. Így ugyanaz a modell használható olyan helyzetekben, amikor egy szöveges megnevezés, illetve olyanokban is, amikor egy képi példa adja meg a keresett objektumot.
A kutatók több feladaton vizsgálták a módszert
A tanulmány szerzői többféle szegmentálási feladaton végeztek kísérleteket. Az Apple kutatási oldala szerint ezek az eredmények igazolták a javasolt módszer hatékonyságát, a forrás azonban nem közöl konkrét pontszámokat vagy összehasonlító mérőszámokat.
A COSINE a bemenetek sokféleségét és az egyetlen modalitásra épülő megoldások korlátait kezeli egy közös modellben. A kutatók ezt a rendszert a nyílt világú érzékeléshez szükséges képességként írják le, amely lehetővé teszi, hogy a szegmentálás ne kizárólag előre meghatározott objektumkategóriákhoz kötődjön.
A tanulmány helye az Apple gépi tanulási kutatásaiban
A Unified Open-World Segmentation with Multi-Modal Prompts című tanulmány az Apple gépi tanulási kutatási oldalán szerepel, a számítógépes látás területén. A publikáció konferenciája az ICCV, a kutatási oldal pedig 2025 decemberét jelöli meg a tanulmány megjelenési időpontjaként. Az oldalon feltüntetett dátum 2026. július 6.
A szerzők Yang Liu, Yufei Yin, Chenchen Jing, Muzhi Zhu, Hao Chen, Yuling Xi, Bo Feng, Hao Wang és Shiyu Li. A szerzők között a Zhejiang University, a Hangzhou Dianzi University és a Zhejiang University of Technology kutatói szerepelnek.
A felhasználók szempontjából a forrás alapján a legfontosabb változás az, hogy a javasolt rendszer többféle utasítással képes dolgozni. A tanulmány a technikai módszert és annak kísérleti értékelését mutatja be, konkrét termékbe épített funkcióról vagy nyilvánosan elérhető szolgáltatásról azonban nem közöl információt.


