Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple kutatói képpel és szöveggel is vezérelhető szegmentáló modellt mutattak be

2026. július 6.Forrás: Apple
Az Apple kutatói képpel és szöveggel is vezérelhető szegmentáló modellt mutattak be
Kép: Apple

Az Apple kutatói a COSINE nevű, nyílt világú képszegmentáló modellt mutatták be, amely képeket és szöveget is használhat bemenetként. A rendszer az eltérő szegmentálási feladatokat egy közös, utasításokkal vezérelhető keretben kezeli.

A lényeg röviden
  • Az Apple kutatói bemutatták a COSINE nyílt világú képszegmentáló modellt.
  • A rendszer képi és szöveges bemeneteket is támogat.
  • A COSINE egy közös keretben kezeli a nyílt szókészletű és a kontextuson belüli szegmentálást.
  • A modell egy modellkészletből és egy szegmentáló dekóderből áll.
  • A kutatók több szegmentálási feladaton vizsgálták a módszer hatékonyságát.

Egy modell két szegmentálási megközelítéshez

A tanulmány a nyílt világú képszegmentálás fejlődésére épít. Ezen belül az egyik irány a nyílt szókészletű szegmentálás, amelynél a rendszer szöveges fogalmak alapján keresi meg és jelöli ki a kép releváns részeit. A másik az úgynevezett kontextuson belüli szegmentálás, ahol egy megadott példakép segít meghatározni, melyik objektumot kell elkülöníteni.

Az Apple kutatói szerint a korábbi módszerek jellemzően egyetlen modalitásból származó utasításra támaszkodtak. Ez korlátozhatja a rugalmasságot és a pontosságot összetett, objektumközpontú feladatoknál. A COSINE ezt a két feladattípust egységesen, utasítással vezérelhető szegmentálási problémaként kezeli.

Képek és szöveg lehet a bemenet

A COSINE neve a Consolidates Open-vocabulary Segmentation and IN-context sEgmentation kifejezésből származik. A modell különböző típusú bemeneteket támogat, köztük képeket és szöveget. Ez lehetővé teszi, hogy a felhasználó a feladat jellegéhez illő modalitással adja meg, milyen konkrét fogalmat vagy objektumot kell megtalálni a képen.

A rendszer két fő elemet tartalmaz: egy modellkészletet és egy szegmentáló dekódert, vagyis segdecoder komponenst. A kutatók leírása szerint a COSINE az alapmodellek reprezentációs képességére támaszkodik. Ennek segítségével különböző bemenetek alapján képes meghatározott fogalmak pontos szegmentálására.

A megközelítés lényege, hogy a képi és szöveges promptok egy közös rendszerben jelennek meg. Így ugyanaz a modell használható olyan helyzetekben, amikor egy szöveges megnevezés, illetve olyanokban is, amikor egy képi példa adja meg a keresett objektumot.

A kutatók több feladaton vizsgálták a módszert

A tanulmány szerzői többféle szegmentálási feladaton végeztek kísérleteket. Az Apple kutatási oldala szerint ezek az eredmények igazolták a javasolt módszer hatékonyságát, a forrás azonban nem közöl konkrét pontszámokat vagy összehasonlító mérőszámokat.

A COSINE a bemenetek sokféleségét és az egyetlen modalitásra épülő megoldások korlátait kezeli egy közös modellben. A kutatók ezt a rendszert a nyílt világú érzékeléshez szükséges képességként írják le, amely lehetővé teszi, hogy a szegmentálás ne kizárólag előre meghatározott objektumkategóriákhoz kötődjön.

A tanulmány helye az Apple gépi tanulási kutatásaiban

A Unified Open-World Segmentation with Multi-Modal Prompts című tanulmány az Apple gépi tanulási kutatási oldalán szerepel, a számítógépes látás területén. A publikáció konferenciája az ICCV, a kutatási oldal pedig 2025 decemberét jelöli meg a tanulmány megjelenési időpontjaként. Az oldalon feltüntetett dátum 2026. július 6.

A szerzők Yang Liu, Yufei Yin, Chenchen Jing, Muzhi Zhu, Hao Chen, Yuling Xi, Bo Feng, Hao Wang és Shiyu Li. A szerzők között a Zhejiang University, a Hangzhou Dianzi University és a Zhejiang University of Technology kutatói szerepelnek.

A felhasználók szempontjából a forrás alapján a legfontosabb változás az, hogy a javasolt rendszer többféle utasítással képes dolgozni. A tanulmány a technikai módszert és annak kísérleti értékelését mutatja be, konkrét termékbe épített funkcióról vagy nyilvánosan elérhető szolgáltatásról azonban nem közöl információt.

AppleCOSINEICCVZhejiang Universitymultimodális AIkutatási eredmény

Kapcsolódó hírek

Az Apple kutatása szerint a diffúziós modellek magabiztossága félrevezető lehet
Kutatás2026. október 2.

Az Apple kutatása szerint a diffúziós modellek magabiztossága félrevezető lehet

Az Apple kutatói szerint a diffúziós modellek pozíciónkénti valószínűségei önmagukban nem árulják el, hogy a generált tokenek között fennáll-e függőség. Ez torzíthatja a…

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…