AI-ügynök értékeli, mennyire jól szerkesztenek képeket az új modellek

A Lambda, a Texasi Egyetem austini kampuszával, a UCLA-val és a Microsofttal közösen, EdiVal-Agent néven olyan keretrendszert fejlesztett, amely AI-ügynökkel értékeli a képszerkesztő alapmodelleket. A rendszer azt vizsgálja, hogy a modellek teljesítik-e a kérést, megőrzik-e a változatlan tartalmakat, és vizuálisan meggyőző eredményt adnak-e.
- Az EdiVal-Agent AI-ügynökkel értékeli a képszerkesztő alapmodelleket.
- A rendszer az utasításkövetést, a tartalmi következetességet és a vizuális minőséget méri.
- Az EdiVal-IF 81,3 százalékban egyezett az emberi értékelésekkel.
- A többfordulós szerkesztésben a hibák idővel összeadódhatnak.
- A keretrendszer a Lambda szerint a modellfejlesztési visszacsatolási ciklus része lehet.
Miért nehéz a képszerkesztő modellek értékelése?
A szöveges utasításokra épülő képszerkesztés a multimodális alapmodellek egyik fontos képességévé válik. A felhasználó például azt kérheti, hogy a rendszer távolítsa el a háttérben álló embert, változtassa pirosra az autót, vagy helyezze a széket az asztal mellé.
A fejlesztők számára azonban a jobb képek előállítása csak a feladat egyik része. Azt is meg kell állapítaniuk, hogy egy új modellverzió valóban javult-e. Az értékelés segít a modellváltozatok összehasonlításában, az új tanítási módszerek ellenőrzésében, a visszaesések felismerésében és a következő fejlesztési irány kijelölésében.
A képszerkesztésnél egyszerre kell teljesülnie több feltételnek. A modellnek pontosan a kért változtatást kell végrehajtania, meg kell őriznie mindent, aminek változatlanul kell maradnia, és jó vizuális minőségű képet kell létrehoznia. Többfordulós szerkesztésnél az új utasítások mellett a korábbi módosításokat is meg kell őriznie. Több ezer eredmény kézi ellenőrzése lassú és költséges, az egyetlen pontszámot adó automatizált mérőszámok pedig nem feltétlenül ragadják meg ezeket a szempontokat.
Az EdiVal-Agent objektumokra bontja a feladatot
Az ICLR 2026 konferencián tanulmányként elfogadott EdiVal-Agent nem egyetlen AI-modellel próbálja megítélni a teljes szerkesztett képet. A keretrendszer kisebb, ellenőrizhető feladatokra bontja az értékelést. Először azonosítja a kép szemantikailag jelentős objektumait, majd az utasítást objektumszinten értelmezi, és meghatározza, minek kell megváltoznia, illetve minek kell változatlannak maradnia.
Több szerkesztési körben egy folyamatosan frissülő objektumkészlet követi a változásokat. A rendszer különböző AI-modelleket és vizuális eszközöket hangol össze. A „change the blue car to red” utasítás esetén például ellenőrizheti, hogy a megfelelő autó továbbra is látható-e, megváltozott-e a színe, megmaradtak-e a háttér és más, nem érintett objektumok, valamint meggyőző maradt-e a végső kép.
- Instruction Following, EdiVal-IF: a kért szerkesztés megtörtént-e.
- Content Consistency, EdiVal-CC: változatlan maradt-e az a tartalom, amelynek meg kellett maradnia.
- Visual Quality, EdiVal-VQ: vizuálisan meggyőző és hibáktól mentes-e az eredmény.
Az emberi értékelésekhez is közelebb kerülhet
A Lambda közlése szerint az EdiVal-IF 81,3 százalékban egyezett az emberi értékelésekkel. Ez magasabb arány a kizárólag látás és nyelv alapú modellt használó értékelő 75,2 százalékánál, valamint a küszöbértékkel alkalmazott CLIP-alapú mérőszám 68,9 százalékánál. A vállalat ezt annak tulajdonítja, hogy a rendszer a nyelvi és vizuális következtetést speciális képfeldolgozó eszközökkel kombinálja.
Az EdiVal-Agent segítségével a kutatók több képszerkesztő alapmodellt és többfordulós feladatot is összehasonlítottak. Az eredmények egyik tanulsága, hogy az erős egyszeri teljesítmény nem feltétlenül jelent erős többfordulós működést. Ahogy gyűlnek az utasítások, a modelleknek minden új kérést teljesíteniük kell, miközben megőrzik a korábbi módosításokat és a nem érintett tartalmakat. A hibák így idővel összeadódhatnak.
A Lambda szerint a részletes értékelés a fejlesztőknek nem csak rangsort ad. Megmutathatja, hogy egy javulás vagy visszaesés az utasításkövetéshez, a tartalom megőrzéséhez vagy a vizuális minőséghez kapcsolódik-e. Egy új modellváltozat például jobban követheti a szerkesztési kéréseket, miközben rosszabbul őrzi meg a környezetet.
Az értékelés a fejlesztési folyamat része lehet
Az EdiVal-Agentet a Lambda olyan eszközként mutatja be, amely a modellfejlesztési folyamatba is beépíthető. Egy új ellenőrzőpont létrehozásakor a modell automatikusan szerkesztéseket végezhet egy értékelési adathalmazon, a keretrendszer pedig megvizsgálhatja az eredményeket és azonosíthatja a konkrét hibákat. Ezek az eredmények a következő tanítási kör irányítását segíthetik.
A megközelítés a Lambda tágabb, ügynökalapú mesterséges intelligenciával kapcsolatos munkájának része. A vállalat szerint az AI-ügynökök nemcsak felhasználói feladatokat hajthatnak végre, hanem más AI-rendszerek összehasonlításában, ellenőrzésében és javításában is szerepet kaphatnak. A rendszer objektumokat követ, több eszközt hangol össze, és több lépésben ad visszajelzést. A Lambda GPU-infrastruktúrájával az értékelés modellek, modellváltozatok, képek, szerkesztési körök és értékelők között is skálázható lehet.


