Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

AI-ügynök értékeli, mennyire jól szerkesztenek képeket az új modellek

2026. szeptember 17.Forrás: Lambda
AI-ügynök értékeli, mennyire jól szerkesztenek képeket az új modellek
Kép: Lambda

A Lambda, a Texasi Egyetem austini kampuszával, a UCLA-val és a Microsofttal közösen, EdiVal-Agent néven olyan keretrendszert fejlesztett, amely AI-ügynökkel értékeli a képszerkesztő alapmodelleket. A rendszer azt vizsgálja, hogy a modellek teljesítik-e a kérést, megőrzik-e a változatlan tartalmakat, és vizuálisan meggyőző eredményt adnak-e.

A lényeg röviden
  • Az EdiVal-Agent AI-ügynökkel értékeli a képszerkesztő alapmodelleket.
  • A rendszer az utasításkövetést, a tartalmi következetességet és a vizuális minőséget méri.
  • Az EdiVal-IF 81,3 százalékban egyezett az emberi értékelésekkel.
  • A többfordulós szerkesztésben a hibák idővel összeadódhatnak.
  • A keretrendszer a Lambda szerint a modellfejlesztési visszacsatolási ciklus része lehet.

Miért nehéz a képszerkesztő modellek értékelése?

A szöveges utasításokra épülő képszerkesztés a multimodális alapmodellek egyik fontos képességévé válik. A felhasználó például azt kérheti, hogy a rendszer távolítsa el a háttérben álló embert, változtassa pirosra az autót, vagy helyezze a széket az asztal mellé.

A fejlesztők számára azonban a jobb képek előállítása csak a feladat egyik része. Azt is meg kell állapítaniuk, hogy egy új modellverzió valóban javult-e. Az értékelés segít a modellváltozatok összehasonlításában, az új tanítási módszerek ellenőrzésében, a visszaesések felismerésében és a következő fejlesztési irány kijelölésében.

A képszerkesztésnél egyszerre kell teljesülnie több feltételnek. A modellnek pontosan a kért változtatást kell végrehajtania, meg kell őriznie mindent, aminek változatlanul kell maradnia, és jó vizuális minőségű képet kell létrehoznia. Többfordulós szerkesztésnél az új utasítások mellett a korábbi módosításokat is meg kell őriznie. Több ezer eredmény kézi ellenőrzése lassú és költséges, az egyetlen pontszámot adó automatizált mérőszámok pedig nem feltétlenül ragadják meg ezeket a szempontokat.

Az EdiVal-Agent objektumokra bontja a feladatot

Az ICLR 2026 konferencián tanulmányként elfogadott EdiVal-Agent nem egyetlen AI-modellel próbálja megítélni a teljes szerkesztett képet. A keretrendszer kisebb, ellenőrizhető feladatokra bontja az értékelést. Először azonosítja a kép szemantikailag jelentős objektumait, majd az utasítást objektumszinten értelmezi, és meghatározza, minek kell megváltoznia, illetve minek kell változatlannak maradnia.

Több szerkesztési körben egy folyamatosan frissülő objektumkészlet követi a változásokat. A rendszer különböző AI-modelleket és vizuális eszközöket hangol össze. A „change the blue car to red” utasítás esetén például ellenőrizheti, hogy a megfelelő autó továbbra is látható-e, megváltozott-e a színe, megmaradtak-e a háttér és más, nem érintett objektumok, valamint meggyőző maradt-e a végső kép.

  • Instruction Following, EdiVal-IF: a kért szerkesztés megtörtént-e.
  • Content Consistency, EdiVal-CC: változatlan maradt-e az a tartalom, amelynek meg kellett maradnia.
  • Visual Quality, EdiVal-VQ: vizuálisan meggyőző és hibáktól mentes-e az eredmény.

Az emberi értékelésekhez is közelebb kerülhet

A Lambda közlése szerint az EdiVal-IF 81,3 százalékban egyezett az emberi értékelésekkel. Ez magasabb arány a kizárólag látás és nyelv alapú modellt használó értékelő 75,2 százalékánál, valamint a küszöbértékkel alkalmazott CLIP-alapú mérőszám 68,9 százalékánál. A vállalat ezt annak tulajdonítja, hogy a rendszer a nyelvi és vizuális következtetést speciális képfeldolgozó eszközökkel kombinálja.

Az EdiVal-Agent segítségével a kutatók több képszerkesztő alapmodellt és többfordulós feladatot is összehasonlítottak. Az eredmények egyik tanulsága, hogy az erős egyszeri teljesítmény nem feltétlenül jelent erős többfordulós működést. Ahogy gyűlnek az utasítások, a modelleknek minden új kérést teljesíteniük kell, miközben megőrzik a korábbi módosításokat és a nem érintett tartalmakat. A hibák így idővel összeadódhatnak.

A Lambda szerint a részletes értékelés a fejlesztőknek nem csak rangsort ad. Megmutathatja, hogy egy javulás vagy visszaesés az utasításkövetéshez, a tartalom megőrzéséhez vagy a vizuális minőséghez kapcsolódik-e. Egy új modellváltozat például jobban követheti a szerkesztési kéréseket, miközben rosszabbul őrzi meg a környezetet.

Az értékelés a fejlesztési folyamat része lehet

Az EdiVal-Agentet a Lambda olyan eszközként mutatja be, amely a modellfejlesztési folyamatba is beépíthető. Egy új ellenőrzőpont létrehozásakor a modell automatikusan szerkesztéseket végezhet egy értékelési adathalmazon, a keretrendszer pedig megvizsgálhatja az eredményeket és azonosíthatja a konkrét hibákat. Ezek az eredmények a következő tanítási kör irányítását segíthetik.

A megközelítés a Lambda tágabb, ügynökalapú mesterséges intelligenciával kapcsolatos munkájának része. A vállalat szerint az AI-ügynökök nemcsak felhasználói feladatokat hajthatnak végre, hanem más AI-rendszerek összehasonlításában, ellenőrzésében és javításában is szerepet kaphatnak. A rendszer objektumokat követ, több eszközt hangol össze, és több lépésben ad visszajelzést. A Lambda GPU-infrastruktúrájával az értékelés modellek, modellváltozatok, képek, szerkesztési körök és értékelők között is skálázható lehet.

Kapcsolódó hírek

A világ modellezésétől az aktív robotokig lépne a fizikai AI
Kutatás2026. október 1.

A világ modellezésétől az aktív robotokig lépne a fizikai AI

A fizikai környezetben működő mesterséges intelligenciának az élethű világmodellezés mellett azt is tudnia kell, mikor van szüksége új információra, hogyan tervezzen, és…

A fizikai MI következő lépése az aktív érzékelés lehet
Kutatás2026. október 1.

A fizikai MI következő lépése az aktív érzékelés lehet

A fizikai világban működő mesterséges intelligenciának nem elég valósághű jövőképeket generálnia. A Lambda szerint az ilyen rendszereknek fel kell ismerniük a…

Az MLPerfben először mértek adatközponti AI-ügynököt
Chipek és infrastruktúra2026. szeptember 16.

Az MLPerfben először mértek adatközponti AI-ügynököt

Az MLPerf Inference v6.1 mérésében először szerepelt adatközponti hardveren futtatott ügynöki terhelés, a Lambda pedig egy ezermilliárdnál több paraméteres modellt…