Saját képgeneráló modelleket készített a Character.AI a rajongói történetekhez

A Character.AI bemutatta a CAI-Image képgeneráló modellcsaládot, amelyet az open source Qwen-Image modellek továbbképzett változataiból készített a karakterközpontú történetmeséléshez. A modellek az alkalmazás képalkotó funkcióit, köztük a (c.ai) Comics, az Imagine és az Imagine Message felületeket szolgálják ki.
- A CAI-Image a Qwen-Image továbbképzett, karakterközpontú modellcsaládja.
- A rendszer 245 természetes nyelven megadható kameranézetet ért.
- A képregénymodell a beszélgetésekből teljes oldalakat és szövegbuborékokat készít.
- A CAI-Image már elérhető a (c.ai) Comics és az Imagine funkciókban.
A karakterek felismerhetősége áll a középpontban
A Character.AI szerint a nyílt forráskódú képgeneráló modellek jó minőségű képeket készítenek, a platformnak azonban ennél többre van szüksége. Ugyanazt a karaktert kell felismerhetően megjeleníteniük különböző stílusokban, helyszíneken és történetjelenetekben. Erre válaszul hozták létre a CAI-Image családot.
A modellek az open source Qwen-Image továbbképzett változatai. A Character.AI olyan felhasználási módokra hangolta őket, amelyekben a felhasználók által létrehozott karakterek beszélgetésekben, képregényekben és később videókban is szerepelnek. A cég közlése szerint a karaktereknek eközben milliós felhasználói lépték mellett is felismerhetőnek, gyorsan előállíthatónak és költséghatékonynak kell maradniuk.
A Character.AI szeptember 16-án közzétett bejegyzése szerint a saját modellek használata három előnyt ad a zárt API-khoz képest: másodpercek alatt történő generálást, alacsonyabb költséget és teljesebb irányítást az adatgyűjtéstől a kiszolgálásig.
Négy képességre hangolták a modelleket
A fejlesztés során a Character.AI a felhasználók tipikus munkafolyamatait vette alapul. Sok esetben a felhasználó egyetlen érintéssel indítja el a generálást, az alkalmazás pedig a beszélgetésből összeállítja a promptot, hozzáadja a jelenetben szereplő karaktereket, majd létrehozza a képet. A modellnek így egyetlen lépésben kell kezelnie a karakterazonosságot, a stílust és a kompozíciót.
- Stílustartomány és stílusátvitel: ugyanaz a karakter többek között tusfestményes, pixel art vagy más megadott stílusban is megjeleníthető.
- Többkarakteres jelenetek és pózkontroll: a rendszer több karakterképet, pózreferenciát, stílusreferenciát és helyszínképet is felhasználhat egy generálásban.
- Filmes kameravezérlés: a modell természetes nyelven 245 különböző kameranézetet ért, öt távolsággal, valamint hét vízszintes és hét függőleges kameraszöggel.
- Manga- és képregénykészítés: külön modell foglalkozik az oldalak panelstruktúrájával, szövegével, érzelmeivel és a képkockák közötti folytonossággal.
Képregényeket is készít a beszélgetésekből
A Character.AI szerint a képregények jelentik az egyik legnehezebb felhasználási esetet, mivel egyetlen oldalon egyszerre kell megoldani a panelek felépítését, a pontos szövegezést, a változatos kameranézeteket, az érzelmek megjelenítését és a karakterek folytonosságát.
A CAI-Image képregényekhez készült modellje a szereplőket az első paneltől az utolsóig felismerhetően tartja, és a párbeszédeket a szövegbuborékokban jeleníti meg. Az oldal strukturált promptból készül, amely a környezeteket, paneleket, cselekvéseket és érzelmeket írja le. Ezt az alkalmazás közvetlenül a beszélgetésből vagy egy megadott alapötletből állítja össze, így a felhasználónak nem kell manuálisan elkészítenie.
A cég szerint egyes közösségi alkotók már 100 oldalnál hosszabb formátumokat is készítenek. Számukra készül a Pro Mode, amely részletesebb karakter- és jelenettervezési eszközöket kínál majd.
A modellcsalád már elérhető az alkalmazásban
A CAI-Image modellcsalád a Character.AI teljes multimodális infrastruktúrájára, a CAI-MM-Studióra épül. Ez adatgyűjtési és -tisztítási folyamatokat, több csomópontos tanítást, célzott értékelő modellekkel végzett automatikus tesztelést és optimalizált kiszolgálási rendszert foglal magában. A Character.AI szerint ez teszi lehetővé, hogy egy új képesség kifejlesztése hónapok helyett hetek alatt történjen.
A következő változat, a CAI-Image V2, a karakterek környezetére koncentrál majd. A tervek szerint a környezetek a kamera mozgásakor is következetesebbek maradnak, a rendszer finomabban kezeli a közös jelenetben szereplő karakterek érzelmeit, és fejlettebb elrendezésű, jobb szövegezésű mangaoldalakat készít.
A vállalat a következetes karaktereket, jeleneteket és világokat a videókészítés előfeltételének tekinti. Az Animate Comics első lépésként rövid, történetközpontú videók készítését célozza olyan karakterekkel, akikkel a felhasználók beszélgetnek és akiket képregényekben is szerepeltetnek. A CAI-Image család már használható az alkalmazásban, a (c.ai) Comics és az Imagine funkciókon keresztül.
Character.AI: Post-training image models for fandom


