Négy AI-videóeszközt teszteltek, eltérően követik a promptokat

A Higgsfield összehasonlítása szerint nincs egyetlen AI-videóeszköz, amely minden promptkövetési kategóriában a legjobb lenne. A Cinema Studio 4.0 a legtöbb megadott korlátozást tartotta meg, míg más modellek a kameramozgásban, a fizikában vagy a stilizált elemekben teljesítettek erősebben.
- A Cinema Studio 4.0 tartotta meg a legtöbb kért korlátozást.
- A Seedance 2.5 a változó látószögek és a tárgyrészletek kezelésében volt erős.
- A Veo 3.1 a fizika és a realizmus terén teljesített a legjobban.
- A Gemini Omni Flash 1.1 a stilizált elemeknél bizonyult a legerősebbnek.
- A Higgsfield szerint nincs minden kategóriában győztes modell.
A promptkövetés összetett feladat
A promptkövetés azt jelenti, hogy a generált videó mennyire pontosan felel meg a leírás konkrét részleteinek. Ide tartozhatnak a képen megjelenő tárgyak, azok színei, a kameramozgás, a képernyőn látható szöveg és az események sorrendje.
Egy videó akkor is lehet látványos, ha közben nem tartja be pontosan a promptot. A különbségek főként akkor válnak láthatóvá, amikor a leírás egyszerre három vagy több tárgyat, meghatározott kamerautat, képernyőn megjelenő szöveget és pontos eseménysorrendet ír elő. Az egyetlen tárgyat és egyetlen cselekvést tartalmazó promptokat a Higgsfield szerint a legtöbb modell könnyebben kezeli.
Négy modell, négy erősség
A Higgsfield egy szándékosan sok megkötést tartalmazó promptot futtatott négy modellen: Seedance 2.5, Cinema Studio 4.0, Google Veo 3.1 és Gemini Omni Flash 1.1. A leírás három konkrét tárgyat, megnevezett kameramozgást, meghatározott fénybeállítást és egy adott színű képernyőszöveget tartalmazott.
A vállalat értékelése szerint a Cinema Studio 4.0 őrizte meg a legtöbb kért korlátozást. A Seedance 2.5 a változó látószögek és a tárgyak részleteinek kezelésében volt erős. A Veo 3.1 adta a legerősebb fizikát és realizmust, míg a Gemini Omni Flash 1.1 a stilizált elemeknél teljesített a legjobban. A Higgsfield szerint egyik eszköz sem nyerte meg az összes kategóriát.
A tesztben egy összetett filmes jelenetet írtak le
A vizsgált prompt egy napfényes New York-i sugárúton játszódó jelenetet részletezett. A leírásban három barát, egy 45 méter magas növényistennő, sárga taxik és más járművek, magas épületek, gyalogosok, közlekedési lámpák és utcai lámpák szerepeltek.
A prompt többek között ARRI Alexa 35 kamerát, 4K felbontást, 24 képkocka per másodperces sebességet, 180 fokos zárszöget, Kodak Vision3 250D filmszimulációt és finom filmszemcsézettséget határozott meg. A kameramozgások, a fényforrások, a vágások közötti mozgásfolytonosság és az események sorrendje szintén rögzítve volt.
Külön szabály tiltotta a logókat, márkajelzéseket, rendszámokat és más olvasható szövegeket a járműveken, a lábbeliken és a jelenet egyéb felületein. A prompt azt is előírta, hogy egy adott ponttól a három szereplő egymás mellett, a növényistennővel szemben álljon, és a fő szembenállást hátulról, széles látószögű beállításban mutassák.
Hogyan javítható a promptkövetés?
A Higgsfield hét gyakorlatot emel ki. A pontosan megjelenítendő szereplőkhöz, termékekhez vagy helyszínekhez érdemes referencia képeket használni, mert a pusztán szöveges leírás minden generálásnál kissé más értelmezést kaphat.
A kameramozgást konkrétan kell megnevezni, például lassú közelítéssel, balra pásztázással vagy rögzített totálképpel. Mozgásos jeleneteknél a műfaj vagy a fizikai környezet megadása is segíthet. Az eseményeket sorrendben célszerű leírni, a túl sok részletet pedig több snittre bontani.
A fényforrás pontos megnevezése szintén fontos. A Higgsfield külön kiemeli, hogy a szöveg és a színek gyakran kimaradnak, ezért ezeket név szerint kell megadni. A teszt eredménye alapján a felhasználóknak az eszközválasztást a kívánt feladathoz kell igazítaniuk: a korlátozások megőrzése, a realizmus, a kameramozgás és a stilizált megjelenés eltérő erősségeket kívánhat.
Higgsfield: Which AI Video Tools Are Best at Following Your Prompt?


