A Condé Nast két percre rövidítette a videókeresést az AWS megoldásával

A Condé Nast mesterséges intelligenciára épülő videókeresőt vezetett be, amely a szöveg, a kép és a hang alapján is megtalálja a releváns részleteket. Az AWS szerint a megoldás 250 percről kevesebb mint 2 percre csökkentette egy tartalomkeresési feladat idejét.
- A Condé Nast több mint 140 000 videóból álló archívumban keres.
- A rendszer képek, hangok és leiratok alapján is megtalálja a releváns klipeket.
- A keresési idő 250 percről kevesebb mint 2 percre csökkent.
- A manuális videó-áttekintésre fordított munka több mint 90 százalékkal mérséklődött.
- Az AWS szerint a becsült éves működési megtakarítás hozzávetőleg 800 000 dollár.
A címek helyett a videó tartalma alapján keresnek
A Vogue, a GQ, a Vanity Fair és a Wired szerkesztői korábban egy több mint 140 000 videóból álló archívumban dolgoztak. A releváns klipek megtalálásához elsősorban a videók címére és leírására támaszkodhattak, ezért sok esetben manuálisan kellett végignézniük vagy végigpörgetniük az anyagokat.
A keresés átlagosan 250 percet vett igénybe egy tartalomfelfedezési feladatnál. A problémát az is súlyosbította, hogy a szerkesztők gyakran intézményi tudás alapján találták meg az archívumban lévő anyagokat. Ha az adott kolléga nem volt elérhető, ez megnehezítette a munkát, miközben olyan tartalmak is rejtve maradhattak, amelyek címében vagy leírásában nem szerepelt a keresett kifejezés.
A Condé Nast az AWS Generative AI Innovation Centerrel együttműködve építette fel a keresőrendszert. A megoldás az Amazon Bedrockra és az Amazon OpenSearch Service-re épül, és természetes nyelvű, szándékalapú keresést kínál.
Egy modell kezeli a képet, a hangot és a leiratot
A rendszer a TwelveLabs Marengo beágyazási modelljét használja. Az AWS beszámolója szerint a modell együttesen kódolja a vizuális, hang- és leiratinformációkat, így egy klip akkor is megtalálható, ha a releváns információt az elhangzottak, a látható jelenetek vagy a hangok tartalmazzák.
A szerkesztők olyan természetes nyelvű kéréseket írhatnak be, mint a „kezdő jóga tartalom” vagy a „fenntarthatóságról szóló interjú egy hírességgel”. A kereső tolerálja a pontatlan lekérdezéseket, a jelentésre összpontosít, és pontos időbélyegeket ad vissza a releváns videórészletekhez. Referenciaképet is fel lehet tölteni vizuálisan hasonló tartalmak megtalálásához.
A háttérben a videók feldolgozása és a keresési kérések kiszolgálása két különálló rendszerben működik. Az új videók az Amazon S3-ba kerülnek, majd a feldolgozófolyamat ellenőrzi az anyagokat, kinyeri a formátumra, hosszra és felbontásra vonatkozó adatokat, és szegmensekre bontja őket. A szegmensekhez a Marengo hoz létre multimodális vektorokat, amelyeket tartós tárolás után az Amazon OpenSearch Service indexébe írnak.
Skálázható háttér a nagy archívumhoz
A feldolgozási folyamatot események vezérlik, a videódarabok párhuzamosan dolgozhatók fel, és az egyes lépésekhez újrapróbálási logika, valamint nyomon követhetőség tartozik. A Condé Nast ezt különösen a kezdeti, 140 000 videót érintő feltöltésnél használta ki.
A lekérdezési réteg a felhasználó természetes nyelvű kérését vektoros kereséssé alakítja, majd k legközelebbi szomszéd alapú keresést végez az OpenSearch-indexben. A találatok videócímekkel, bélyegképekkel, hivatkozásokkal és pontos időpontokkal egészülnek ki. A kapcsolódó metaadatokat az Amazon DocumentDB, MongoDB-kompatibilis adatbázis szolgáltatja.
Az AWS leírása szerint a rendszer több rendelkezésre állási zónában működik. Az OpenSearch Service replikációja három zónát érint, két aktív és egy tartalék példánnyal. Az Amazon DocumentDB elsődleges csomóponttal és tartalék replikával működik két zónában, a számítási rétegeket pedig automatikus méretezési csoportok kezelik.
A Condé Nast mérése szerint jelentősen csökkent a keresési idő
A Condé Nast 2026 májusában benchmarking workshopon mérte fel a rendszer hatását. A vállalat mérései szerint a tartalomkeresés ideje 250 percről hozzávetőleg 2 percre csökkent feladatonként, ami 99,2 százalékos mérséklődést jelent.
A manuális videó-áttekintésre fordított munka több mint 90 százalékkal csökkent. A szerkesztőknek a teljes videók végigpörgetése helyett célzott klipeket és pontos időbélyegeket ad a rendszer. Az AWS közlése szerint a megoldás a termelékenységnövekedés alapján hozzávetőleg 800 000 dollár becsült éves működési megtakarítást jelent.
A felhasználók számára a fejlesztés azt jelenti, hogy az archívum tartalmai a címek és leírások korlátain túl is kereshetővé válnak. A szerkesztők a videóban elhangzó, látható vagy hallható információ alapján találhatnak anyagokat, ami az AWS szerint gyorsabb hozzáférést adhat a korábban nehezen felfedezhető klipekhez.


