A GPT-6 Astra videókat is elemezhet, ha képkockákra bontják

A GPT-6 Astra API-ja közvetlenül nem fogad videófájlokat, a Roboflow azonban időbélyeges képkockák sorozatával tesztelte videóelemzési képességeit. A modell strukturált JSON-kimenetben képes eseményeket és időpontokat megadni.
- A GPT-6 Astra API-ja közvetlenül nem fogad MP4-videókat.
- Időbélyeges képkockákból JSON-formátumú eseménylistát készít.
- A Roboflow tenisz-, tacoállomás- és rakodórámpa-felvételeken tesztelte.
- Egy 100 képkockás kérés körülbelül 1 dollárba kerül.
- Folyamatos követéshez a Roboflow külön objektumfelismerő modellt javasol.
Képkockákból rekonstruálja a videó eseményeit
A Roboflow 2026. szeptember 11-én közzétett bemutatója szerint a GPT-6 Astra szöveges és képi bemenetet kezel, az MP4-fájlokat viszont az API elutasítja, akár videóként, akár fájlként küldik el. A megoldás az, hogy a videót rögzített ütemben képkockákra bontják, majd minden képhez időbélyeget társítanak a kérés szövegében.
A tesztekben a kimenetet szigorú JSON-sémához kötötték. A modell így eseménytípusokat, időpontokat, szereplőket vagy állapotokat adott vissza, amelyeket a Roboflow ezután rárajzolt az eredeti videóra. A vállalat szerint a magas szintű következtetési beállítás minden vizsgált klipen segített.
Egy 100 képkockás kérés feldolgozása két-három percig tart, költsége pedig körülbelül 1 dollár. A Roboflow számítása szerint a 768×432 képkockák nagyjából 45 ezer bemeneti tokent és körülbelül 8 ezer kimeneti tokent jelentenek egy csomagban.
Teniszben és ételkészítésnél is tesztelték
Az első bemutatóban egy alapvonal mögé helyezett, rögzített kamera teniszmeccsét elemezték. A képkockák 5 képkocka/másodperc sebességgel érkeztek, a modellnek pedig a szervákat, ütéseket, pontokat és hibákat kellett felismernie. A játékosokat a mezük színe alapján azonosította, az eseményekhez időpontot és rövid megjegyzést rendelt.
A 1 és 5 képkocka/másodperc közötti újratesztelésben mind a 7 szervát és 17 ütést megtalálta minden mintavételezési sebességnél. A pontok kimenetelének felismeréséhez azonban 4 képkocka/másodperc alatti sebességnél már hiányzott egy esemény, mert nem állt rendelkezésre olyan képkocka, amelyből megállapíthatta volna, hogy a labda a pályára érkezett-e.
A második bemutatóban egy tacoállomás felülnézeti felvételén azt vizsgálták, milyen hozzávalók kerülnek az ételekre. A rendszer 27 másodperc alatt 13 hozzáadást jelentett, és ezek mindegyike 0,3 másodpercen belül volt ahhoz képest, ami a képkockákon látható. A guacamole-t kérték, de a szakács nem adta hozzá.
Logisztikában a kapuk és teherautók állapotát követte
A harmadik példa egy 11 perces, három kaput mutató rakodórámpa-felvétel volt. A Roboflow képkockánként 6 másodperces mintavételezéssel, összesen 112 képpel kérte a GPT-6 Astrától, hogy kapunként készítsen idővonalat. Az állapotok között szerepelt a zárt kapu, a nyitott kapu teherautó nélkül, a várakozó teherautó, valamint a rakodás és a kirakodás.
A kérés költsége a bemutató szerint körülbelül 0,75 dollár volt. A Roboflow ugyanakkor arra figyelmeztet, hogy a folyamatos, napi 24 órás feldolgozás egy kameránál hozzávetőleg 100 dollárnyi napi tokenköltséget jelentene.
A vállalat ezért hibrid megközelítést javasol. Az egyszerű állapotokat, például a nyitott vagy zárt kapu és a teherautó jelenlétét objektumfelismerő modell is kezelheti. A GPT-6 Astra ott lehet hasznos, ahol a rendszernek azt kell eldöntenie, hogy a rakományt éppen be- vagy kirakodják. A Roboflow szerint így a költség kameránként napi körülbelül 100 dollárról teherautónként néhány centre csökkenthető.
A GPT-6 Astra a bemutató alapján akkor használható videón, ha elegendő az események időpontját a mintavételezési lépés pontosságával meghatározni. Folyamatos képkockakövetéshez, valamint minden képkockán kulcspontok, határolókeretek vagy maszkok előállításához a Roboflow külön, finomhangolt RF-DETR-modellt javasol.
Roboflow: Understanding Video with GPT-6 Astra

