Közvetlen képgenerálást kapott a Pydantic AI

A Pydantic AI új ImageGenerator felülete közvetlen hozzáférést ad dedikált képgeneráló modellekhez. Az egységes API az OpenAI GPT Image, a Google Gemini és az xAI Grok Imagine használatát is támogatja.
- A Pydantic AI új ImageGenerator API-ja közvetlen képgenerálást kínál.
- Támogatott az OpenAI GPT Image, a Google Gemini és az xAI Grok Imagine.
- Az ügynökök az ImageGeneration képességen keresztül is készíthetnek képeket.
- A generált eredmény BinaryImage típusként használható az alkalmazásban.
- A funkció egységes beállításokat és Logfire-integrációt kínál.
Egységes API több képgenerálóhoz
A Pydantic 2026. szeptember 14-én jelentette be, hogy a Pydantic AI-ban elérhetővé vált a dedikált képgeneráló modellek támogatása. A fejlesztők korábban beszélgetési modelleken keresztül használhattak képgenerálást, az új ImageGenerator azonban közvetlen API-t biztosít, ügynökfuttatás nélkül.
A felület jelenleg az OpenAI GPT Image, a Google Gemini és az xAI Grok Imagine modelljeit kezeli. A Google szolgáltatása a Gemini Developer API-n és a Vertex AI-on keresztül is használható. A szolgáltatókhoz külön opcionális függőségekre és hitelesítő adatokra van szükség, a modellek pedig a szolgáltatóhoz tartozó előtaggal adhatók meg.
A Pydantic példája szerint az OpenAI-kiegészítő telepítése és az API-kulcs beállítása után a fejlesztő egyetlen hívással kérhet képet. Az eredmény BinaryImage típusú objektum, amely közvetlenül tartalmazza a képfájlt és annak médiatípusát. A felület szinkron és aszinkron használatot is támogat, valamint referencia- vagy bemeneti képek átadásával szerkesztésre és átalakításra is alkalmas.
Az ügynök is dönthet a képkészítésről
A közvetlen API mellett a Pydantic AI ügynökei is hozzáférhetnek képgeneráláshoz az ImageGeneration képességen keresztül. Ebben az esetben az alkalmazás fejlesztője meghatározhatja, mikor induljon a generálás, vagy átadhatja a döntést az ügynöknek.
A létrehozott kép az ügynök futásának üzenetei között, eszközeredményként jelenik meg. Így a modell a későbbi lépésekben tovább dolgozhat vele, például alternatív szöveget írhat hozzá. A Pydantic AI lehetővé teszi azt is, hogy a fejlesztő saját eszközbe csomagolja a képgenerátort, és szöveges, valamint bináris tartalmat adjon vissza ugyanabban az eredményben.
Az ImageGeneration használhat natív képgenerálást, ha az ügynök modellje támogatja azt, vagy a fejlesztő által megadott helyi implementációt. A dokumentáció szerint a „helyi” implementáció az alkalmazásban működő eszközt jelenti, a generátor azonban továbbra is távoli képszolgáltatót hív. Ez a mechanizmus a modellek képességei alapján választ tartalékutat, és nem automatikus szolgáltatóváltás sikertelen kérés után.
Kevesebb illesztőkód, közös beállítások
A Pydantic szerint az új megoldás egyik előnye, hogy a szolgáltatók beállítása, a kérések leképezése és a képek dekódolása közös eredménytípuson keresztül történik. Az olyan beállítások, mint a méretek és a képarány, egységes felületen érhetők el, miközben a szolgáltatóspecifikus vezérlők megőrzik saját előtagjukat.
Az adapterek ellenőrzik a támogatott geometriát, és jelzik, ha egy beállítást a szolgáltató figyelmen kívül hagy vagy felülír. A szolgáltatók saját korlátai továbbra is érvényesek. Az egységes interfész segítségével másik modell kipróbálásakor az alkalmazás többi részét nem kell átírni az eltérő válaszformátum miatt.
A képek ügynökbemenetté vagy eszközeredménnyé alakíthatók. A Pydantic AI Harness médiakülsősítési funkciója a nagy tartalmakat ki tudja venni a tartósan tárolt üzenettörténetből, de a képgenerálás önmagában nem menti el automatikusan a fájlokat. A generátor OpenTelemetry-instrumentációt is kínál, így a hívások az ügynök- és eszköztevékenységekkel együtt követhetők a Logfire-ben.
A fejlesztők számára ez közös Pythonos felületet jelent több képszolgáltatóhoz, valamint egyszerűbb integrációt az ügynökökkel. A funkció a Pydantic közlése szerint felhasználói visszajelzések nyomán készült, az eredeti pull requestet Egon Ferri készítette.
Pydantic: Generate images with Pydantic AI


