Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Közvetlen képgenerálást kapott a Pydantic AI

2026. szeptember 14. 11:00Forrás: Pydantic
Közvetlen képgenerálást kapott a Pydantic AI
Kép: Pydantic

A Pydantic AI új ImageGenerator felülete közvetlen hozzáférést ad dedikált képgeneráló modellekhez. Az egységes API az OpenAI GPT Image, a Google Gemini és az xAI Grok Imagine használatát is támogatja.

A lényeg röviden
  • A Pydantic AI új ImageGenerator API-ja közvetlen képgenerálást kínál.
  • Támogatott az OpenAI GPT Image, a Google Gemini és az xAI Grok Imagine.
  • Az ügynökök az ImageGeneration képességen keresztül is készíthetnek képeket.
  • A generált eredmény BinaryImage típusként használható az alkalmazásban.
  • A funkció egységes beállításokat és Logfire-integrációt kínál.

Egységes API több képgenerálóhoz

A Pydantic 2026. szeptember 14-én jelentette be, hogy a Pydantic AI-ban elérhetővé vált a dedikált képgeneráló modellek támogatása. A fejlesztők korábban beszélgetési modelleken keresztül használhattak képgenerálást, az új ImageGenerator azonban közvetlen API-t biztosít, ügynökfuttatás nélkül.

A felület jelenleg az OpenAI GPT Image, a Google Gemini és az xAI Grok Imagine modelljeit kezeli. A Google szolgáltatása a Gemini Developer API-n és a Vertex AI-on keresztül is használható. A szolgáltatókhoz külön opcionális függőségekre és hitelesítő adatokra van szükség, a modellek pedig a szolgáltatóhoz tartozó előtaggal adhatók meg.

A Pydantic példája szerint az OpenAI-kiegészítő telepítése és az API-kulcs beállítása után a fejlesztő egyetlen hívással kérhet képet. Az eredmény BinaryImage típusú objektum, amely közvetlenül tartalmazza a képfájlt és annak médiatípusát. A felület szinkron és aszinkron használatot is támogat, valamint referencia- vagy bemeneti képek átadásával szerkesztésre és átalakításra is alkalmas.

Az ügynök is dönthet a képkészítésről

A közvetlen API mellett a Pydantic AI ügynökei is hozzáférhetnek képgeneráláshoz az ImageGeneration képességen keresztül. Ebben az esetben az alkalmazás fejlesztője meghatározhatja, mikor induljon a generálás, vagy átadhatja a döntést az ügynöknek.

A létrehozott kép az ügynök futásának üzenetei között, eszközeredményként jelenik meg. Így a modell a későbbi lépésekben tovább dolgozhat vele, például alternatív szöveget írhat hozzá. A Pydantic AI lehetővé teszi azt is, hogy a fejlesztő saját eszközbe csomagolja a képgenerátort, és szöveges, valamint bináris tartalmat adjon vissza ugyanabban az eredményben.

Az ImageGeneration használhat natív képgenerálást, ha az ügynök modellje támogatja azt, vagy a fejlesztő által megadott helyi implementációt. A dokumentáció szerint a „helyi” implementáció az alkalmazásban működő eszközt jelenti, a generátor azonban továbbra is távoli képszolgáltatót hív. Ez a mechanizmus a modellek képességei alapján választ tartalékutat, és nem automatikus szolgáltatóváltás sikertelen kérés után.

Kevesebb illesztőkód, közös beállítások

A Pydantic szerint az új megoldás egyik előnye, hogy a szolgáltatók beállítása, a kérések leképezése és a képek dekódolása közös eredménytípuson keresztül történik. Az olyan beállítások, mint a méretek és a képarány, egységes felületen érhetők el, miközben a szolgáltatóspecifikus vezérlők megőrzik saját előtagjukat.

Az adapterek ellenőrzik a támogatott geometriát, és jelzik, ha egy beállítást a szolgáltató figyelmen kívül hagy vagy felülír. A szolgáltatók saját korlátai továbbra is érvényesek. Az egységes interfész segítségével másik modell kipróbálásakor az alkalmazás többi részét nem kell átírni az eltérő válaszformátum miatt.

A képek ügynökbemenetté vagy eszközeredménnyé alakíthatók. A Pydantic AI Harness médiakülsősítési funkciója a nagy tartalmakat ki tudja venni a tartósan tárolt üzenettörténetből, de a képgenerálás önmagában nem menti el automatikusan a fájlokat. A generátor OpenTelemetry-instrumentációt is kínál, így a hívások az ügynök- és eszköztevékenységekkel együtt követhetők a Logfire-ben.

A fejlesztők számára ez közös Pythonos felületet jelent több képszolgáltatóhoz, valamint egyszerűbb integrációt az ügynökökkel. A funkció a Pydantic közlése szerint felhasználói visszajelzések nyomán készült, az eredeti pull requestet Egon Ferri készítette.

Kapcsolódó hírek

A Pydantic AI már Jevvel is osztályozza az ügynökök döntéseit
Fejlesztőknek2026. szeptember 29. 11:00

A Pydantic AI már Jevvel is osztályozza az ügynökök döntéseit

A Pydantic AI 2.50.0 támogatja a TypeSafe Jev döntési modelljét, amely szöveges válaszok generálása helyett előre meghatározott kérdésekre ad típusos válaszokat. A…

A Pydantic AI már Jevvel is megmutatja, hogyan döntött az ügynök
Fejlesztőknek2026. szeptember 29. 11:00

A Pydantic AI már Jevvel is megmutatja, hogyan döntött az ügynök

A Pydantic AI 2.50.0 támogatja a TypeSafe Jev döntési modelljét, amely szövegből strukturált válaszokat választ ki generált szöveg nélkül. A Pydantic Logfire új nézete…

A Picsart közvetlenül a Google Gemini beszélgetéseibe költözött
Termékek és eszközök2026. szeptember 23. 16:57

A Picsart közvetlenül a Google Gemini beszélgetéseibe költözött

A Picsart csatlakoztatható alkalmazásként megjelent a Google Geminiben, így a felhasználók külön szerkesztő megnyitása nélkül készíthetnek és alakíthatnak át vizuális…