A LangChain szerint az OpenAI zárt ügynöki architektúrára fogad

A GPTs és az Assistants API ugyanarra az ügynöki működési modellre épül a LangChain értelmezése szerint. A fejlesztői platform úgy látja, hogy az OpenAI arra fogad, az ilyen rendszerek megbízhatósági problémái idővel eltűnnek.
- A GPTs és az Assistants API hasonló ügynöki architektúrát képvisel.
- Az ügynökök a modell által meghatározott műveleteken és ismétlődő ciklusokon alapulnak.
- A LangChain szerint az ilyen rendszerek még nem elég megbízhatók komoly alkalmazásokhoz.
- Az összetett láncok és állapotgépek nagyobb fejlesztői irányítást kínálnak.
- A LangChain az OpenGPTs projektet nyílt és szerkeszthető alternatívaként említi.
Két termék, hasonló működési modell
Harrison Chase, a LangChain szerzője szerint az OpenAI fejlesztői eseményén bemutatott két legfontosabb újdonság, a GPTs és az Assistants API ugyanazt a célt szolgálja. Mindkettő egy ügynöki, zárt kognitív architektúrát képvisel, miközben eltérő felhasználói körnek szól.
A GPTs segítségével jórészt kódolás nélkül lehet saját GPT-t létrehozni. A készítők egyedi utasításokat, tudást és funkciókat adhatnak hozzá. A LangChain szerint ez az OpenAI második kísérlete egyfajta alkalmazásáruház kialakítására a korábbi Plugins után, amelyről Sam Altman azt mondta, hogy nem talált termékpiaci illeszkedést.
Az Assistants API fejlesztőknek szánt változat. Állapottartó API-ként tárolhatja a korábbi üzeneteket, fájlok tölthetők fel hozzá, elérhető benne a beépített code interpreter, és funkcióhívással külső eszközök vezérlésére is használható.
Mit jelent a kognitív architektúra?
Chase a kifejezést egy nagy nyelvi modellre épülő alkalmazás vezérlésének és összehangolásának leírására használja. Szerinte az érdekes LLM-alkalmazások kontextusérzékeny következtetési rendszerek. Két alapvető kérdésük van: hogyan jut el a megfelelő kontextus az alkalmazáshoz, és hogyan következtet a rendszer.
A LangChain több szintet különböztet meg. A legegyszerűbb megoldás egyetlen LLM-hívás, ezt követheti több hívás lánca. Ennél összetettebb, amikor a modell választja ki a használni kívánt eszközt, keresőt vagy promptot. Az állapotgépek előre meghatározott lépések között irányítják a modellt, az ügynökök esetében viszont az átmeneti lehetőségeket nagyrészt maga a nyelvi modell határozza meg.
Az ügynöki működés egy ismétlődő ciklusként írható le. A modell a felhasználói bemenet alapján vagy választ ad, vagy műveletet kezdeményez. Művelet esetén a rendszer végrehajtja azt, majd az eredményt visszaadja a modellnek. Ez az eredmény bekerül a promptba, és a modell újra lefut, amíg elkészül a válasz.
A megbízhatóság és az irányítás kérdése
Az Assistants API és a GPTs a LangChain szerint ebbe az ügynöki architektúrába illeszkedik. A GPTs esetében a felhasználói felületen egy betöltést jelző elem mutatja, amikor a rendszer eszközt hív, például keresést vagy code interprettert használ. Az Assistants API hasonlóan működik, de a külső eszközök meghívását a fejlesztő végzi el a kliensoldalon, az API pedig megadja a szükséges eszközt és a bemenetet.
Chase úgy látja, hogy ez a megközelítés még nem elég megbízható komoly alkalmazásokhoz. Az OpenAI ugyanakkor jó helyzetben van a problémák kezeléséhez, mert a saját modelljét fejleszti. A szerző szerint a vállalat arra fogad, hogy az ügynöki rendszereket sújtó gondok idővel megszűnnek.
A LangChain ezzel szemben azt vallja, hogy a cégeknek ellenőrzést kell kapniuk a saját kognitív architektúrájuk felett. Példaként az OpenGPTs projektet említi, amely az Assistants API és a GPTs nyílt, szerkeszthető és konfigurálható változataként mutatja be.
Miért lehet fontos a fejlesztőknek?
A LangChain szerint a hasznos autonóm rendszerek jelentős része nem tisztán ügynöki felépítésű. Egyesek összetett lépéssorozatokat, mások állapotgépeket használnak. A bejegyzés példaként a GPT-Researchert és a Sweep.dev-et említi.
A GPT-Researcher először rész-kérdéseket készít, majd linkeket gyűjt, összefoglalja azokat, végül kutatási jelentéssé állítja össze az eredményeket. A Sweep.dev előbb keresést végez, tervet készít és végrehajtja azt, majd ellenőrzi az eredményt. Siker esetén pull requestet készít, hiba esetén új tervet generál.
A LangChain érvelése szerint az előre meghatározott láncok és állapotgépek legfontosabb előnye a nagyobb irányítás. A fejlesztők így az adott problémához választhatják ki a megfelelő architektúrát, ahelyett hogy minden feladatnál ugyanarra az ügynöki működésre támaszkodnának.
LangChain: OpenAI's Bet on a Cognitive Architecture

