A Bayer 135 millió vektorral épített vállalati keresőt

A Bayer belső myGenAssist platformja havonta több mint 1,5 millió üzenetet dolgoz fel, miközben több mint 450 ezer feltöltött dokumentumot kezel. A gyógyszeripari és agrártechnológiai vállalat a Qdrant vektoros keresőjével épített ki olyan rendszert, amely a szöveges dokumentumok mellett képek, hang- és videófájlok keresését is támogatja.
- A Bayer myGenAssist platformja havonta több mint 1,5 millió üzenetet kezel.
- A rendszer több mint 450 ezer dokumentumot dolgoz fel.
- A Qdrant-fürt nagyjából 135 millió pontot tárol hét gyűjteményben.
- A keresés szövegek, képek, hang- és videófájlok között is működik.
- A Bayer a kulcsszavas és szemantikus keresést kombináló hibrid megoldást használja.
Három hónap alatt indult el a belső AI-platform
A Bayer egészségügyi és táplálkozási területen működő globális élettudományi vállalat. A cég szerint a mesterséges intelligencia a szervezet egészében használható eszköz, többek között a munkatársak termelékenységének javítására, a terméshozamok előrejelzésére és a gyógyszerkutatás gyorsítására.
Miután a ChatGPT beszélgetős felülete szélesebb körben is elérhetővé tette az AI használatát, a Bayer gyorsan lépett. Hooman Sedghamiz, a vállalat Precision Medicine & Insights részlegének AI és gépi tanulási vezetője szerint csapata három hónapon belül létrehozta a myGenAssist belső generatív AI-platformot.
A rendszer kezdetben ezer felhasználóval és gyógyszerkutatási célú természetesnyelv-feldolgozási alkalmazásokkal indult. Többek között az amerikai Élelmiszer- és Gyógyszerügyi Hatóság, az FDA, valamint a PubMed adataira támaszkodott. A Qdrant által közölt esettanulmány szerint a platform ma már a teljes vállalatot kiszolgálja, havonta több mint 1,5 millió üzenetet dolgoz fel, és több mint 450 ezer feltöltött dokumentumot tartalmaz.
A Qdrantot a teljesítmény és a nyílt forráskód miatt választották
A Bayer első vektoros keresési prototípusa Redisre épült, de a vállalat szerint ez nem skálázódott megfelelően. A csapat több szolgáltatót vizsgált meg olyan szempontok alapján, mint az ár és teljesítmény aránya, a késleltetés, valamint a nyitottság.
A Qdrant mellett szólt, hogy nyílt forráskódú volt, ezért a Bayer gyorsan tesztelhette beszerzési akadályok nélkül. A vállalat a késleltetést is megfelelőnek találta, és figyelembe vette, hogy a rendszer Rust programozási nyelven készült. A Bayer végül ezt a megoldást választotta, és közel három éve használja.
A kezdeti, saját üzemeltetésű telepítés után az üzemeltetési teher növekedett, ahogy a felhasználói kör az ezer főtől a vállalat teljes, 116 ezer fős szervezetéig bővült. A Bayer szigorú megfelelési követelményei miatt az adatoknak a vállalat saját, tanúsított felhőjében kell maradniuk.
A cég ezért a Kubernetes-operátorra épülő Qdrant Hybrid Cloud megoldásra váltott. Ez a felállás a Bayer környezetében tartja az adatokat, miközben a fürt kezelésének jelentős részét leveszi a vállalat kisebb csapatának válláról. A Qdrant szerint a Bayer több mint két éve használja ezt a hibrid modellt.
135 millió vektor, többféle adat és hibrid keresés
A telepítés mögött egy négycsomópontos Qdrant Hybrid Cloud-fürt működik. A rendszer nagyjából 135 millió pontot tárol hét gyűjteményben. A legnagyobb gyűjtemény, a felhasználói fájlok tárhelye, 91 millió pontot tartalmaz sűrű és ritka vektorok kombinációjaként.
A terhelést a környező adatfeldolgozási folyamatok is növelik. A felhasználók gyakran újra feltöltik vagy módosítják ugyanazokat a dokumentumokat, ezért a vektorokat folyamatosan szinkronban kell tartani a forrásfájlokkal. A vektorizálás előtti dokumentumfeldolgozás szintén jelentős terhelést okoz, miközben a vektortárat a változó dokumentumokkal is konzisztensen kell tartani.
A Bayer a szöveges dokumentumokon túl képekre, orvosi felvételekre, molekuláris adatbázisokra, hanganyagokra és videókra is kiterjeszti a keresést. Tudományos PDF-ek esetében egy látásalapú modell leírja az ábrákat, kiolvassa a rajtuk szereplő szöveget, majd ezeket az információkat a dokumentum szövegébe illeszti. A hang- és videofelvételeket feldarabolják, Whisperrel átírják, majd a szöveges dokumentumok mellett vektorizálják.
A felhasználók számára a gyorsaság és a válaszok megalapozottsága a legfontosabb. A Bayer tíz másodpercen belüli válaszidőt vár el. A vállalat szerint a kizárólag szemantikus keresés két éve már nem volt elegendő, ezért a kulcsszavas és szemantikus keresést egyesítő hibrid keresés vált a rendszer fontos elemévé. Ez segít abban, hogy a nyelvi modellek és az ügynökalapú alkalmazások relevánsabb vállalati kontextusra támaszkodjanak, és csökkenjen a hallucinációk kockázata.
A rendszer az ügynökalapú alkalmazások felé tart
A Bayer architektúrája a chatbot jellegű használattól az ügynökalapú alkalmazások felé mozdul. A vállalat LangGraph-alapú keretrendszeren futtat ilyen rendszereket. A Qdrant által ismertetett példában egy mély kutatási futtatás hosszú eszközhívási folyamatot indíthat, amely több száz lépésből és akár több ezer keresési lekérdezésből áll.
Ez a működés a lekérdezésenkénti késleltetést még fontosabbá teszi, mivel az egyes keresésekre fordított idő összeadódik. A Bayer esetében ezért a keresési infrastruktúra egyszerre szolgálja a megfelelési követelményeket, a vállalati adatokkal megalapozott válaszokat, valamint az egyre összetettebb AI-alkalmazások működését.

