A LangSmith a klinikai ellenőrzést újrahasznosítható tesztekké alakítja

A LangChain szerint a LangSmith az egészségügyi AI-rendszerek klinikai ellenőrzését újrahasznosítható adatkészletekké, értékelőkké és kiadási ellenőrzésekké alakítja. Az Abridge a közlemény szerint egy-két hónapról néhány napra rövidítette kiadási ciklusát, az Included Health pedig a rendszer indulása után 75 százalékos növekedést látott a beszélgetésekben.
- A LangSmith a klinikai értékeléseket címkézett adatkészletekké és újrahasznosítható értékelőkké alakítja.
- Az Abridge kiadási ciklusa egy-két hónapról néhány napra rövidült a vállalat szerint.
- Az Included Health Dot rendszere a magas kockázatú helyzetek több mint 99 százalékát helyesen jelölte meg.
- Az Included Healthnél 75 százalékkal nőtt a beszélgetésekben való részvétel az indulást követően.
- A klinikai ellenőrzések a kiadások előtti tesztelésbe és a folyamatos éles értékelésbe is bekerülnek.
A klinikai szakértelem szűk keresztmetszet
A LangChain szeptember 22-i blogbejegyzése szerint az egészségügyi AI-rendszerek értékelésében azok szakértelme a legfontosabb, akiknek az idejét ezek a rendszerek védeni hivatottak. Egy klinikus gyorsan meg tudja állapítani például, hogy egy generált jegyzet megfelelően tulajdonítja-e a tünetet a betegnek, vagy a rendszer a megfelelő ellátási szintet javasolta-e. Több ezer találkozás esetén azonban ezt a munkát a szakemberek nem tudják korlátlanul elvégezni.
A LangChain által bemutatott megközelítésben a klinikai felülvizsgálatot infrastruktúraként kezelik. A szakértői döntések címkézett adatkészletekké, kalibrált értékelőkké és automatizált kiadási ellenőrzésekké alakulnak. A cél a vállalat szerint nem az emberi ítélet kiváltása, hanem az, hogy egy-egy szakértői értékelés a későbbi tesztekben és kiadásokban is felhasználható legyen.
Eltérő egészségügyi feladatok, hasonló ellenőrzési igény
Az Included Health a Dot nevű, LangGraphra és Deep Agentsre épülő AI-útmutatót fejlesztette. A rendszer a tagok nehezen értelmezhető igényeit dolgozza fel, válaszol a fedezettel és számlázással kapcsolatos kérdésekre, megfelelő ellátási helyre irányítja őket, és vészhelyzeteket is felismer. Az értékelés során azt is vizsgálják, hogy a Dot figyelembe vette-e a beszélgetés teljes előzményét, és biztonságos következő lépést javasolt-e.
Az Abridge a beteg és a klinikus beszélgetéséből készít klinikai jegyzetet. A páciens beleegyezésével rögzített találkozásból olyan dokumentum készül, amely bekerülhet a hosszú távú egészségügyi nyilvántartásba, és a számlázást is támogathatja. Emiatt különösen fontos, hogy a jegyzet pontosan jelezze, ki mit mondott. Kockázatot jelenthet az is, ha a rendszer olyan gyógyszert vagy adagolást ír a nyilvántartásba, amelyről nem volt szó.
Az Abridge megfogalmazása szerint „a bizalom cseppekben épül, és vödrökben vész el”. A LangChain szerint a két szervezet eltérő termékeken dolgozik, de ugyanazzal a korláttal szembesül: a pontosságot a mérnöki csapaton kívüli szakemberek ítélik meg, akiknek az ideje szűkös erőforrás.
Címkézett adatokból kalibrált értékelők
Az Abridge a klinikusoktól és felhasználóktól érkező visszajelzések alapján azonosítja a gyakori vagy súlyos hibákat. Ezeket többek között pontosság, megfelelőség, stílus és teljesség szerint csoportosítja, majd külön értékelőt készít az egyes hibamódokra. Így a rendszer nem egyetlen általános minősítést ad, hanem konkrét kockázatokat vizsgál.
A vállalat referencia nélküli értékelőket használ, amelyek közvetlenül a forrásbeszélgetéshez viszonyítják a jegyzetet. Emellett referenciaalapú értékelőket is alkalmaz, amelyek válogatott példák segítségével egy-egy orvosi szakterület sajátosságait és árnyalatait is figyelembe vehetik. A két módszer együtt szélesebb lefedettséget és pontosabb, szakterülethez igazított ellenőrzést tesz lehetővé.
A LangSmith Align Evaluator felületet ad az értékelők és a klinikai annotációk összevetéséhez, valamint az eltérések vizsgálatához. Az Abridge az annotátoroktól azt is kéri, hogy helyes kimenet esetén magyarázzák meg döntésüket. Ezek a magyarázatok segítenek az ellentmondások feloldásában és annak ellenőrzésében, hogy a címkék valóban alapos felülvizsgálaton alapulnak.
Folyamatos ellenőrzés a működésben
Az Included Health a beszélgetéseket LangSmith-annotációs sorba küldi. A klinikai felülvizsgálók azt értékelik, hogy a Dot a megfelelő ellátási helyre irányította-e a tagot, megfelelően működtek-e a vészhelyzeti korlátok, és szükség van-e további utánkövetésre. A döntések strukturált címkékké válnak, amelyeket a vállalat adattárházába exportálnak. A LangChain szerint ezeket az adatokat az adattudományi csapat működési műszerfalak készítésére és a Dot működését irányító készségdefiníciók fejlesztésére használja.
A vállalat közlése szerint a Dot indulása után 75 százalékkal nőtt a beszélgetésekben való részvétel, a rendszer pedig a magas kockázatú helyzetek több mint 99 százalékát helyesen jelölte meg. Az Abridge esetében a modellváltoztatások több lépcsőn mennek át: offline értékeléseken, korábbi találkozásokon végzett visszatesztelésen, korlátozott A/B-teszten, teljes kiadáson, majd folyamatos éles környezetbeli ellenőrzésen.
A megközelítés a felhasználók számára azt jelentheti, hogy az egészségügyi AI-rendszerek hibáit és biztonsági viselkedését a vállalatok ismétlődő, dokumentált tesztekkel követik. A LangChain ugyanakkor az értékelések aktuális kihívásai között említi a védett egészségügyi adatok kezelését és a rendszer viselkedésének időbeli eltolódását is.
LangChain: The Reliability Layer for Healthcare AI: Common LangSmith Use Cases


