A Datadog egy 9 milliárd paraméteres modellt tanított riasztások vizsgálatára

A Datadog egy kisebb, célfeladatra finomhangolt Qwen3.5-9B modellel vizsgálja, hogy egy friss változtatás okozhatta-e a production riasztást. A cég szerint a modell a GLM-5.3 visszahívási arányának 87 százalékát érte el, miközben a vizsgálat önálló hosztolásának költsége körülbelül hússzor alacsonyabb.
- A Datadog Qwen3.5-9B modellt finomhangolt production riasztások vizsgálatára.
- A modell a GLM-5.3 visszahívási arányának 87 százalékát érte el.
- A vizsgálat önálló hosztolása 0,003 dollárba került, szemben a GLM-5.3 0,06 dolláros API-költségével.
- Az adathalmaz két további kör után 100-ról 186 példára bővült.
- Egy 40 GB-os A100 GPU hetente körülbelül 100 000 vizsgálatot támogathat.
A szabályalapú keresés és az ügynöki vizsgálat között
Egy deployment, feature flag vagy konfigurációs módosítása riasztást válthat ki, annak meghatározása viszont, hogy a közelmúlt változtatásai közül melyik járulhatott hozzá leginkább a problémához, több szolgáltatáson és rendszeren átívelő vizsgálatot igényelhet.
A Datadog Change Tracking jelenleg két módon támogatja ezt a feladatot. A Relevant Changes nézet a monitor riasztási idővonalára helyezi rá a friss változtatásokat, és kiemeli a potenciálisan releváns deploymenteket, feature flageket és konfigurációs módosításokat. Az eredmények másodperceken belül megérkeznek, és a megoldás elég olcsó ahhoz, hogy az Application Performance Monitoring ügyfelei számára ingyenesen elérhető legyen. A szabályalapú visszakeresés pontossága azonban összetett incidenseknél korlátozott.
A Change Tracking adatai Model Context Protocol eszközön keresztül is használhatók az ügynöki vizsgálatokban, köztük a Datadog Bits Investigation megoldásában. A Datadog 2026 júliusi belső telemetriája szerint az eszköz hetente több ezer Bits-vizsgálathoz járul hozzá, és a Bits Investigation következtetéseinek 20 százaléka hivatkozik a Change Tracking által rögzített változtatásra.
Nagy tanármodellből kisebb, célzott modell
A Datadog szerint a promptok ismételt finomítása önmagában nem tette megbízhatóvá a Qwen3.5-9B-t. A modell gyakran túl széles körben keresett, ahelyett hogy a legígéretesebb bizonyítékokra szűkítette volna a vizsgálatot.
A cég ezért egy nagyobb tanármodell vizsgálati viselkedését próbálta átadni a kisebb diáknak. A folyamatban a GLM-5.3 ugyanazt a riasztást nyolc körben, öt eszköz használatával és 65 536 tokenes kontextusablakkal vizsgálja. Ezután rangsorolja a lehetséges változtatásokat, és bizalmi értékeket rendel hozzájuk.
A módszer alapját a Datadog az NVIDIA adatkörforgásos megközelítéséhez igazította. A tanármodell vizsgálati nyomokat generál, a sikeres példákból pedig a kisebb modellt finomhangolják. A kiválasztásnál a Bits Investigation következtetéseiből kinyert, úgynevezett proxy címkéket használnak. Ezek azt jelzik, hogy a Bits melyik változtatást társította az incidenshez, nem pedig önállóan igazolt ok-okozati kapcsolatot jelentenek.
100 példával indult, 186-ra bővült az adathalmaz
A tanármodellt minden riasztáson háromszor futtatják le. Csak azokat a példákat tartják meg, amelyekben a visszaadott változtatások egyeznek a Bits-következtetésből kinyert proxy címkékkel. Ezt a technikát elutasításos mintavételezésen alapuló finomhangolásnak nevezik.
A kezdeti adathalmazt 348, 2026. május 26. és június 24. között bekövetkezett belső incidensből állították össze. Ezekből 100 tanári vizsgálati nyomot választottak ki, mindegyiket eltérő vizsgálatból. A Datadog közlése szerint az adathalmaz előállításához nem használtak ügyféladatokat.
A Qwen3.5-9B finomhangolása 16 bites, alacsony rangú adaptációval, LoRA-val történt. Ez az összes modellparaméter helyett az adapterparaméterek egy kisebb részét módosítja, a tanítási veszteséget pedig csak a kiválasztott nyomok asszisztensi válaszaira számították.
A tanár- és a diákmodell egyaránt production környezetben fut. Ha a tanár előrejelzése egyezik a proxy címkével, a diáké viszont nem, a tanár vizsgálati nyoma új tanítási példává válik. Két további kör után az adathalmaz 100-ról 186 példára nőtt, vagyis 86 új képzési példával bővült.
Alacsonyabb költség, nagyobb lefedettség
A Datadog által közölt eredmények szerint a finomhangolt modell a GLM-5.3 visszahívási arányának 87 százalékát érte el. A Qwen3.5-9B önálló hosztolásának költsége a vizsgált telepítési feltételek mellett vizsgálatonként 0,003 dollár volt, szemben a GLM-5.3 API-használatának 0,06 dolláros költségével. Ez a cég számítása szerint hozzávetőleg húszszoros csökkenést jelent.
A Datadog szerint egyetlen, 40 GB-os A100 GPU hetente körülbelül 100 000 vizsgálatot képes kiszolgálni ezen a költségszinten. Ez elegendő a cég ügyfelei által hetente használt több millió egyedi monitor egy részének vizsgálatához. A vállalat további optimalizálásokat folytat, hogy a megközelítés a monitorok jóval nagyobb részénél is gyakorlatias legyen.
Datadog: Teaching a 9B model to investigate production alerts


