Az Amazon grafikus digitális ikerrel keresné a hálózati hibák okát

Az Amazon Science olyan hálózati digitális ikret mutatott be, amely grafként ábrázolja az eszközöket, kapcsolatokat, riasztásokat és teljesítménymutatókat. A vállalat szerint az erre épülő MI-ügynöki rendszer percek alatt szűkítheti le egy összetett hiba lehetséges okait.
- Az Amazon Science hálózati digitális ikret épít gráfstruktúrára.
- A rendszer eszközöket, kapcsolatokat, riasztásokat és teljesítménymutatókat egyesít.
- A cascaded elemzés három szakaszban szűkíti a lehetséges gyökérokokat.
- Az Amazon szerint a módszert az NTT DOCOMO-val kereskedelmi hálózaton is bemutatták.
- A cél a többórás vagy többnapos hibakeresés percekre rövidítése.
A hálózatból folyamatosan frissülő digitális iker készül
Az Amazon Science október 1-jén közzétett írása szerint a hálózatok természetüknél fogva gráfként írhatók le. A csomópontok lehetnek például eszközök, az élek pedig a kapcsolatok, a nyitott kommunikációs csatornák vagy a szolgáltatásfüggőségek. Egy ilyen szerkezet megőrzi, hogy mi mihez kapcsolódik, és hogyan terjedhet a hatás a rendszerben.
A megközelítés középpontjában egy folyamatosan szinkronizált gráf áll. Ebben a csúcsok az eszközöket és azok attribútumait, az élek pedig a kapcsolatokat jelölik. A rendszer több hálózati forrásból fogad függőségeket, élő riasztásokat és teljesítménymutatókat, majd ezeket egy topológiatudatos adatszerkezetben egyesíti. Az Amazon ezt a fizikai vagy szoftveresen definiált hálózat digitális ikrének nevezi.
A vállalat leírása szerint a gráfok használata a hálózati topológia egyszerű modellezésétől a szemantikai és ok-okozati kapcsolatok kezeléséig fejlődött. A tudásgráfok és ontológiák például olyan fogalmakat is géppel értelmezhetővé tesznek, mint a cella, a szolgáltatási szint megsértése vagy az eszkalációs eljárás.
Három lépésben szűkítik a lehetséges okokat
Az Amazon megoldása egymásra épülő gráfalgoritmusokkal dolgozik. Az első szakaszban a rendszer a kapcsolatok száma és erőssége alapján megkeresi a topológia leginkább összekapcsolt részeit. Ha egy hiba miatt a hálózat több, egymástól elváló részgráfra szakad, az elemzés a határ menti csomópontokra összpontosíthat. Ezzel a vizsgált jelöltek száma az Amazon példája szerint több ezer csomópontról több százra csökkenhet.
A második szakaszban közösségfelismerő algoritmusok, köztük a Louvain és a címketerjesztéses eljárás, csoportosítják az egymással gyakran kommunikáló vagy közös függőségekkel rendelkező csomópontokat. Így elkülöníthetők az egyetlen klasztert érintő hibák és azok, amelyek klaszterhatárokon keresztül terjednek. A jelöltek száma ekkor több százról több tucatnyira szűkülhet.
A harmadik szakaszban központiságot mérő algoritmusok rangsorolják a lehetséges gyökérokokat. A személyre szabott PageRank a riasztást kibocsátó csomópontokból indítja a gráfbejárást, a riasztásviszonyított fokszám csak a riasztott csomópontokhoz vezető éleket számolja, a riasztásviszonyított közelség pedig a hibacsoporthoz legközelebb eső csomópontokat emeli ki. Az algoritmusok kiválasztását az érintett részgráf szerkezete, például a fokszámeloszlás és az átmérő alapján végzi az ügynöki réteg.
A cél a többórás hibakeresés lerövidítése
Az Amazon Science szerint összetett, többrétegű hálózati hibák elhárítása a hagyományos hálózati műveleti központokban átlagosan négy-öt órát vehet igénybe, szélsőséges esetben pedig napokig is tarthat. A nehézséget a több száz riasztás, konfigurációs fájl és telemetriai adat egyidejű értelmezése jelenti több ezer csomóponton.
A hagyományos időbeli korreláció azt feltételezi, hogy ha egy riasztás megelőz egy másikat, akkor az első okozta a másodikat. Az Amazon szerint ez összetett topológiákban félrevezető lehet, mivel a hibák több párhuzamos útvonalon terjedhetnek, a lekérdezési időközök bizonytalanná tehetik az időzítést, és a valódi gyökérok akár riasztást sem generálhat.
A vállalat az NTT DOCOMO-val együtt az idei Mobile World Conference rendezvényen mutatta be a módszert, és közlése szerint kereskedelmi hálózatokon percek alatt végzett gyökérok-elemzést. A megközelítés a gráfmodellezést, a gráfközpontú elemzést és az ügynöki vezérlést kapcsolja össze. A felhasználók számára ez elsősorban gyorsabb hibafeltárást jelenthet, míg az üzemeltetőknek a különböző hálózati rétegekből származó adatok egységes elemzését kínálja.
Amazon Science: Graph-centric agentic intelligence


