← Nieuwste papers
🤖 AI

Agentic Observability: Automated Alert Triage for Adobe E-Commerce

Dit artikel presenteert een agentisch observabiliteitsframework dat is uitgerold binnen de e-commerce-infrastructuur van Adobe en dat autonoom alert-triage uitvoert met behulp van een ReAct-paradigma, waarbij een reductie van 90% in de gemiddelde tijd tot inzicht wordt bereikt terwijl de diagnostische nauwkeurigheid behouden blijft door middel van dynamische loganalyse en contextbewuste actieplanning.

Oorspronkelijke auteurs: Aprameya Bharadwaj, Kyle Tu

Gepubliceerd 2026-02-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Aprameya Bharadwaj, Kyle Tu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een enorme, razendsnelle e-commerce winkel voor (zoals degene die Adobe beheert) als een gigantische, bruisende stad. Deze stad bestaat uit duizenden kleine, onderling verbonden gebouwen (microservices) die constant met elkaar praten om bestellingen te verwerken, abonnementen te beheren en producten weer te geven.

In deze stad gaat er de hele tijd wel iets mis. Een leiding springt, een verkeerslicht hapert of de stroom knippert even. In de oude dagen, wanneer er een alarm afging, moest een menselijke "brandweerman" (een engineer):

  1. Naar het alarm te rennen.
  2. Een kaart te pakken (logs).
  3. Naar vijf verschillende gebouwen te rennen om hun status te controleren.
  4. De bibliotheek te bellen om de handleiding voor dat specifieke gebouw op te zoeken.
  5. Eindelijk uit te vogelen wat er kapot is en hoe het te repareren.

Dit proces nam een lange tijd in beslag (ongeveer 18 tot 33 minuten), en de brandweerman werd vaak overweldigd omdat hij te veel kaarten en gereedschappen tegelijk moest hanteren.

De Nieuwe Oplossing: Het "Superdetective"-team

Het paper introduceert een nieuw systeem genaamd Agentic Observability. Zie dit niet als één robot, maar als een gespecialiseerd detective-team dat direct in actie komt zodra er een alarm afgaat. Ze wachten niet tot een mens hen vertelt wat ze moeten doen; ze springen direct in actie.

Hier is hoe dit team is gestructureerd, met behulp van een eenvoudige analogie:

  • De "Verkenner" (Splunk Agent): Zodra het alarm afgaat, rent deze agent naar de scène. Hij pakt de specifieke "foto's van de plaats delict" (logs) van de exacte locatie waar de fout is opgetreden. Hij filtert de ruis weg en vindt de specifieke aanwijzingen (foutmeldingen) die er toe doen.
  • De "Detective" (Tools Agent): Dit is het brein van de operatie. Hij kijkt naar de aanwijzingen die de Verkenner heeft gevonden. Hij vraat: "Hebben we net de loodgieterswerkzaamheden aangepast? Is het elektriciteitsnet aan het haperen?" Hij raadpleegt de blauwdrukken van de stad (runbooks) en de geschiedenis van recente wijzigingen (code deployments) om te achterhalen waarom dit is gebeurd. Vervolgens maakt hij een stappenplan om het op te lossen.
  • De "Kwaliteitscontroleur" (Reflection Agent): Voordat het team een rapport naar de menselijke baas stuurt, controleert deze agent het werk. Hij vraagt zich af: "Hebben we iets gemist? Is deze uitleg logisch? Is de oplossing veilig?" Als het team niet 100% zeker is, stoppen ze na een paar pogingen en zeggen ze tegen de mens: "Dit is ons beste vermoeden, maar we hebben uw hulp nodig."

Hoe het in de praktieve werkt

Het paper testte dit team op een specifiek probleem: Content Validatie Fouten. Stel je een scenario voor waarin een productbeschrijving op de website een typefout of een defect formaat heeft. In het oude systeem moest een mens handmatig door duizenden regels tekst zoeken om de typefout te vinden, te identificeren in welke taalversie deze zat, en het vervolgens te repareren. Dit duurde ongeveer 13 minuten per fout.

Met dit nieuwe AI-team:

  1. Het alarm gaat af.
  2. De Verkenner haalt direct het specifieke logbestand op dat de gebroken tekst laat zien.
  3. De Detective ontdekt precies welk product en welke taalversie kapot is en vindt het exacte regelnummer van de fout.
  4. De Kwaliteitscontroleur controleert de bevindingen.
  5. Het team stuurt een bericht naar de menselijke engineer: "De fout zit in de 'Summer Sale' banner voor de Franse versie, regel 42. Hier is de oplossing."

De menselijke engineer hoeft alleen maar op "toepassen" te klikken om het te herstellen. Het hele proces duurde voor het AI-team ongeveer 1,8 minuut.

De Resultaten

Het paper beweert dat dit nieuwe systeem een game-changer is om drie belangrijke redenen:

  1. Snelheid: Het verminderde de tijd om het probleem te vinden (Mean Time to Insight) met 90%. In plaats van 18 minuten te wachten, komt het antwoord in ongeveer 2 minuten.
  2. Nauwkeurigheid: Het AI-team was net zo goed in het vinden van de juiste oorzaak als de ervaren menselijke engineers (ongeveer 88% nauwkeurigheid), maar dan veel sneller en consistenter.
  3. Minder werk voor mensen: Het automatiseerde ongeveer 65% tot 75% van de stappen die mensen voorheen handmatig moesten uitvoeren. Dit betekent dat engineers minder tijd besteden aan het zoeken naar aanwijzingen en meer tijd aan het daadwerkelijk repareren van de stad.

De Keerzijde

Het paper is eerlijk over de beperkingen. Het "Superdetective"-team is slechts zo goed als de informatie waar het toegang toe heeft.

  • Als de "telefoonlijnen" (API's) verstopt raken omdat er te veel alarmen tegelijk afgaan, kan het team iets trager worden.
  • Het team heeft mensen nodig om het de regels te leren (runbooks) voor nieuwe soorten gebouwen. Het kan de regels niet zelf uitvinden; het volgt simpelweg de regels die het heeft gekregen.
  • Voor gevaarlijke reparaties (zoals het uitschakelen van een hoofdschakelaar) moet een mens nog steeds de definitieve "ok" geven om de veiligheid te garanderen.

Samenvatting

Kortom, dit paper beschrijft een systeem dat reactieve monitoring (wachten tot een mens uitzoekt wat er mis is) verandert in proactief redeneren (een AI-team dat onmiddellijk onderzoek doet, redeneert en een oplossing voorstelt op het moment dat een alarm afgaat). Het verschuift de rol van de mens van "detective" naar "supervisor", waardoor de onderneming sneller kan herstellen van storingen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →