← Nieuwste papers
💻 computer science

AnoMod: A Dataset for Anomaly Detection and Root Cause Analysis in Microservice Systems

Het artikel introduceert AnoMod, een uitgebreide multimodale dataset voor microservicesystemen die bestaande hiaten aanpakt door diverse anomaliecategorieën en vijf verschillende monitoringsmodaliteiten te bieden om geavanceerd onderzoek in cross-modale anomaliedetectie en fijnmazige oorzaakanalyse mogelijk te maken.

Oorspronkelijke auteurs: Ke Ping, Hamza Bin Mazhar, Yuqing Wang, Ying Song, Mika V. Mäntylä

Gepubliceerd 2026-02-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ke Ping, Hamza Bin Mazhar, Yuqing Wang, Ying Song, Mika V. Mäntylä

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de manager bent van een enorm, druk treinstation (een Microservice Systeem). In plaats van één groot gebouw, bestaat het station uit honderden kleine, gespecialiseerde hokjes: één verkoopt kaartjes, een andere controleert ID-bewijzen, een derde regelt de bagage en een vierde beheert de dienstregelingen. Ze praten constant met elkaar om een passagier van punt A naar punt B te krijgen.

Wanneer er iets misgaat—een kaartjeskraam bevriest, de bagagescanner vertraagt, of de dienstregeling raakt corrupt—is het een nachtmerrie om uit te zoeken waarom. Is het het netwerk? Een fout in de code? Een volle database?

Dit is het probleem dat de paper AnoMod probeert op te lossen. Hier is de uitsplitsing in eenvoudige termen:

1. Het Probleem: De "Blinde Vlek" in Huidige Tools

De auteurs zeggen dat onderzoekers die proberen "slimme detectives" (AI-tools) te bouwen om deze treinstations te repareren, momenteel werken met slechte kaarten.

  • De Oude Kaarten: Bestaande datasets (verzamelingen van gegevens) kijken voornamelijk naar prestaties. Ze vertellen je of het station "traag" of "druk" is, zoals controleren of de rij bij de kaartjeskraam lang is.
  • De Ontbrekende Stukken: Ze vertellen je niet waarom de rij lang is. Is het omdat de kaartjesautomaat kapot is? Heeft de kassier een rekenfout gemaakt? Is de database zonder inkt geraakt? Ook keken de meeste oude datasets slechts naar twee of drie soorten aanwijzingen (zoals logs en snelheidscijfers), waardoor het grotere plaatje ontbrak.

2. De Oplossing: Een Nieuwe "Super-Dataset" Genoemd AnoMod

Het team heeft een nieuwe, enorme dataset gemaakt genaamd AnoMod. Beschouw dit als een "crash-test" waarbij ze twee echte, echte treinstations (SocialNetwork en TrainTicket) op zeer specifieke, realistische manieren hebben gesaboteerd, en vervolgens alles hebben vastgelegd wat er gebeurde.

Ze hebben de boel niet willekeurig gesaboteerd; ze organiseerden de "defecten" in vier duidelijke categorieën, als een checklist van een monteur:

  1. Prestatieniveau: De motor te heet laten lopen of het netwerk traag maken (zoals een verkeersopstopping).
  2. Serviceniveau: Eén hokje laten weigeren met een ander te communiceren (zoals een kapotte telefoonlijn tussen de kaartjesverkoper en de poortjes).
  3. Databaseniveau: De opslagruimte vol laten raken zodat er niets nieuws meer opgeslagen kan worden (zoals een verbindingsterminal die leegloopt).
  4. Codeniveau: Logische fouten introduceren, zoals een kassier die per ongeluk gratis kaartjes weggeeft vanwege een typefout in hun instructies.

3. De "Vijf Zintuigen" Aanpak

Het meest unieke deel van deze dataset is dat ze niet alleen de "snelheid" van het station hebben geregistreerd. Ze hebben vijf verschillende soorten gegevens (modaliteiten) gelijktijdig vastgelegd, wat een 360-graden beeld geeft:

  • Logs: Het geschreven dagboek van elke actie die de hokjes ondernamen.
  • Metrics: De snelheidsmeters en brandstofmeters (CPU, geheugengebruik).
  • Traces: Een kaart die precies laat zien welk pad een passagier door elk afzonderlijk hokje heeft afgelegd.
  • API Responses: Wat de passagier daadwerkelijk zag (Kregen ze een kaartje? Kregen ze een foutmelding?). Dit is de "gebruikerservaring".
  • Code Coverage Reports: Een speciale highlighter die precies laat zien welke regels van de instructiehandleiding van de kassier daadwerkelijk gelezen en gebruikt werden. Dit helpt om te bepalen of de fout in de code zelf zat.

4. Hoe Ze Het Deden (Het Experiment)

Om dit te bouwen, gebruikten ze een robot-tester genaamd EvoMaster.

  • Fase 1: De robot gedroeg zich als duizenden klanten die kaartjes probeerden te kopen en het systeem gebruikten om er zeker van te zijn dat alles normaal functioneerde.
  • Fase 2: Het team injecteerde de "defecten" (anomalieën) in het systeem. Ze kozen niet willekeurige hokjes; ze richtten zich op de meest kritieke onderdelen om te zien hoe het hele station reageerde.
  • Fase 3: Ze legden alle vijf de datatype-typen vast terwijl de robot bleef werken, waarbij ze de chaos in realtime vastlegden.

5. Waarom Dit Belangrijk Is

De auteurs beweren dat deze dataset een game-changer is omdat het onderzoekers in staat stelt om:

  • De verbanden te leggen: Zien hoe een kleine codefout (een typefout in de handleiding) uiteindelijk leidt tot een gebruiker die een "Systeemfout" melding ziet.
  • De grondoorzaak te vinden: In plaats van alleen te weten "het systeem is traag", kunnen ze pinpointen: "de databaseverbinding is uitgeput vanwege een specifieke codepad".
  • Betere AI te testen: Het biedt AI-onderzoekers een veel rijkere, meer realistische speeltuin om hun "slimme detectives" te trainen om deze complexe systemen automatisch te repareren.

Kortom: De paper introduceert een nieuwe, zeer gedetailleerde "plaats delict" dataset waarbij ze een microservice-systeem op vier verschillende manieren hebben gesaboteerd en het met vijf verschillende camera's hebben vastgelegd. Dit helpt toekomstige AI-tools om niet alleen te leren dat er iets mis is, maar precies wat er mis is en waar het moet worden gerepareerd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →