← Nieuwste papers
🤖 machine learning

Mitigating The Effect of Class Imbalance in Data with Hierarchical and Dependable Structure

Dit artikel stelt een Hierarchy-Aware RoBERTa-framework voor dat leerbare ouderklasse-embeddings gebruikt om klassenonbalans bij CWE-kwetsbaarheidsclassificatie effectief te mitigeren, waarbij wordt aangetoond dat het integreren van hiërarchische structuren traditionele oversamplingtechnieken die vaak de modelprestaties verslechteren, overtreft.

Oorspronkelijke auteurs: Bipin Chhetri, Deepika Giri, Avishek Kadel, Rabin Kumar Karki, Akbar Siami Namin

Gepubliceerd 2026-07-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bipin Chhetri, Deepika Giri, Avishek Kadel, Rabin Kumar Karki, Akbar Siami Namin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een enorme stapel aanwijzingen over computerbeveiligingslekken probeert te ordenen. Deze lekken zijn georganiseerd in een gigantische stamboom genaamd de Common Weakness Enumeration (CWE). Aan de top van de boom staan brede categorieën zoals "Base" (het grote plaatje), en naarmate je lager in de boom komt, worden de takken specifieker, eindigend in kleine, zeldzame blaadjes zoals "Compound" of "Pillar".

Het probleem? De bewijszak van de detective is totaal uit balans. Er zijn honderden aanwijzingen voor de grote, veelvoorkomende categorieën, maar slechts een handvol voor de zeldzame, specifieke categorieën. Het is alsof je een bibliotheek hebt met 500 boeken over "Fruit" maar slechts 5 boeken over "Dragonfruit". Als je een computer probeert te leren dit te sorteren, wordt hij lui en gokt hij steeds "Fruit", omdat dat is wat hij het vaakst ziet.

Het "Nepte Aanwijzing" Experiment (Wat niet werkte)

Om dit op te lossen, probeerden veel experts een truc genaamd oversampling. Ze namen de weinige zeldzame aanwijzingen en probeerden nieuwe, nep aanwijzingen te verzinnen om de aantallen gelijk te trekken. Ze gebruikten twee populaire methoden: SMOTE en ADASYN.

Denk aan een chef die probeert een soep op smaak te brengen alsof er meer zeldzame kruiden in zitten. In plaats van meer echte kruiden te vinden, nemen ze twee bestaande korrels kruiden, mengen deze met elkaar en hopen dat de nieuwe mix authentiek smaakt.

Het artikel testte dit op verschillende soorten "detectives" (computermodellen):

  • De Ouderwetse Detectives (Random Forest en SVM): Deze modellen zijn als detectives die kijken naar eenvoudige lijsten met feiten. Wanneer ze gevoed werden met de nep gemengde kruiden, kregen ze een kleine boost. Hun nauwkeurigheid ging van 0,65 naar 0,69 voor de Random Forest, en de Support Vector Machine (SVM) bleef stabiel rond de 0,71–0,72. Het hielp een beetje, maar niet veel.
  • De High-Tech Detectives (CNN en BiGRU): Dit zijn slimmere, deep-learning modellen die begrijpen hoe woorden samenstromen. Toen de onderzoekers hen voedden met de nep gemengde kruiden, liepen de resultaten uit op een ramp. De nauwkeurigheid van de CNN stortte in van 0,71 naar 0,55 met SMOTE en 0,51 met ADASYN. De BiGRU daalde van 0,70 naar 0,53 en 0,44.

Waarom? Het artikel betoogt dat deze high-tech modellen als chefs zijn die het verschil kunnen proeven tussen echte kruiden en een nep mengsel. Wanneer je twee verschillende computer-"woorden" bij elkaar mixt om een nep woord te maken, verbreek je de regels van de stamboom. Je creëert misschien een "Variant" die beweert een kind te zijn van een "Base", maar de nep mix houdt die ouder-kind relatie niet in acht. Het is alsof je een "Dragonfruit" probeert te maken door een "Appel" en een "Banaan" te mengen. Het resultaat is geen Dragonfruit; het is een verwarrende bende die de detective in verwarring brengt.

De "Stamboom" Oplossing (Wat wél werkte)

In plaats van nep aanwijzingen te maken, bouwden de auteurs een nieuwe detective genaamd Hierarchy-Aware RoBERTa.

Stel je voor dat deze detective een speciale kaart van de stamboom in zijn zak heeft. Ze lezen niet alleen de aanwijzing; ze controleren ook de kaart om te zien: "Wacht even, als deze aanwijzing over een 'Base' zwakte gaat, dan moet het antwoord gerelateerd zijn aan die ouder."

Het model werkt als volgt:

  1. Het leest de tekstuele beschrijving van de fout (met behulp van een krachtig hulpmiddel genaamd SecureBERT).
  2. Het pakt een "Parent ID" uit de stamboom (zoals weten dat de aanwijzing bij de "Base" tak hoort).
  3. Het combineert de tekstlezing met de locatie op de kaart om tot een definitieve gok te komen.

De Resultaten:
Deze nieuwe detective had helemaal geen nep aanwijzingen nodig. Het behaalde een gewogen F1-score van 0,76 zonder enige data-augmentatie.

  • Vergelijk dit met het standaard BERT model, dat een score van 0,74 behaalde.
  • Het belangrijkste is: kijk naar de zeldzame "Class" categorie. Het standaard BERT model behaalde voor deze zeldzame groep slechts een F1-score van 0,49. De nieuwe Hierarchy-Aware model verhoogde dit naar 0,60.

De Kern van het Verhaal

Het artikel suggereert dat wanneer je een gestructureerde stamboom van data hebt, het proberen te "faken" van meer data door bestaande stukjes te mengen (oversampling) een slecht idee is. Het werkt redelijk voor eenvoudige modellen, maar breekt de meer geavanceerde modellen.

In plaats daarvan is de beste aanpak om het model vanaf het begin de stamboomstructuur te leren respecteren. Door het model een "kaart" te geven van de ouder-kind relaties, kan het de zeldzame, lastige gevallen veel beter begrijpen dan wanneer je de trainingsdata simpelweg volstouwt met synthetische ruis.

De auteurs merken echter voorzichtig op dat zelfs hun beste detective nog steeds worstelt met de meest zeldzame categorieën, zoals "Compound" en "Pillar", die respectievelijk slechts 8 en 5 monsters hadden. Voor deze extreem zeldzame groepen bleef de F1-score 0,00 over alle modellen heen, wat suggereert dat wanneer er bijna geen data is, zelfs een stamboomkaart niet genoeg is om het mysterie op te lossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →