← Nieuwste papers
📊 statistics

Conflict inherits the frame: bin geometry and BPA construction in evidential fusion of quantised continuous evidence

Dit artikel toont aan dat bij de Dempster-Shafer evidentiële fusie van gekwantiseerde continue data de geometrie van het binning-kader conflictmaten kunstmatig verwarre het met de positie van bewijs, wat leidt tot een voorgestelde excess-conflict statistiek om deze bias te corrigeren, terwijl het onthult dat standaard combinatieregels vaak reduceren tot Bayesiaanse producten met verwaarloosbare effectiviteitsverschillen in het voorspellen van de exploitatie van softwarekwetsbaarheden.

Oorspronkelijke auteurs: Elena Udrescu, Alexandru Udrescu, Ana-Maria Suduc, Mihai Bîzoi

Gepubliceerd 2026-09-07
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Elena Udrescu, Alexandru Udrescu, Ana-Maria Suduc, Mihai Bîzoi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert te beslissen hoe gevaarlijk een softwarefout is door drie verschillende experts te raadplegen. Elke expert geeft een getal, maar ze zijn zelden het met elkaar eens. Soms noemt de één een fout een klein ongemak, terwijl een ander het een kritieke dreiging noemt. Om zin te geven aan deze onenigheid, gebruiken onderzoekers vaak een wiskundig systeem dat ontworpen is om onzekere meningen te combineren tot één duidelijker beeld. Dit systeem werkt door een continu bereik van mogelijkheden – zoals een schaal van nul tot tien – op te knippen in afzonderlijke emmers, zoals "laag", "medium", "hoog" en "kritiek". Het idee is dat zodra de getallen in deze emmers zijn gesorteerd, het systeem kan berekenen hoeveel de experts van mening verschillen en die onenigheid kan gebruiken om het risico te beoordelen. Decennialang is deze methode een standaardinstrument geweest in velden variërend van medische diagnose tot beveiligingsanalyse, vertrouwd om rommelige, tegenstrijdige gegevens om te zetten in een betrouwbaar oordeel.

Echter, een nieuwe studie suggereert dat de manier waarop deze emmers worden gevormd, de resultaten stiekem kan vervormen. Onderzoekers Elena Udrescu, Alexandru Udrescu, Ana-Maria Suduc en Mihai Bîzoi van de Valahia Universiteit van Targoviste onderzochten dit proces met behulp van echte gegevens over softwarekwetsbaarheden. Ze bekeken duizenden records waarin verschillende organisaties ernstscores aan dezelfde beveiligingsfouten hadden toegekend. Hun doel was om te zien of het combineren van deze scores volgens de standaard wiskundige regels daadwerkelijk hielp bij het identificeren van welke kwetsbaarheden actief werden misbruikt door hackers, of dat de methode simpelweg een illusie van inzicht creëerde. Wat zij ontdekten, was dat de vorm van de emmers zelf het meeste werk deed, wat er vaak toe leidde dat het systeem een hoge mate van onenigheid rapporteerde op plaatsen waar de experts het eigenlijk eens waren, en andersom.

De onderzoekers begonnen door de gegevens van het Common Vulnerability Scoring System te onderzoeken, wat de standaardtaal is voor het beschrijven van softwarefouten. Dit systeem verdeelt scores in vier banden: laag, medium, hoog en kritiek. Het probleem is dat deze banden niet even groot zijn. De "lage" band beslaat een breed bereik aan getallen, terwijl de "kritieke" band zeer smal is. Wanneer de onderzoekers de gegevens in het standaard combinatiesysteem invoerden, ontdekten ze een verborgen fout in de logica. Het systeem behandelde de nauwheid van een emmer als een teken van conflict. Als twee experts scores gaven die dicht bij de rand van een smalle emmer lagen, berekende het systeem een hoge mate van onenigheid, zelfs als de experts het eigenlijk heel eens waren over hun beoordeling. Omgekeerd, als de scores in het midden van een brede emmer vielen, rapporteerde het systeem een lage mate van onenigheid, zelfs als de scores behoorlijk ver uit elkaar lagen. De geometrie van de emmers overschreef de werkelijke meningen van de experts.

Om dit te bewijzen, creëerde het team een nieuwe manier om onenigheid te meten die de invloed van de emmergroottes wegnam. Ze vergeleken de standaardmethode met deze gecorrigeerde versie. De resultaten waren opvallend. De standaardmethode suggereerde dat experts meer van mening verschilden over de meest ernstige fouten dan over de minder ernstige, een patroon dat aan de oppervlakte logisch leek. Maar de gecorrigeerde methode toonde precies het tegenovergestelde aan: experts waren eigenlijk vaker van mening verschillend over de matige fouten en waren vaker het eens over de kritieke incidenten. De oorspronkelijke methode was misleid door het feit dat de kritieke categorie zo smal was dat elke kleine afwijking in de scores het berekening in een staat van hoog conflict bracht. Door deze geometrische bias te verwijderen, lieten de onderzoekers zien dat het standaardinstrument de vorm van de categorieën rapporteerde in plaats van de werkelijke staat van het bewijs.

De studie keek ook naar hoe de scores van de experts werden omgezet in de input van het systeem. Een veelvoorkomende praktijk is om een specifieke score te nemen en deze volledig toe te wijzen aan de enkele emmer waarin deze valt, waarbij wordt genegeerd dat de score een punt op een continue lijn is. De onderzoekers vonden dat deze "crisp" benadering de hele conceptie van onenigheid reduceerde tot een eenvoudige ja-of-nee vlag. Als de experts in dezelfde emmer landden, zag het systeem nul conflict. Als ze in verschillende emmers landden, zag het systeem maximaal conflict. Dit binaire beeld miste alle nuance daartussenin. Wanneer de onderzoekers een "graded" benadering gebruikten, waarbij de score over naburige emmers wordt verspreid om onzekerheid te reflecteren, herwon het systeem zijn vermogen om subtiele verschillen te zien. Echter, zelfs met deze verbetering bleef de onderliggende geometrie van de emmers de resultaten verkenen, tenzij de nieuwe correctie werd toegepast.

Toen het team testte of het combineren van de visies van de experts daadwerkelijk hielp bij het voorspellen welke kwetsbaarheden in de echte wereld werden misbruikt, waren de resultaten sober. Ze analyseerden meer dan 13.000 paren beoordelingen van verschillende organisaties en controleerden of de gecombineerde score beter was in het identificeren van de 70 bekende geëxploiteerde fouten dan simpelweg te vertrouwen op de beste individuele expert. Het antwoord was nee. Hoe ze de scores ook combineerden, of ze nu de standaardregels of de nieuwe correcties gebruikten, het gefuseerde resultaat presteerde niet beter dan de beste enkele bron. De enige methode die iets beter presteerde, was een simpele truc waarbij de lagere van de twee scores werd genomen, maar de onderzoekers waarschuwden dat dit mogelijk een artefact was van de manier waarop de gegevens werden verzameld in plaats van een werkelijk inzicht. Sterker nog, de studie vond dat de standaard combinatieregels in veel gevallen wiskundig gelijk waren aan een eenvoudig gemiddelde, wat betekende dat de complexe machinerie geen echte waarde toevoegde.

Een aanzienlijk deel van de studie legde ook een dataprobleem bloot dat onopgemerkt was gebleven. Veel van de "tweede meningen" in de database waren niet daadwerkelijk onafhankelijke beoordelingen van de organisaties die de oorspronkelijke fouten hadden gerapporteerd. In plaats daarvan waren het geautomatiseerde updates van een overheidsinstantie die vaak gewoon de oorspronkelijke score kopieerden. Toen de onderzoekers deze eruit filterden, steeg de onenigheid tussen de werkelijke onafhankelijke bronnen aanzienlijk. Dit onthulde dat eerdere studies de onenigheid tussen experts waarschijnlijk hadden onderschat omdat ze onbedoeld een bron met een kopie van zichzelf vergeleken.

De onderzoekers concludeerden dat de instrumenten die gebruikt worden om onzekere bewijslast te fuseren, veel gevoeliger zijn voor het ontwerp van de categorieën dan voorheen werd aangenomen. Ze toonden aan dat de standaardmaat voor conflict vaak een spiegel is van de emmergroottes in plaats van een reflectie van menselijke onenigheid. Hoewel de complexe wiskundige regels voor het combineren van bewijs in dit specifieke geval niet de capaciteit verbeterden om echt gevaar te voorspellen, bood de studie een vitale correctie voor hoe de gegevens te lezen. Door de grootte van de emmers aan te passen, kunnen analisten nu het werkelijke niveau van onenigheid tussen bronnen zien. De les is dat in de zoektocht naar het combineren van onzekere informatie, de manier waarop we de categorieën definiëren net zo belangrijk is als de informatie zelf. Zonder aandacht te schenken aan de vorm van de emmers, riskeren we patronen te zien die slechts de schaduw zijn van onze eigen meetinstrumenten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →