← Nieuwste papers
💻 computer science

CandidateFusion-MKAN: A Unified Framework for Robust Multimodal Crisis Classification across Diverse Supervision and Evidence Conditions

CandidateFusion-MKAN is een verenigd framework dat robuuste single-output multimodale crisisclassificatie bereikt door modaliteit-ondersteunde kandidaat-verzamelleerprocessen, kandidaat-verzameling waarschijnlijkheid en begrensde adaptieve zachte targets te integreren om effectief om te gaan met diverse supervisie, ontbrekende of gedegradeerde bewijslast, en conflicterende of complementaire aanwijzingen.

Oorspronkelijke auteurs: Zequn Wang, Shanshan Li, Qingjie Liu, Zhian Pan, Guan Li

Gepubliceerd 2026-09-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zequn Wang, Shanshan Li, Qingjie Liu, Zhian Pan, Guan Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de chaotische uren na een ramp vertrouwen crisismanagers op een vloedgolf aan informatie van sociale media om te begrijpen wat er ter plaatse gebeurt. Een enkel bericht kan een tekstbericht bevatten dat een ingestorte brug beschrijft en een foto die een familie laat zien die vastzit op een dak. Ideaal gezien zouden deze twee stukken bewijs naar dezelfde urgente behoefte wijzen, zoals "reddingspogingen" of "infrastructuurschade". De realiteit van menselijke communicatie is echter vaak rommeliger. Soms vertellen de tekst en de afbeelding verschillende verhalen, misschien omdat de schrijver gefocust is op de mensen terwijl de foto de verwoesting vastlegt, of omdat de afbeelding wazig is en de tekst het enige duidelijke spoor is. In deze momenten staat een computersysteem dat ontworpen is om deze berichten in categorieën te sorteren voor een moeilijke keuze: moet het de tekst vertrouwen, de afbeelding, of proberen één antwoord te raden dat de waarheid in een van beide zou kunnen negeren? Als het systeem te vroeg een enkele, rigide beslissing afdwingt, loopt het het risico vitale informatie weg te gooien die levens zou kunnen redden.

Dit is de specifieke uitdaging waar een nieuw framework genaamd CandidateFusion-MKAN een antwoord op biedt, ontwikkeld door onderzoekers van de University of Emergency Management en het Big Data Center van het Ministerie van Emergency Management. Het team zette zich het doel om een systeem te bouwen dat de rommelige realiteit van crisisdata kan afhandelen zonder de nuance van het oorspronkelijke bewijs te verliezen. In plaats van tekst en afbeelding te dwingen om het eens te worden over één label voordat de computer een beslissing neemt, houdt hun systeem beide mogelijkheden levend tijdens het leerproces. Het behandelt de tekst en de afbeelding als twee aparte getuigen, die elk hun eigen versie van de waarheid bieden, en combineert ze pas aan het einde om één definitief, betrouwbaar antwoord te produceren. Deze aanpak stelt het systeem in staat om robuust te blijven, zelfs wanneer het bewijs ontbreekt, gedegradeerd is of tegenstrijdig is.

De onderzoekers testten hun systeem op een enorme dataset van echte rampenberichten, bekend als CrisisMMD, die meer dan 18.000 tekst-afbeeldingsparen van zeven verschillende rampen bevat. Ze ontdekten dat in meer dan de helft van deze berichten de tekst en de afbeelding daadwerkelijk verschillende humanitaire categorieën ondersteunden. Bijvoorbeeld, een bericht kan tekst bevatten over "getroffenen" terwijl de afbeelding "infrastructuurschade" liet zien. Traditionele systemen worstelen hier vaak mee, door ofwel één zijde te negeren, ofwel in de war te raken. Het nieuwe framework leerde echter beide categorieën als geldige kandidaten te behouden. Het gebruikt een methode die het vertrouwen van de computer concentreert op de set opties die door het bewijs worden ondersteund, in plaats van te forceren om te snel een winnaar te kiezen. Als de tekst en de afbeelding het eens zijn, gedraagt het systeem zich als een standaardclassifier. Als ze het oneens zijn, houdt het systeem beide opties in het spel, zodat de uiteindelijke beslissing geworteld blijft in het werkelijke bewijs dat door beide bronnen wordt geleverd.

Om om te gaan met het feit dat real-world data vaak incompleet is, werd het systeem ook getraind om om te gaan met ontbrekende of kwalitatief slechte inputs. In de echte wereld kan een foto te donker zijn om iets te zien, of een tekstbericht kan afgebroken zijn. De onderzoekers simuleerden deze omstandigheden door tijdens het testen doelbewust tekst te verwijderen of afbeeldingen te vervagen. Ze ontdekten dat hun systeem naadloos kon adapteren door de afhankelijkheid te verschuiven naar het resterende duidelijke bewijs. Wanneer de tekst ontbrak, leunde het systeem zwaar op de afbeelding; wanneer de afbeelding wegviel, vertrouwde het op de tekst. Cruciaal was dat dit gebeurde zonder dat er voor elk specif type ontbrekende data opnieuw getraind hoefde te worden. Het systeem leerde ook te herkennen wanneer de tekst en de afbeelding complementaire aanwijzingen boden — waarbij geen van beide op zichzelf voldoende was, maar samen een compleet beeld vormden. In deze gevallen slaagde het systeem erin de onderscheidende inzichten van beide bronnen te combineren om tot een nauwkeurigere conclusie te komen dan wanneer het hen als redundant had behandeld.

De resultaten van de studie werden gemeten over duizenden testgevallen, inclusief gevallen waar de tekst en de afbeelding van mening verschilden. Het nieuwe framework behaalde een nauwkeurigheid van 92,60% op berichten waar de tekst en de afbeelding het eens waren, waarmee het de prestaties van de beste bestaande systemen evenaarde. Belangrijker nog, op de moeilijke berichten waar de tekst en de afbeelding tegenstrijdige informatie boden, behield het systeem een hoog niveau van betrouwbaarheid door in meer dan 90% van de gevallen een geldige categorie correct te identificeren. Het verminderde ook de onzekerheid in de voorspellingen aanzienlijk vergeleken met oudere methoden die simpelweg de resultaten van tekst- en beeldanalyse middelden. Door het bewijs tot het laatste moment gescheiden te houden, voorkwam het systeem het "middelmatige" probleem waarbij een sterk signaal van de ene bron wordt verdund door een zwak of tegenstrijdig signaal van de andere.

De onderzoekers keken ook naar hoe het systeem omgaat met zeldzame categorieën, zoals specifieke soorten verwondingen of schade die slechts in zeer weinig berichten voorkomen. Ze ontdekten dat standaardmethoden deze zeldzame gevallen vaak verliezen omdat ze een enkel label afdwingen dat mogelijk niet door zowel de tekst als de afbeelding wordt ondersteund. Door de kandidaat-opties open te houden, behield het nieuwe systeem het vermogen om deze zeldzame maar kritieke situaties te herkennen, zelfs wanneer ze alleen zichtbaar waren in één deel van het bericht. Dit is essentieel voor noodhulp, waarbij het missen van een zeldzame maar ernstige conditie ernstige gevolgen kan hebben. De studie toonde aan dat het systeem zijn geleerde kennis kon overdragen naar nieuwe soorten rampen die het nog nooit eerder had gezien, mits het voldoende voorbeelden had gezien van de algemene soorten gebeurtenissen, zoals overstromingen of aardbevingen, tijdens de training.

Uiteindelijk demonstreert dit werk dat robuuste crisisclassificatie niet vereist dat het bewijs perfect of consistent is. Het vereist een systeem dat de complexiteit van menselijke communicatie en de beperkingen van real-world data kan respecteren. Door de tekst en de afbeelding te behandelen als onafhankelijke bronnen van waarheid en ze pas samen te voegen wanneer dat nodig is, biedt het CandidateFusion-MKAN framework een betrouwbaarder hulpmiddel voor crisismanagers. Het zorgt ervoor dat wanneer een beslissing wordt genomen, deze gebaseerd is op het volledige gewicht van het beschikbare bewijs, of dat bewijs nu duidelijk, tegenstrijdig of incompleet is. Deze aanpak biedt een praktisch pad voor het gebruik van kunstmatige intelligentie in omgevingen met hoge inzet, waar de kosten van een verkeerde gok te groot zijn om de details te negeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →