← Nieuwste papers
💻 computer science

SQCAFusion: Multi-Scale Scene-Query Cross-Attention for Illumination-Adaptive Infrared and Visible Image Fusion

Dit artikel stelt SQCAFusion voor, een verlichtingsadaptief framework voor de fusie van infrarode en zichtbare beelden dat multi-schaal scene-query cross-attention met leerbare scene tokens gebruikt om kenmerken tijdens de vroege codering dynamisch te moduleren, waardoor scene-blindness problemen worden opgelost en de fusiekwaliteit onder variërende lichtomstandigheden wordt verbeterd.

Oorspronkelijke auteurs: Yunfei Chen, Juan Zhang, Yongbin Gao, Bo Huang

Gepubliceerd 2026-09-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yunfei Chen, Juan Zhang, Yongbin Gao, Bo Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van machine vision worden camera's vaak beperkt door de fysica van het licht. Een standaardcamera ziet de wereld vergelijkbaar met een menselijk oog, waarbij ze rijke kleuren en fijne texturen vastlegt, maar het heeft moeite wanneer de zon ondergaat of wanneer rook de lucht vult. In contrast hiermee detecteren thermische camera's warmte in plaats van licht, waardoor ze levende wezens duidelijk kunnen zien, zelfs in totale duisternis, maar ze produceren vaak wazige, grijze beelden die de scherpe details van een normale foto missen. Decennialang hebben ingenieurs geprobeerd deze twee soorten beelden te combineren tot één perfect beeld dat de helderheid van een dagfoto en de warmtesensorkracht van een nachtzichtapparaat bezit. Dit proces, bekend als beeldfusie, is essentieel voor alles van autonome voertuigen die door mistige straten navigeren tot militaire surveillance in vijandige omgevingen. Echter, een hardnekkig probleem heeft deze pogingen geteisterd: de meeste computerprogramma's die ontworpen zijn om deze beelden samen te voegen zijn "scène-blind". Ze behandelen een heldere, zonnige dag en een pikdonkere nacht precies op dezelfde manier, waarbij ze niet beseffen dat de regels voor het combineren van de beelden moeten veranderen afhankelijk van de verlichting. Deze blindheid leidt vaak tot resultaten waarbij de duisternis van de nachtelijke hemel ruis en statische elektriciteit versterkt, of waar de heldere kleuren van een zonnige dag worden weggespoeld, wat resulteert in een modderig en verwarrend eindbeeld.

Een team van onderzoekers aan de Shanghai University of Engineering Science heeft een nieuwe aanpak ontwikkeld om dit specifieke probleem op te lossen, waarbij ze een systeem creëerden dat ze SQCAFusion noemen. In plaats van te wachten tot het einde van het proces om de verlichting aan te passen, vraagt hun methode de computer om de omgeving al aan het begin van het proces te begrijpen. Stel je een vertaler voor die, voordat hij een boek leest, eerst controleert hoe laat het is om te beslissen of hij formele of informele taal gebruikt; vergelijkbaar daarmee analyseert dit nieuwe systeem eerst de scène om te bepalen of het dag of nacht is. Het gebruikt deze kennis vervolgens om het fusieproces vanaf het begin actief te sturen, in plaats van alleen achteraf een correctie toe te passen. De onderzoekers ontdekten dat door deze "scènebewustheid" direct in de vroege stadia van de kenmerkextractie (feature extraction) te injecteren, de computer dynamisch kan beslissen hoeveel gewicht hij aan het zichtbare beeld versus het thermische beeld moet geven. Als het zichtbare beeld donker en ruisachtig is, leert het systeem om meer op de thermische gegevens te vertrouwen, terwijl de scherpe randen van de zichtbare wereld behouden blijven. Als de scène helder is, geeft het prioriteit aan de rijke texturen en kleuren van de standaardcamera.

De kern van deze innovatie is een mechanisme dat fungeert als een dynamisch filter. Het systeem genereert een reeks digitale tokens die de lichtomstandigheden van de scène vertegenwoordigen. Deze tokens fungeren vervolgens als een query, die de computer vraagt om naar de beeldkenmerken te kijken en te beslissen welke delen belangrijk zijn en welke slechts ruis zijn. Dit gebeurt over meerdere schalen, wat betekent dat het systeem zowel de brede vormen van objecten als de minuscule details van texturen gelijktijdig controleert. Door dit te doen, kan de computer de korrelige ruis onderdrukken die vaak problemen geeft bij beelden met weinig licht, zonder de belangrijke doelwitten, zoals een voetganger of een voertuig, te vervagen. De onderzoekers introduceerden ook een slimme trainingsstrategie om de moeilijkheid van het leren van slechte data aan te pakken. Wanneer de computer wordt getraind op zeer donkere beelden, kan de ruis de leerprocessen soms misleiden door te doen voorkomen dat de korrelige statische elektriciteit een echt randje of object is. Om dit te voorkomen, werd het systeem geleerd om automatisch de verwachtingen voor de kwaliteit van het zichtbare beeld te verlagen wanneer het een donkere scène detecteert. Hierdoor kan het model de ruis negeren terwijl het toch de ware structuur van de scène getrouw vastlegt.

De resultaten van dit nieuwe framework werden getest tegen een breed scala aan bestaande methoden met behulp van verschillende datasets, waaronder stedelijke straatscènes, militaire camouflage scenario's en complexe wegomgevingen. In standaardtests op een dataset van meer dan duizend beeldparen presteerde de nieuwe methode beter dan alle voorheen bekende algoritmen op het gebied van informatiebehoud en visuele helderheid. Het slaagde erin meer detail te bewaren en beelden met een hogere contrastratio te creëren dan zijn concurrenten. Misschien nog indrukwekkender is dat het systeem een opmerkelijk vermogen tot generalisatie toonde. Wanneer de onderzoekers het testten op volledig nieuwe datasets die het nog nooit eerder had gezien—variërend van HD-verkeersscènes tot enkelvoudige kanaal militaire thermische beelden—had het model geen hertraining of aanpassing nodig. Het behield zijn hoge prestaties en produceerde heldere, scherpe beelden die de thermische doelwitten duidelijk hielden terwijl het natuurlijke uiterlijk van de achtergrond behouden bleef. In omstandigheden met weinig licht, waar andere methoden wazige halo's produceerden of details volledig verloren, hield deze nieuwe aanpak de randen van objecten scherp en de achtergronden schoon.

De studie bevestigt dat de sleutel tot betere beeldfusie niet alleen ligt in het hebben van krachtige hardware, maar in het geven van het vermogen aan de software om de context te begrijpen waarin zij werkt. Door af te stappen van een rigide, eenheidsbenadering en over te gaan naar een dynamisch systeem dat zich in realtime aanpast aan de lichtomstandigheden, hebben de onderzoekers een hulpmiddel gecreëerd dat veel robuuster is voor real-world toepassingen. Het werk suggereert dat toekomstige visiesystemen contextbewust zullen moeten zijn om de onvoorspelbare aard van de fysieke wereld te kunnen hanteren. Hoewel het huidige model leunt op een globale begrip van de scène, merken de onderzoekers op dat toekomstige iteraties zich op nog fijnere details kunnen richten, wat potentieel real-time adaptatie in nog complexere omgevingen mogelijk maakt. Voor nu vertegenwoordigt deze methode een belangrijke stap voorwaarts in het betrouwbaar maken van machine vision in het donker, om ervoor te zorgen dat cruciale details niet verloren gaan in de schaduwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →