← Nieuwste papers
🤖 machine learning

ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery

Deze paper introduceert ThermEval-B, een gestructureerde benchmark van ongeveer 55.000 vraag-antwoordparen op thermische beelden die aantoont dat bestaande vision-language modellen slecht presteren bij temperatuur-gebaseerd redeneren en dat er specifieke evaluaties nodig zijn die verder gaan dan RGB-aannames.

Oorspronkelijke auteurs: Ayush Shrivastava, Kirtan Gangani, Laksh Jain, Mayank Goel, Nipun Batra

Gepubliceerd 2026-02-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ayush Shrivastava, Kirtan Gangani, Laksh Jain, Mayank Goel, Nipun Batra

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot hebt die alles kan zien en begrijpen. Deze robot is opgeleid met miljoenen foto's van de wereld: stralende zonneschijn, felgekleurde bloemen, blauwe luchten en textuurrijke stoffen. Hij is een meester in het zien van RGB-beelden (de normale foto's die wij met onze camera's maken).

Maar wat gebeurt er als je deze robot een warmtebeeld laat zien? Een beeld gemaakt met een camera die niet licht, maar warmte ziet?

Dat is precies waar dit onderzoek, genaamd ThermEval, over gaat. De onderzoekers ontdekten dat onze slimme robots, hoe groot ze ook zijn, hier volledig op vastlopen.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Kleurenblindheid" van de Robot

Onze huidige AI-modellen zijn opgeleid op "daglicht". Ze denken dat een rode kleur betekent dat iets warm is, of dat een blauwe kleur koud is. Maar in een warmtebeeld (thermografie) zijn de kleuren vaak kunstmatig toegevoegd om temperatuur aan te geven.

  • De Analogie: Stel je voor dat je een robot leert te rijden op een weg met witte strepen. Dan geef je hem plotseling een wegkaart met gele strepen. De robot blijft proberen de witte strepen te zoeken en botst tegen de muur. Hij begrijpt niet dat de betekenis van de strepen is veranderd, alleen de kleur.
  • De Realiteit: De robot kijkt naar een warmtebeeld van een mens en denkt: "Oh, die persoon is rood, dus hij is warm!" Maar in het beeld is die persoon misschien blauw (koud) of paars, afhankelijk van de instelling van de camera. De robot raakt in de war en geeft foute antwoorden.

2. De Oplossing: ThermEval (De Nieuwe Examenkaart)

De onderzoekers hebben een nieuw examen ontwikkeld, ThermEval, om te testen hoe goed deze robots echt zijn in het begrijpen van warmte. Ze hebben dit niet zomaar bedacht; ze hebben een nieuwe dataset (ThermEval-D) gemaakt met duizenden foto's van mensen in kantoren en parken, waarbij ze elke pixel van de foto hebben gemeten op exacte temperatuur.

Het examen bestaat uit zeven taken, van makkelijk naar heel moeilijk:

  1. Herkenning: "Is dit een gewone foto of een warmtebeeld?" (De robots doen dit redelijk goed).
  2. Kleurveranderingen: "Kijk, dit warmtebeeld heeft nu een andere kleurenschaal. Is het nog steeds een warmtebeeld?" (Hier beginnen de robots te struikelen).
  3. Tellen: "Hoeveel mensen zie je?" (Ze tellen vaak te veel of te weinig).
  4. De Legenda: "Kijk naar die kleurenschaal rechts. Wat is de hoogste temperatuur?" (Veel robots kunnen de getallen niet lezen of hallucineren onzin).
  5. Redeneren: "Wie is warmer: de persoon links of rechts?" (Ze gokken vaak op basis van wat ze denken dat logisch is, in plaats van naar het beeld te kijken).
  6. Exacte Meting: "Wat is de temperatuur van het voorhoofd?" (Hier falen ze dramatisch; ze geven vaak een standaardantwoord zoals "37 graden", ongeacht de foto).
  7. Afstand: "Wat is de temperatuur als de persoon verder weg staat?" (Ook hier raken ze de balans kwijt).

3. De Resultaten: Waarom de Robots Falen

De onderzoekers hebben 25 verschillende robots getest, van kleine tot gigantische modellen. De conclusie is verrassend en een beetje triest voor de AI-wereld:

  • Ze vertrouwen op "gokjes" (Taalkennis): Als een robot niet zeker weet wat hij ziet, raadt hij. Omdat hij weet dat mensen normaal gesproken rond de 37 graden hebben, zegt hij dat, zelfs als het beeld toont dat iemand 20 graden is (bijvoorbeeld omdat ze in de sneeuw staan). Ze gebruiken hun "taalgeheugen" in plaats van hun "ogen".
  • Hoe groter, hoe niet beter: Het maakt niet uit of de robot 1 miljard of 200 miljard "hersencellen" (parameters) heeft. Als hij niet is getraind op warmte, is hij net zo slecht als een kleine robot.
  • De "Kleurenschaal" is een valstrik: Als je de kleuren in een warmtebeeld verandert (bijvoorbeeld van 'warm rood' naar 'koud blauw'), denken veel robots dat het een andere foto is. Ze begrijpen niet dat het zelfde object is, alleen anders gekleurd.

4. Kan Training Het Oplossen? (De "Cursus")

De onderzoekers hebben geprobeerd om een van de slimme robots (Qwen-VL) een speciale "cursus" te geven met hun nieuwe dataset.

  • Het resultaat: De robot werd veel beter! Hij kon nu veel beter tellen en de legenda lezen.
  • Het probleem: Hij werd nog steeds niet perfect. Bij het schatten van de exacte temperatuur zat hij nog steeds 1 of 2 graden naast het juiste antwoord. Voor een robot die een patiënt moet screenen op koorts of een elektriciteitskast moet controleren op oververhitting, is dat verschil levensgevaarlijk.

De Grote Les

De kernboodschap van dit papier is: AI is niet alleswetend.

Onze huidige slimme modellen zijn als studenten die alleen hebben gestudeerd op daglichtfotografie. Ze zijn experts in kleuren en texturen. Maar als je ze in het donker zet met een nachtkijker (warmtebeeld), verliezen ze hun oriëntatie. Ze proberen de wereld te begrijpen met de regels van het daglicht, wat niet werkt.

Wat moeten we doen?
We moeten AI-modellen niet alleen trainen op foto's, maar ook op fysieke sensoren. Ze moeten leren dat een pixel niet alleen een kleur is, maar een temperatuurwaarde. Pas dan kunnen we robots bouwen die echt veilig en betrouwbaar kunnen werken in het donker, bij branden, of in de medische wereld.

Kortom: ThermEval is de wake-up call voor de AI-wereld: "Stop met gokken, leer echt naar de warmte te kijken!"

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →