← Nieuwste papers
🔬 materials science

Physics as the label for measuring and correcting materials reasoning in multimodal models

Dit artikel introduceert MatPCR, een label-vrije benchmark die de fysieke consistentie van het redeneren van multimodale modellen in materiaalkunde evalueert door programmatische oracles te gebruiken om de naleving van natuurwetten zoals de wet van Bragg en thermodynamische stabiliteit te verifiëren, waarmee de beperkingen van huidige evaluatiemethoden die afhankelijk zijn van schaarse menselijke annotaties worden aangepakt.

Oorspronkelijke auteurs: Hasan Kurban, Rasul Khanbayov, Mustafa Kurban

Gepubliceerd 2026-09-14
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hasan Kurban, Rasul Khanbayov, Mustafa Kurban

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het moderne laboratorium wenden wetenschappers zich steeds vaker tot kunstmatige intelligentie om de complexe materialen die onze wereld bouwen, te begrijpen. Deze systemen, bekend als vision-language modellen, kunnen naar afbeeldingen van kristallen kijken of beschrijvingen van chemische structuren lezen en proberen hun eigenschappen te herleiden. Ze krijgen de opdracht om de grootte van een deeltje uit een foto te identificeren, te voorspellen of een nieuwe verbinding stabiel zal zijn, of de energieniveaus van elektronen binnen een rooster te bepalen. De hoop is dat deze digitale assistenten de ontdekking van nieuwe batterijen, sterkere legeringen of efficiëntere zonnecellen kunnen versnellen. Er is echter een hardnekkig probleem ontstaan: deze modellen klinken vaak zelfverzekerd terwijl ze fysiek onmogelijk zijn. Ze kunnen beweren dat een deeltje tien micrometer breed is, terwijl de afbeelding duidelijk een schaalbalk toont die een veel kleiner gezichtsveld aangeeft, of ze kunnen een materiaal als stabiel verklaren terwijl de wetten van de thermodynamica voorschrijven dat het uit elkaar zou moeten vallen. De kern van de moeilijkheid is geweest hoe men deze fouten kan vangen. Traditioneel hebben onderzoekers vertrouwd op menselijke experts om de uiteindelijke antwoorden te controleren, maar dit is traag, duur en onmogelijk op te schalen naar de enorme hoeveelheid gegenereerde data. Bovendien kan een model tot het juiste getal komen om de verkeerde redenen, of een plausibel klinkende uitleg geven die de fundamentele wetten van de natuurkunde schendt.

Een team van onderzoekers heeft een nieuwe manier geïntroduceerd om deze modellen te evalueren die het volledig omzeilt door menselijke beoordeling. In plaats van te vragen "Is het antwoord juist?", vragen ze "Voldoet de redeneerketen aan de wetten van de natuurkunde?". Ze bouwden een systeem genaamd MatPCR, dat de wetten van de natuurkunde zelf als het antwoordmodel behandelt. De onderzoekers realiseerden zich dat materiaaldat zijn eigen interne logica bevat die programmatisch gecontroleerd kan worden. Bijvoorbeeld, de positie van pieken in een diffractiepatroon moet een specifieke wiskundige relatie volgen die bekend staat als de wet van Bragg; de grootte van een kenmerk in een microscoopbeeld kan de grenzen die door de schaalbalk worden gesteld niet overschrijden; en de stabiliteit van een kristalstructuur wordt bepaald door de energie in verhouding tot een theoretisch minimum. Door deze natuurkundige regels in software te coderen, creëerde het team een set geautomatiseerde rechters, of "oracles", die direct kunnen verifiëren of de redeneerstappen van een model fysiek toelaatbaar zijn. Deze aanpak stelt hen in staat om de "Physical-Consistency Rate" te meten, een score die reflecteert hoe vaak de denkketen van een model de harde beperkingen van de fysieke wereld respecteert, ongeacht of het uiteindelijke antwoord overeenkomt met de verwachting van een mens.

De onderzoekers testten dit systeem op negen verschillende kunstmatige intelligentiemodellen, variërend van open-source tools tot de meest geavanceerde commerciële systemen die beschikbaar zijn. Ze voedden de modellen met duizenden taken met betrekking tot afbeeldingen van diffractiepatronen, elektronenmicroscopie foto's, spectrale data en kristalstructuren. De resultaten onthulden een landschap van aanzienlijke inconsistentie. Hoewel sommige modellen goed presteerden op bepaalde taken, was geen enkel model uniform betrouwbaar. De modellen waren verrassend goed in het lezen van schaalbalken in microscoopbeelden, waarbij ze vaak bijna perfecte consistentiecijfers behaalden, maar ze hadden enorme moeite met spectrale data, waarbij veel modellen basisfysieke beperkingen niet herkenden. Een van de meest geavanceerde modellen bereikte een consistentiecijfer van ongeveer 77 procent in totaal, wat betekent dat ongeveer één op de vier redeneerketens een fysieke overtreding bevatte. De studie benadrukte ook dat het simpelweg vragen aan een model om "harder na te denken" of het gebruiken van een duurdere versie van hetzelfde model niet garandeerde dat er beter fysiek redeneerde. In sommige gevallen presteerden nieuwere modellen niet beter dan hun oudere broers of zussen, en modellen met expliciete "redeneermodi" vertoonden geen duidelijk voordeel ten opzichte van hun standaard tegenhangers.

Om te zien of deze modellen van hun fouten konden leren, introduceerden de onderzoekers een proces genaamd Constraint-Grounded Self-Verification. In deze opstelling, wanneer de geautomatiseerde oracle een fysieke fout in de redenering van het model detecteerde, voedde het die specifieke overtreding terug aan het model en vroeg het het antwoord te herzien. De resultaten waren bemoedigend maar genuanceerd. De modellen corrigeerden hun fouten succesvol en verbeterden hun consistentiecijfers aanzienlijk wanneer ze werden begeleid door de fysieke feedback. Echter, de onderzoekers vonden dat deze verbetering vaak voortkwam uit het feit dat de modellen terugvielen op een veiliger, meer generiek antwoord, in plaats van het werkelijk juiste fysieke waarde te vinden. De modellen leerden de specifieke valstrik die de oracle uitzette te vermijden, maar ze hebben de onderliggende natuurkunde niet noodzakelijkerwijs geleerd. Dit suggereert dat hoewel de modellen weggestuurd kunnen worden van overduidelijke onmogelijkheden, ze nog niet de diepe fysieke principes hebben geïnternaliseerd die nodig zijn om correcte redeneringen vanuit het niets te genereren.

Het team trainde ook een kleinere, gespecialiseerde AI om als detector voor deze fouten te fungeren, in de hoop dat het overtredingen kon voorspellen zonder de zware computationele kracht van de volledige natuurkundige simulaties nodig te hebben. Deze detector werkte erg goed wanneer hij werd getest op dezelfde typen data waarop hij was getraind, waarbij hij fysieke inconsistenties in de redeneerketens succesvol identificeerde. Echter, toen de onderzoekers hem testten op geheel nieuwe typen fysieke beperkingen die hij nog nooit had gezien, daalde de prestatie tot het niveau van willekeurig gokken. Deze bevinding is cruciaal: het geeft aan dat het vermogen om fysieke fouten op te sporen zeer specifiek is voor het type data en de betrokken regels. Een detector getraind om fouten in röntgendiffractiepatronen op te sporen, kan niet automatisch leren om fouten in magnetische eigenschappen of chemische stabiliteit op te sporen. Dit gebrek aan generalisatie betekent dat voor nu de meest betrouwbare manier om fysieke consistentie te waarborgen, het gebruik is van de specifieke, op natuurkunde gebaseerde controles voor elk type materiaalkundig probleem, in plaats van te vertrouwen op een enkele, universele AI-rechter.

De studie concludeert dat hoewel kunstmatige intelligentie een krachtig instrument aan het worden is voor de materiaalkunde, het nog geen betrouwbare partner is voor high-stakes ontdekkingen zonder externe verificatie. De modellen zijn in staat om plausibele narratieven te genereren, maar ze schenden regelmatig de fundamentele wetten van de natuurkunde in dat proces. Het nieuwe framework biedt een manier om deze fouten te meten en te corrigeren zonder menselijke tussenkomst, wat een pad biedt naar een meer betrouwbare wetenschappelijke AI. Door de natuurkunde als het ultieme label te behandelen, hebben de onderzoekers aangetoond dat we systemen kunnen bouwen die hun eigen redenering auditeren tegen de onverbiddelijke regels van de natuur. Dit betekent niet dat de modellen kapot zijn, maar eerder dat hun huidige redenering vaak een simulatie van begrip is in plaats van een reflectie van de fysieke waarheid. De weg vooruit houdt in dat deze op natuurkunde gebaseerde controles niet alleen als een test worden gebruikt, maar als een gids om modellen te trainen die kunnen redeneren met dezelfde strengheid die de fysieke wereld vereist.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →