← Nieuwste papers
🤖 AI

MaD Physics: Evaluating information seeking under constraints in physical environments

Het artikel introduceert MaD Physics, een nieuw benchmarkontwerp om het vermogen van AI-agenten om fysieke wetten af te leiden en metingen te plannen onder beperkingen van middelen te evalueren door hen te testen in omgevingen met gewijzigde fysieke wetten, waardoor beperkingen in de wetenschappelijke redeneervermogens en gestructureerde verkenning van huidige Gemini-modellen worden blootgelegd.

Oorspronkelijke auteurs: Moksh Jain, Mehdi Bennani, Johannes Bausch, Yuri Chervonyi, Bogdan Georgiev, Simon Osindero, Nenad Tomašev

Gepubliceerd 2026-05-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Moksh Jain, Mehdi Bennani, Johannes Bausch, Yuri Chervonyi, Bogdan Georgiev, Simon Osindero, Nenad Tomašev

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar je hebt een zeer strikte regel: je hebt slechts een beperkt bedrag om uit te geven aan aanwijzingen.

Dit is de kernidee achter een nieuw onderzoeksproject genaamd MaD Physics (Measuring and Discovering Physics). De onderzoekers bij Google DeepMind en Mila hebben een videogame-achtige test ontwikkeld om te zien hoe goed AI-"wetenschappers" kunnen begrijpen hoe de wereld werkt wanneer ze niet zomaar de antwoorden in een handboek kunnen opzoeken en niet alles kunnen controleren omdat ze het zich niet kunnen veroorloven.

Hier is een eenvoudige uiteenzetting van hoe het werkt en wat ze ontdekten:

1. Het Spel: "Het Mysteriekastje"

In deze test wordt de AI in een virtuele wereld gegooid waar objecten rond bewegen. Maar er is een addertje onder het gras: de natuurwetten in deze wereld zijn lichtelijk gebroken of "gewijzigd".

  • Misschien trekt zwaartekracht dingen niet op de gebruikelijke manier naar beneden.
  • Misschien draait water in een patroon dat de normale vloeistofdynamica tart.
  • Misschien gedragen deeltjes zich alsof ze verbonden zijn door onzichtbare draden die in onze echte wereld niet bestaan.

De AI kent deze regels niet. Ze moet ze achterhalen door te kijken hoe de objecten bewegen.

2. De Uitdaging: Het "Aanwijzingenbudget"

Hier komt het "MaD"-gedeelte om de hoek kijken. De AI heeft een budget (zoals een portemonnee met een vast aantal munten).

  • Naar een object kijken kost geld.
  • Dichtbij kijken (hoge precisie) kost veel.
  • Van veraf kijken (lage precisie) kost weinig.
  • Langer wachten om te kijken kost meer tijd.

De AI moet slimme keuzes maken: "Moet ik mijn hele budget uitgeven om één object zeer nauwkeurig te controleren, of moet ik een beetje uitgeven om tien verschillende objecten te controleren voor een ruwe schatting?"

Als de AI zijn geld verspilt aan slechte gokken, raakt hij zijn munten kwijt voordat hij het mysterie kan oplossen. Zodra het geld op is, stopt het spel en moet de AI voorspellen waar de objecten in de toekomst zullen zijn, uitsluitend gebaseerd op de aanwijzingen die het erin slaagde te kopen.

3. De Drie Werelden

Om ervoor te zorgen dat de AI niet zomaar feiten uit de echte wereld uit het hoofd leert, hebben ze het getest in drie verschillende "universums":

  • De Springbalwereld (Klassieke Mechanica): Objecten die stuiteren en botsen, maar met een vreemde, onzichtbare "herinnering" die het moeilijker maakt om ze in bepaalde richtingen te duwen.
  • De Draaiende Waterwereld (Vloeistofmechanica): Een vloeistof die stroomt, maar met een onzichtbare "vreemde kracht" die het in vreemde, draaiende patronen duwt.
  • De Geestdeeltjescwereld (Kwantummechanica): Kleine deeltjes die zich als golven gedragen, maar met een draai: de regels voor hoe ze verschijnen wanneer je ernaar kijkt, verschillen van het echte leven.

4. De Testpersonen

De onderzoekers testten vier verschillende versies van Google's Gemini AI-modellen (van een kleinere, snellere tot een grotere, slimmere) om te zien hoe goed ze waren in dit spel.

5. De Resultaten: Wat de AI Fout Hield

De resultaten waren voor de AI een beetje vernederend:

  • Ze hadden moeite met "strategisch" zijn: De AI gaf haar budget vaak inefficiënt uit. Soms keek ze naar de verkeerde dingen of keek ze te nauwkeurig naar dingen die er niet toe deden, waardoor ze haar geld opgierde voordat ze het patroon begreep.
  • Ze konden geen "nieuwe wetten" "uitvinden": Wanneer de natuurwetten waren gewijzigd, probeerde de AI vaak de regels uit de echte wereld op de nieuwe wereld te forceren. Het was alsof je probeerde een Sudoku-puzzel op te lossen met de regels van Schaak.
  • Betere modellen deden het beter, maar niet perfect: De slimmere AI-modellen (zoals Gemini 3) maakten minder fouten en waren beter in het voorspellen van de toekomst, maar ze konden de "geheime code" van de gewijzigde natuurwetten nog steeds niet perfect achterhalen.
  • Beelden maakten het moeilijker: Wanneer de AI naar foto's van de bewegende objecten moest kijken in plaats van alleen naar getallen, raakte ze nog meer in de war.

De Conclusie

Het paper concludeert dat hoewel AI steeds beter wordt in het beantwoorden van vragen waarvan ze al de antwoorden kent, het nog steeds worstelt met ware wetenschappelijke ontdekking: het vermogen om eropuit te trekken, beperkte middelen wijsig uit te geven, nieuwe data te verzamelen en regels te achterhalen die nog niet bestaan.

Denk er zo over: De AI is geweldig in het zijn van een bibliothecaris (bestaande boeken vinden), maar ze leert nog hoe ze een ontdekkingsreiziger moet zijn (een kaart tekenen van een territorium dat nog niemand heeft gezien). MaD Physics is een nieuwe kaart voor onderzoekers om precies te zien waar de AI verdwaalt, zodat ze kunnen helpen om het beter te leren verkennen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →