← Nieuwste papers
🔬 applied physics

BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs

Het artikel introduceert BilliardPhys-Bench, een synthetische biljart-benchmark die onthult dat huidige multimodale LLM's moeite hebben met visuele dynamiek en complexe fysieke redenering, waarbij ze vaak een "stasis-bias" vertonen waarbij ze onterecht voorspellen dat er geen interactie plaatsvindt in uitdagende scenario's.

Oorspronkelijke auteurs: Ben Wang, Xiaogang Li, Ruochen Gao, Peiyao Xiao, Chengliang Xu, Zeyu Wang, Zichao Chen, Bing Zhao, Hu Wei

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ben Wang, Xiaogang Li, Ruochen Gao, Peiyao Xiao, Chengliang Xu, Zeyu Wang, Zichao Chen, Bing Zhao, Hu Wei

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een potje biljart kijkt. Je ziet de witte biljartbal worden geraakt, en je weet instinctief: "Hij gaat de rode bal raken, van de zijkant afstuiven en daar tot stilstand komen." Mensen doen dit zonder erbij na te denken; onze hersenen hebben een ingebouwde "physics engine" die de toekomst simuleert.

Dit artikel introduceert een nieuwe test genaamd BilliardPhys-Bench om te zien of AI-computers over hetzelfde "onderbuikgevoel" voor natuurkunde beschikken, of dat ze simpelweg aan het gokken zijn.

Hier is de opbouw van wat ze hebben gedaan en wat ze hebben gevonden, met behulp van eenvoudige analogieën:

1. De Test: Een Digitale Biljartzaal

De onderzoekers bouwden een virtuele biljarttafel met behulp van een computerprogramma. Ze gebruikten geen echte video; ze genereerden duizenden willekeurige scenario's waarbij de ballen onder verschillende snelheden en hoeken worden geslagen.

  • De Opstelling: Ze laten de AI één enkele afbeelding zien van de tafel met de ballen en een pijl die aangeeft waar de witte bal naartoe gaat.
  • De Regels: Ze vertellen de AI de natuurwetten (hoeveel wrijving de ballen vertraagt, hoe ze stuiteren).
  • De Uitdaging: De AI moet drie dingen voorspellen zonder de toekomst te zien:
    1. Wordt er geraakt? (Zal de witte bal tegen een andere bal botsen?)
    2. Wordt er gestoten? (Zal hij de wand raken?)
    3. Waar komt het tot stilstand? (Precies waar bevinden alle ballen zich na 1, 2, 3, 4 of 5 seconden?)

2. De Spelers: De AI "Studenten"

Ze testten de slimste beschikbare AI-modellen (uit families zoals GPT, Claude, Gemini en Qwen). Zie deze modellen als studenten die een examen over natuurkunde maken.

3. De Resultaten: Wie is geslaagd en wie is gezakt?

De resultaten waren verrassend en onthulden een specifieke zwakte in de manier waarop deze AI's denken.

  • De "Stasis Bias" (De Luie Student):
    De grootste fout die de onderzoekers ontdekten, is iets wat ze de "Stasis Bias" noemen. Wanneer de situatie ingewikkelder wordt of de voorspellingstijd langer wordt (zoals het voorspellen van 5 seconden in de toekomst), worden de AI's bang om het fout te hebben. In plaats van een botsing te voorspellen, kiezen ze standaard voor de optie: "Er is niets gebeurd." Ze voorspellen dat de ballen gewoon blijven liggen. Het is alsof een student, wanneer hij het antwoord niet weet, "Ik weet het niet" opschrijft in plaats van te proberen het wiskundige probleem op te lossen.

  • Het "Goed aan het einde, slecht in het midden"-probleem:
    Sommige modellen waren erg goed in het raden waar de ballen uiteindelijk zouden eindigen na 5 seconden, maar waren slecht in het uitleggen van hoe ze daar gekomen waren.

    • Analogie: Stel je voor dat een student aan het einde van een verhaal een perfect plaatje tekent van een auto-ongeluk, maar het hele middenstuk van het verhaal volledig verkeerd heeft (door te zeggen dat de auto rechtuit reed terwijl hij eigenlijk uitweek). Ze kregen de eindtoestand goed door geluk of patroonherkenning, maar ze begrepen de natuurkunde van de crash niet echt.
  • De Winnaars:
    De beste presteerders waren GPT-5.5 en GPT-5.4-Pro. Deze modellen waren het meest "gebalanceerd". Ze konden zowel de eindpositie voorspellen als correct identificeren welke botsingen daartoe leidden.

    • Interessant genoeg deden de "Pro"-versies van de modellen (die meer rekenkracht gebruiken om langer na te "denken") het veel beter bij het herkennen van botsingen dan de standaardversies. Dit suggereert dat het geven van de AI meer tijd om na te denken helpt om de luie "Stasis Bias" te overwinnen.

4. De Harde Waarheid

Het artikel concludeert dat hoewel deze AI's geweldig zijn in het herkennen van wat er op een foto staat (zoals zeggen: "dat is een biljarttafel"), ze nog steeds erg slecht zijn in het voorspellen hoe dingen bewegen.

  • Tijd is de vijand: Naarmate de voorspellingstijd langer werd (van 1 naar 5 seconden), daalde de nauwkeurigheid van de AI. Kleine fouten in het begin stapelden zich op, zoals een spelletje "telefoontje" waarbij de boodschap aan het eind vervormd is.
  • De Kloof: Er is een enorme kloof tussen het "zien" van de wereld en het "simuleren" van de wereld. Huidige AI's zijn goed in het beschrijven van een statische foto, maar worstelen met het draaien van een mentale film van wat er daarna gebeurt.

Samenvatting

Het artikel beweert niet dat deze AI's al voor je kunnen biljarten. In plaats daarvan gebruikt het biljart als een eenvoudige, heldere manier om aan te tonen dat huidige AI-modellen geen echt intern natuurkundig model bezitten. Ze zijn goed in het beschrijven van het heden, maar falen vaak in het voorspellen van de toekomst, vooral wanneer zaken ingewikkeld of chaotisch worden. Om dit op te lossen, moet toekomstige AI worden gebouwd met beter "gezond verstand" over hoe objecten met elkaar interageren, in plaats van alleen maar patronen te memoriseren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →