← Nieuwste papers
🤖 AI

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

KnotBench introduceert een strenge benchmark met bijna 860.000 knoopdiagrammen om aan te tonen dat huidige visueel-taalmodellen, ondanks verbeterde prestaties met 'denk'-modi, fundamenteel moeite hebben om visuele knoopstructuren om te zetten in bruikbare symbolische redenering en vaak falen om bij taken die diagrammatische manipulatie vereisen, de prestaties van willekeurige baselines te overtreffen.

Oorspronkelijke auteurs: Hao Liu, Jicheng Liu

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hao Liu, Jicheng Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer slimme robot voor die naar een foto van een verwarde streng kan kijken en deze perfect kan beschrijven. Het kan zeggen: "Ik zie een rode lus die over een blauwe lus gaat, die vervolgens onder een groene lus doorloopt." Het heeft uitstekend gezichtsvermogen.

Maar hier zit de adder onder het gras: als je diezelfde robot vraagt om de streng te ontwarren, of om te zeggen of twee verschillende foto's van knopen eigenlijk dezelfde knoop zijn, alleen anders getekend, faalt het volledig. Het kan de knoop beschrijven, maar het kan er niet in zijn gedachten mee "spelen".

Dit artikel, getiteld "De Gordijnknoop voor VLM's", introduceert een nieuwe test genaamd KnotBench om precies aan te tonen hoe groot deze kloof is tussen "zien" en "doen" voor moderne AI-modellen.

De Opzet: Een Digitale Knoopentuin

De onderzoekers creëerden een enorme tuin van 858.000 foto's van knopen.

  • De Bron: Ze begonnen met 1.951 basis-"prototype" knopen (de eenvoudigste bouwstenen van de knoopentheorie).
  • De Magie: Ze gebruikten een wiskundige regel (een Reidemeister-beweging genoemd) om deze knopen duizenden keren te draaien, te keren en opnieuw te tekenen.
  • Het Resultaat: Je kunt een foto hebben van een eenvoudige "drieknoop" met 3 kruisingen, en een andere foto van exact dezelfde knoop met 20 kruisingen, die er totaal anders uitziet. Of, je kunt twee foto's hebben die er bijna identiek uitzien maar eigenlijk verschillende knopen zijn (zoals een linkshandige handschoen versus een rechtshandige handschoen).

De computer kent de "ware identiteit" van elke enkele knoop omdat deze ze met wiskunde heeft gegenereerd, niet met menselijke gokkerij. Dit maakt de test perfect eerlijk.

De Test: 14 Manieren om Stuck te Raken

De onderzoekers vroegen vier van de slimste beschikbare AI-modellen (waaronder Claude Opus 4.7 en GPT-5) om 14 verschillende taken uit te voeren. Ze splitsten de taken op in twee groepen om te zien waar de AI vastloopt:

  1. De "Afbeelding"-Groep: De AI kijkt naar een foto van de knoop.
  2. De "Tekst"-Groep: De AI kijkt naar een lijst met cijfers en letters (een code) die de knoop beschrijft.

Hier is wat ze de AI vroegen te doen, met eenvoudige analogieën:

  • De "Hetzelfde of Anders?" Test (Familie A): "Zijn deze twee foto's dezelfde knoop?"

    • De Valstrik: Soms zien de foto's er totaal anders uit maar zijn het dezelfde knoop. Soms zien ze er bijna identiek uit maar zijn het verschillende knopen.
    • Het Resultaat: Wanneer de tekstcode werd gegeven, was de AI hier uitstekend in. Wanneer de foto werd gegeven, gokte het willekeurig, zoals een aap die pijlen gooit.
  • De "Wat is er gebeurd?" Test (Familie B): "Ik heb je een knoop getoond, toen heb ik één kleine beweging gemaakt (zoals het toevoegen van een lus). Welke beweging heb ik gemaakt?"

    • De Valstrik: Dit vereist dat de AI de beweging mentaal simuleert. "Als ik dit touw hier trek, hoe ziet de foto er dan uit?"
    • Het Resultaat: Wanneer de tekstcode werd gegeven, kon de AI dit uitzoeken. Wanneer de foto werd gegeven, faalde het op erbarmelijke wijze. Eén model (GPT-5) begon simpelweg steeds weer het meest voorkomende antwoord ("R3") te raden, zoals een student die het antwoorden heeft uit het hoofd geleerd maar de wiskunde niet heeft begrepen.
  • De "Tellen"-Test (Familie C): "Hoe vaak kruisen de touwen elkaar?"

    • Het Resultaat: De AI kon 8 kruisingen makkelijk tellen. Maar zodra de knoop complex werd (17+ kruisingen), werd de telling van de AI een complete puinhoop. Het kon zelfs niet eens de items tellen waar het naar keek.
  • De "Vertaler"-Test (Familie D): "Hier is een foto. Schrijf de geheime code eronder op."

    • Het Resultaat: Nul. Geen enkel model kon dit. Ze konden de visuele foto niet vertalen naar de wiskundige code, zelfs niet met hun "denk"-modus ingeschakeld.

De Grote Ontdekking: De "Waarneming-Bewerking-Kloof"

Het artikel noemt het faalpunt de "Waarneming-Bewerking-Kloof".

Stel het je zo voor:

  • Waarneming is kijken naar een kaart en zeggen: "Ik zie een rivier en een brug."
  • Bewerking is kijken naar diezelfde kaart en zeggen: "Als ik over de brug loop, kom ik aan de andere kant."

De AI-modellen zijn geweldig in Waarneming. Ze kunnen de knoop beschrijven. Maar ze zijn vreselijk in Bewerking. Ze kunnen niet nemen wat ze zien en het mentaal manipuleren om een probleem op te lossen.

Helpt "Denken"?

De onderzoekers schakelden de "denk-modus" van de AI in (waarbij het model met zichzelf praat voordat het antwoordt).

  • Hielp het? Ja, maar slechts een beetje.
  • Waar hielp het? Alleen wanneer de AI de tekstcode kreeg. Als de AI eerst naar een foto moest kijken, loste "denken" het probleem niet op. Het is als het geven van een rekenmachine aan iemand die de cijfers op het scherm niet kan lezen; de rekenmachine is nutteloos.

De Conclusie

Het artikel concludeert dat huidige AI-modellen zijn als fotografen die geen monteurs kunnen zijn. Ze kunnen een perfecte foto van een knoop maken en elk detail beschrijven, maar ze missen de interne "simulator" die mensen gebruiken om objecten mentaal te draaien en keren om te begrijpen hoe ze werken.

Ze kunnen de knoop zien, maar ze kunnen er niet op handelen. Totdat AI deze interne "mentale simulator" bouwt, zal het blind blijven voor de logica van diagrammen, ongeacht hoeveel foto's het ziet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →