← Nieuwste papers
💬 NLP

Can AI Reason Like an Urban Planner? Benchmarking Large Language Models Against Professional Judgment

Dit artikel introduceert Urban Planning Bench (UPBench), een framework dat 25 grote taalmodellen evalueert tegenover professioneel planningsoordeel, waarbij wordt onthuld dat hoewel AI uitblinkt in analytische synthese, het moeite heeft met contextafhankelijke regulatoire en normatieve taken vanwege specifieke epistemische beperkingen zoals regulatoire hallucinatie en een phronetisch tekort.

Oorspronkelijke auteurs: Yijie Deng, He Zhu, Wen Wang, Junyou Su, Minxin Chen, Wenjia Zhang

Gepubliceerd 2026-06-11
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yijie Deng, He Zhu, Wen Wang, Junyou Su, Minxin Chen, Wenjia Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Vraag

Stel je voor dat je een superintelligente robot hebt die elk boek, elk artikel en elke wet heeft gelezen die ooit over steden is geschreven. Je vraagt het hem: "Hoe moeten we deze drukke buurt verbeteren?"

De grote vraag die dit paper stelt is: Kan deze robot echt denken als een menselijke stedenbouwkundige, of is het slechts een zeer goede imitator?

Om dit te ontdekken, hebben de onderzoekers een speciale test gebouwd genaamd UPBench (Urban Planning Bench). Zie het als een "rijbewijsexamen" voor AI, maar in plaats van een auto te besturen, moet de AI complexe stedelijke problemen oplossen.

Hoe ze de AI hebben getest

De onderzoekers vroegen de AI niet alleen om simpele trivia. Ze creëerden een enorm raster (een 4x5 matrix) om de AI te testen op twee hoofdzaken:

  1. Wat het weet: Vier soorten kennis (Planningsregels, Het mengen van verschillende onderwerpen, Hoe de overheid werkt, en Praktijkervaring in de echte wereld).
  2. Hoe het denkt: Vijf niveaus van denken, van simpel geheugen (Het onthouden van feiten) tot complexe oordeelsvorming (Het maken van moeilijke beslissingen).

Ze testten 25 verschillende AI-modellen (zowel Amerikaanse als Chinese) tegen deze test.

De Verrassende Resultaten: De "Omgekeerde" Test

Normaal gesproken verwachten we dat AI geweldig is in simpele dingen (zoals het onthouden van feiten) en slecht in moeilijke dingen (zoals het maken van complexe oordelen).

Maar dit paper vond het tegenovergestelde. De prestaties van de AI vertoonden een "U"-vorm of een achtbaan:

  • Het Makkelijke Deel (Onthouden): De AI was fantastisch in het oproepen van feiten. Als je vroeg: "Wat is de definitie van een bestemmingsplan?", had het het bijna 90% van de tijd goed.
  • Het Moeilijke Deel (Begrijpen): Hier kwam de schok. Wanneer de AI werd gevragd om uit te leggen waarom een concept werkt of hoe twee ideeën met elkaar verbonden zijn, stortte de AI in. De score daalde naar ongeveer 55%. De AI kon de woorden wel opzeggen, maar begreep de betekenis niet echt.
  • Het "Slimme" Deel (Analyseren): Vreemd genoeg werd de AI weer goed wanneer het werd gevraagd om complexe scenario's te analyseren. Het kon lange, logisch klinkende essays schrijven over stedelijke problemen.
  • Het Menselijke Deel (Oordelen): Wanneer de AI werd gevraagd om een definitieve, op waarden gebaseerde beslissing te nemen (zoals: "Moeten we hier een park of een ziekenhuis bouwen?"), had de AI de meeste moeite.

De Analogie: Stel je een student voor die het hele regelboek van een sport perfect kan opzeggen (Onthouden) en een prachtig essay kan schrijven over de geschiedenis van het spel (Analyseren). Maar als je diegene vraagt om het spel daadwerkelijk te spelen en een beslissing te nemen in een fractie van een seconde op basis van de stemming van het publiek en de stemming van de scheidsrechter (Begrijpen/Oordelen), bevriest de student.

De Vier Manieren waarop AI faalt (De "Epistemic Diagnostics")

Het paper vond dat wanneer AI faalt bij ruimtelijke ordening, het op vier specifieke, voorspelbare manieren faalt:

  1. Regulatoire Hallucinatie (De "Nepadvocaat"):
    De AI verzint vol vertrouwen wetten die niet bestaan. Het kan zeggen: "Volgens Sectie 402 van de gemeentelijke code...", terwijl die sectie volledig verzonnen is. Het klinkt als een advocaat, maar het liegt.
  • Analogie: Het is als een gids die een geheime tunnel in een museum beschrijft die niet bestaat, maar het zo levendig doet dat je er bijna in gelooft.
  1. Conceptuele Confusie (De "Woordmixer"):
    De AI haalt vergelijkbare ideeën door elkaar. Het behandelt twee verschillende planningstheorieën alsof het dezelfde zijn.
  • Analogie: Het is als een chef die denkt dat "zout" en "suiker" hetzelfde zijn omdat het allebei witte poeders zijn. Ze zien er hetzelfde uit, maar als je ze door elkaar gebruikt, is het gerecht verpest.
  1. Wickedness Verlamming (De "Besluiteloze Robot"):
    Echte stedelijke problemen zijn "wicked" (complex en weerbarstig) — ze hebben geen perfect antwoord en gaan over conflicterende waarden (bijv. woningbouw versus natuur). De AI somt alle mogheden op, maar weigert een kant te kiezen. Het zegt: "Het hangt ervan af," in plaats van een moeilijke keuze te maken.
  • Analogie: Stel je een scheidsrechter voor in een voetbalwedstrijd die een overtreding ziet, maar dan zegt: "Nou, beide teams hebben geldige punten, dus laten we gewoon door spelen." Een echte planner moet op de fluit blazen en een beslissing nemen.
  1. Phronetisch Tekort (Het "Gebrek aan Boerenverstand"):
    Dit is de grootste kloof. AI mist "phronesis", wat een chique Grieks woord is voor praktische wijsheid. Het is het intuïtieve gevoel dat een planner krijgt door jarenlange ervaring, zoals weten hoe een specifieke buurt zal reageren, of het begrijpen van de onuitgesproken politiek in een gemeenteraad.
  • Analogie: Een AI kan een kaart van een bos lezen, maar weet niet dat de grond op die specifieke plek modderig is omdat het vannacht heeft geregend, of dat de lokale bevolking dat specifieke pad niet leuk vindt. Het mist de "straatwijsheid" die voortkomt uit er daadwerkelijk te zijn geweest.

Het "Waar je vandaan komt"-probleem

Het paper vond ook dat AI-modellen beter presteren in het land waarvoor ze getraind zijn.

  • Amerikaanse AI is goed in Amerikaanse wetten, maar raakt in de war van Chinese stedelijke regels.
  • Chinese AI is goed in Chinese regels, maar raakt in de war van Amerikaanse regels.
  • De Les: Kennis over ruimtelijke ordening is niet alleen "feiten"; het is diep geworteld in de lokale cultuur, wetgeving en geschiedenis. Je kunt niet zomaar een "globale" planner downloaden; de AI moet getraind worden op de specifieke lokale context.

Wat dit betekent voor de toekomst (volgens het paper)

Het paper stelt een strategie voor genaamd "Differentieel Delegeren" (Differential Delegation). Dit betekent precies weten wat je de AI laat doen en wat je voor mensen bewaart:

  • Laat de AI doen: Het "handwerk". Het samenvatten van lange rapporten, het vinden van vergelijkbare casestudies, of het brainstormen over een lijst met ideeën. Het is goed in de "Onthoud"- en "Analyseer"-delen.
  • Houd voor mensen: Het "oordeel". Het interpreteren van specifieke lokale wetten, het nemen van de uiteindelijke beslissing over controversiële kwesties, en het begrijpen van de menselijke/politieke context. De AI is te geneigd tot het "hallucineren" van wetten en het "verlamd" raken bij moeilijke keuzes om daar alleen op vertrouwd te worden.

De Kern van de Zaak

AI gaat de stedenbouwkundigen niet vervangen. In plaats daarvan fungeert het als een zeer snelle, zeer goed gelezen stagiair die veel feiten kent, maar geen gezond verstand heeft en geen moeilijke morele of juridische beslissingen kan nemen.

Het paper concludeert dat het meest waardevolle deel van het werk van een planner niet het kennen van de regels is (wat AI kan), maar het weten hoe je die regels toepast in een rommelige, echte situatie met echte mensen. Die "menselijke maat" is iets wat AI momenteel niet kan evenaren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →