Explainable Machine Learning for Early-Stage Construction Duration Prediction Using Limited Project Information
Deze studie presenteert een verklaarbaar machine learning-framework met behulp van een XGBoost-model om de bouwdurante in een vroeg stadium te voorspellen op basis van beperkte projectinformatie, waarbij wordt aangetoond dat hoewel het model een sterke voorspellende prestatie levert met projectkosten als primaire drijfveer, de resultaten zorgvuldige interpretatie vereisen vanwege de gevoeligheid voor datapartitionering.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Elk bouwproject begint met een vraag die moeilijk te beantwoorden is zonder een kristallen bol: hoe lang zal het duren om te bouwen? Voordat de blauwdrukken volledig zijn getekend, voordat de materialen zijn besteld en voordat de eerste schep de grond raakt, moeten aannemers en opdrachtgevers een tijdlijn beslissen. Deze beslissing bepaalt het budget, de planning van de werkers en het financiële risico voor alle betrokkenen. Traditioneel vereiste het beantwoorden van deze vraag gedetailleerde technische berekeningen en een uitsplitsing van elke afzonderlijke taak, informatie die in de vroegste planningsfasen simpelweg nog niet bestaat. Dit creëert een moeilijke situatie waarin de behoefte aan een tijdlijn het grootst is op het moment dat de beschikbare gegevens om er een te maken het laagst zijn.
Om dit op te lossen, hebben onderzoekers zich gericht op machine learning, een tak van de informatica waarbij programma's leren patronen in gegevens te vinden in plaats van strikte, vooraf geschreven regels te volgen. In de context van de bouw kunnen deze programma's naar historische projecten kijken en leren hoe bepaalde factoren, zoals de kosten of het type gebouw, verband houden met de duur van de werkzaamheden. Veel eerdere pogingen hiertoe vertrouwden echter op gegevens die pas beschikbaar zijn nadat een project al is gestart, zoals het exacte aantal verdiepingen of de specifieke terreinomstandigheden. Dit beperkt hun bruikbaarheid voor de zeer vroege beslissingen die er het meest toe doen. Een nieuwe studie door Mehmet Sena Kaşka en Işık Ateş Kıral pakt dit gat aan door een systeem te bouwen dat de bouwduraf voorspelt met behulp van alleen de basisinformatie die aan het begin van een project beschikbaar is.
De onderzoekers verzamelden gegevens van 209 voltooide bouwprojecten om hun systeem te trainen. Ze kozen er bewust voor om complexe details te negeren die nog niet bekend zijn tijdens de planningsfase. In plaats daarvan voedden ze de computer vier eenvoudige stukken informatie: de geschatte kosten van het project, of de eigenaar een publieke entiteit of een privaat bedrijf is, het algemene type gebouw of infrastructuur, en de geografische locatie. De dataset bevatte een grote verscheidenheid aan constructies, van woonhuizen en commerciële kantoren tot fabrieken, havens en waterleidingssystemen, verspreid over verschillende regio's waaronder het Midden-Oosten, Noord-Afrika, Zuid-Azië en de Gemenebest van Onafhankelijke Staten. Door een dergelijk diverse set projecten te gebruiken, streefde het team ernaar een model te creëren dat de chaotische realiteit van de bouwsector kan aan kunnen, in plaats van slechts een smalle zijtak ervan.
Om de betekenis van deze gegevens te begrijpen, testte het team verschillende soorten machine learning-algoritmen. Ze vergeleken modellen bekend als Random Forest, Extra Trees, Artificial Neural Networks en XGBoost. Dit zijn verschillende wiskundige benaderingen om patronen te vinden, elk met een eigen manier van het verwerken van informatie. De onderzoekers waren voorzichtig om niet op één enkele test te vertrouwen om een winnaar uit te roepen. In plaats daarvan hebben ze de gegevens herhaaldelijk gehusseld en de modellen op verschillende manieren getest om te waarborgen dat de resultaten stabiel waren en niet slechts een gelukkig toeval van de manier waarop de gegevens waren gesplitst. Deze rigoureuze testmethode onthulde dat hoewel sommige modellen goed presteerden op een enkele test, ze gevoelig waren voor veranderingen in de gegevens. Het XGBoost-model, dat gebruikmaakt van een techniek waarbij veel kleine beslissingsbomen worden gebouwd en gecombineerd, bleek de meest consistente presteerder over deze herhaalde tests heen.
Het uiteindelijke model dat door de onderzoekers werd geselecteerd, XGBoost, bereikte een nauwkeurigheidsniveau dat suggereert dat het betekenisvolle patronen in de gegevens heeft gevangen. Bij het testen op een specifieke set projecten die het nog niet eerder had gezien, week de voorspelling van het model gemiddeld ongeveer 175 dagen af. Hoewel dit als een grote foutmarge kan klinken, varieerden de projecten in de studie van een duur van slechts 92 dagen tot wel 2.760 dagen, met een mediaan van 669 dagen. In de context van de vroege planning, waar nog geen gedetailleerd schema bestaat, biedt dit niveau van precisie een waardevol startpunt. Het model leverde niet alleen een getal; de onderzoekers gebruikten ook instrumenten om uit te leggen hoe het model tot zijn conclusies kwam, om er zeker van te zijn dat de resultaten geen "black box"-mysterie waren.
De analyse van de logica van het model onthulde dat de geschatte kosten van een project de belangrijkste factor was bij het voorspellen van de duur. Naarmate de kosten stegen, nam de voorspelde duur over het algemeen toe, wat aansluit bij de intuïtie dat grotere, duurdere projecten doorgaans langer duren. Het model leerde echter ook dat kosten alleen het hele verhaal niet vertellen. De geografische locatie en of het project publiek of privaat was, beïwaarden ook de tijdlijn. Bijvoorbeeld, bij vergelijkbare kostenniveaus werden projecten in bepaalde regio's voorspeld langer te duren dan in andere. Ook het type project deed ertoe, waarbij infrastructuur- en havenprojecten andere duurpatronen vertoonden vergeleken met fabrieken of commerciële gebouwen, hoewel deze factoren minder invloedrijk waren dan de kosten.
Ondanks deze veelbelovende resultaten zijn de auteurs voorzichtig in het definiëren van de grenzen van hun werk. Ze benadrukken dat dit hulpmiddel geen vervanging is voor een gedetailleerde bouwplanning, die later in het proces wordt gemaakt wanneer alle specifieke plannen bekend zijn. Het model is ontworpen als een voorlopige hulp, een manier om een voorgestelde tijdlijn te toetsen aan historische gegevens of om potentiële risico's te signaleren voordat een offerte wordt ingediend. De onderzoekers merken ook op dat de prestaties van het model verbonden zijn aan de specifieke gegevens waarop het is getraind. Omdat de dataset slechts 209 projecten bevatte en ongelijk verdeeld was over verschillende typen en locaties, kan het model anders reageren als het wordt toegepast op een volledig nieuw land of een andere marktomstandigheid. De studie stelt expliciet dat het model moet worden getest op nieuwe, externe gegevens voordat het kan worden vertrouwd voor kritieke beslissingen in de echte wereld.
Uiteindelijk laat dit onderzoek zien dat het zelfs met zeer beperkte informatie mogelijk is om geïnformeerde schattingen te maken over bouwtijdlijnen. Door zich te concentreren op de weinige variabelen die aan het begin van een project bekend zijn, heeft het team een kader gecreëerd dat besluitvormers helpt de onzekerheid van de vroege planningsfase te navigeren. De studie toont aan dat hoewel een computer de toekomst niet met perfecte zekerheid kan voorspellen, het wel kan leren van het verleden om een redelijke schatting te geven die beter is dan een gok. Deze aanpak biedt een praktische manier om datagestuurde inzichten naar de vroegste stadia van de bouw te brengen, wat helpt bij het beheren van verwachtingen en het plannen van middelen voordat de eerste steen is gelegd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.