Explainable Machine Learning for Early-Stage Construction Duration Prediction Using Limited Project Information
本研究提出了一种利用 XGBoost 模型进行可解释机器学习的框架,用于基于有限的项目信息预测建设初期的工期,并证明了虽然该模型以项目成本为主要驱动因素实现了强大的预测性能,但由于其对数据划分具有敏感性,其结果需要谨慎解读。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每一个建筑项目都始于一个难以回答的问题,仿佛需要一颗水晶球才能看清:建造它需要多长时间?在蓝图完全绘制完成之前,在材料订购之前,也在第一把铲子触地之前,承包商和客户必须决定一个时间表。这一决定决定了预算、工人的进度安排以及所有参与者的财务风险。传统上,回答这个问题需要详细的工程计算和对每一项任务的分解,而这些信息在最早期的规划阶段根本不存在。这造成了一个困境:对时间表的需求最高,而用于创建时间表的数据却处于最低水平。
为了解决这个问题,研究人员转向了机器学习——这是计算机科学的一个分支,其中的程序通过学习发现数据中的模式,而不是遵循僵化的、预先编写的规则。在建筑领域,这些程序可以观察历史项目,并学习诸如成本或建筑类型等特定因素如何与施工时长相关联。然而,以往许多尝试都依赖于项目启动后才可获得的数据,例如确切的楼层数或具体的场地条件。这限制了它们在最重要的早期决策阶段的实用性。Mehmet Sena Kaşka 和 Işık Ateş Kıral 的一项新研究通过建立一个仅使用项目开始时可获得的各种基础信息来预测建筑工期,填补了这一空白。
研究人员收集了来自 209 个已完工建筑项目的数据来训练他们的系统。他们刻意忽略了在规划阶段尚不明确的复杂细节。相反,他们向计算机输入了四个简单信息:项目的预估成本、业主是公共实体还是私营公司、建筑或基础设施的大类类型,以及地理位置。该数据集涵盖了广泛的结构,从住宅房屋、商业办公楼到工厂、港口和输水管线,分布在包括中东、北非、南亚和独联体国家在内的不同地区。通过使用如此多样化的项目,团队旨在创建一个能够应对建筑业复杂现实的模型,而非仅仅针对某个狭窄的领域。
为了理解这些数据,团队测试了几种不同类型的机器学习算法。他们对比了被称为随机森林(Random Forest)、极端随机树(Extra Trees)、人工神经网络(Artificial Neural Networks)和 XGBoost 的模型。这些是寻找模式的不同数学方法,每种方法都有其处理信息的方式。研究人员非常谨慎,没有依赖单一测试来宣布胜者。相反,他们反复打乱数据并在不同方式下测试模型,以确保结果是稳定的,而不仅仅是由于数据分割方式不同而产生的偶然巧合。这种严格的测试表明,虽然某些模型在单次测试中表现良好,但它们对数据的变化很敏感。XGBoost 模型(它使用一种构建许多小决策树并将其组合起来的技术)在这些重复测试中被证明是最一致的表现者。
研究人员最终选择的 XGBoost 模型达到了能够表明其捕捉到了数据中有意义模式的准确度水平。当在一个它从未见过的特定项目集上进行测试时,该模型的预测平均偏差约为 175 天。虽然这听起来误差很大,但研究中的项目持续时间从短至 92 天到长至 2,760 天不等,中位数为 669 天。在没有任何详细进度表存在的早期规划阶段,这种精确度提供了一个有价值的起点。该模型不仅提供了一个数字;研究人员还使用了工具来解释模型是如何得出结论的,从而确保结果不是一个“黑箱”之谜。
对模型逻辑的分析显示,项目的预估成本是预测工期的最重要因素。随着成本上升,预测的持续时间通常也会增加,这符合直觉,即规模更大、更昂贵的项目往往耗时更长。然而,模型也学到,仅靠成本并不能说明全部情况。地理位置以及项目是公有还是私有也会影响时间表。例如,在成本水平相似的情况下,某些地区的项目预测耗时比其他地区更长。项目类型也很重要,基础设施和港口项目表现出与工厂或商业建筑不同的持续时间模式,尽管这些因素的影响力不如成本。
尽管取得了这些令人鼓舞的结果,作者仍谨慎地定义了其工作的局限性。他们强调,这个工具不能取代详细的建筑进度表,后者是在所有具体计划已知后的后期流程中创建的。该模型被设计为一个初步辅助工具,一种将拟定时间表与历史数据进行基准对比,或在提交标书前识别潜在风险的方法。研究人员还指出,模型的性能与其训练所用的特定数据紧密相关。由于数据集仅包含 209 个项目,且在不同类型和地点上的分布不均,如果应用于完全不同的国家或不同的市场环境,模型的表现可能会有所不同。研究明确指出,在将其用于关键的现实世界决策之前,需要用新的外部数据对其进行测试。
最终,这项研究表明,即使在信息非常有限的情况下,也是可以做出关于建筑工期的明智推测的。通过专注于项目开始时已知的极少数变量,该团队创建了一个框架,帮助决策者应对规划早期的不确定性。研究表明,虽然计算机无法完美地预测未来,但它可以通过学习过去来提供一个比猜测更合理的估计。这种方法提供了一种实用的方式,将数据驱动的洞察力引入建筑的最早期阶段,有助于在第一块砖铺设之前管理预期并规划资源。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。