← Últimos artículos
💻 computer science

Explainable Machine Learning for Early-Stage Construction Duration Prediction Using Limited Project Information

Este estudio presenta un marco de aprendizaje automático explicable utilizando un modelo XGBoost para predecir la duración de la construcción en etapas tempranas basándose en información limitada del proyecto, demostrando que si bien el modelo logra un sólido rendimiento predictivo con el costo del proyecto como el principal impulsor, sus resultados requieren una interpretación cuidadosa debido a su sensibilidad a la partición de los datos.

Autores originales: Mehmet Sena Kaşka, Işık Ateş Kıral

Publicado 2026-09-08
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Mehmet Sena Kaşka, Işık Ateş Kıral

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Todo proyecto de construcción comienza con una pregunta que es difícil de responder sin una bola de cristal: ¿cuánto tiempo tardará en construirse? Antes de que los planos estén completamente dibujados, antes de que se pidan los materiales y antes de que la primera pala toque el suelo, los contratistas y los clientes deben decidir un cronograma. Esta decisión dicta el presupuesto, el calendario para los trabajadores y el riesgo financiero para todos los involucrados. Tradicionalmente, responder a esta pregunta requería cálculos de ingeniería detallados y un desglose de cada tarea individual, información que simplemente no existe en las etapas iniciales de planificación. Esto crea una situación difícil donde la necesidad de un cronograma es máxima precisamente cuando los datos disponibles para crear uno son mínimos.

Para resolver esto, los investigadores han recurrido al aprendizaje automático (machine learning), una rama de la informática donde los programas aprenden a encontrar patrones en los datos en lugar de seguir reglas rígidas y preescritas. En el contexto de la construcción, estos programas pueden observar proyectos históricos y aprender cómo ciertos factores, como el costo o el tipo de edificio, se relacionan con la duración de la obra. Sin embargo, muchos intentos previos de esto se han basado en datos que solo están disponibles después de que un proyecto ya ha comenzado, como el número exacto de pisos o las condiciones específicas del sitio. Esto limita su utilidad para las decisiones iniciales que son las más importantes. Un nuevo estudio realizado por Mehmet Sena Kaşka e Işık Ateş Kıral aborda este vacío mediante la creación de un sistema que predice la duración de la construcción utilizando únicamente la información básica disponible al inicio de un proyecto.

Los investigadores recopilaron datos de 209 proyectos de construcción completados para entrenar su sistema. Decidieron deliberadamente ignorar detalles complejos que aún no se conocen en la etapa de planificación. En su lugar, alimentaron a la computadora con cuatro piezas simples de información: el costo estimado del proyecto, si el propietario es una entidad pública o una empresa privada, el tipo general de edificio o infraestructura, y la ubicación geográfica. El conjunto de datos incluyó una gran variedad de estructuras, desde viviendas residenciales y oficinas comerciales hasta fábricas, puertos y líneas de transmisión de agua, ubicadas en diferentes regiones, incluyendo el Medio Oriente, el Norte de África, el Sur de Asia y la Comunidad de Estados Independientes. Al utilizar un conjunto tan diverso de proyectos, el equipo buscaba crear un modelo que pudiera manejar la realidad desordenada de la industria de la construcción, en lugar de solo una parte estrecha de ella.

Para dar sentido a estos datos, el equipo probó varios tipos diferentes de algoritmos de aprendizaje automático. Compararon modelos conocidos como Random Forest, Extra Trees, Redes Neuronales Artificiales y XGBoost. Estos son diferentes enfoques matemáticos para encontrar patrones, cada uno con su propia forma de procesar la información. Los investigadores fueron cuidadosos de no confiar en una sola prueba para declarar un ganador. En su lugar, mezclaron los datos repetidamente y probaron los modelos de diferentes maneras para asegurar que los resultados fueran estables y no solo un accidente de suerte debido a cómo se dividieron los datos. Estas rigurosas pruebas revelaron que, si bien algunos modelos funcionaban bien en una sola prueba, eran sensibles a los cambios en los datos. El modelo XGBoost, que utiliza una técnica de construir muchos árboles de decisión pequeños y combinarlos, demostró ser el de rendimiento más consistente a través de estas pruebas repetidas.

El modelo final seleccionado por los investigadores, XGBoost, alcanzó un nivel de precisión que sugiere que capturó patrones significativos en los datos. Cuando se probó en un conjunto específico de proyectos que no había visto antes, las predicciones del modelo fallaron por un promedio de unos 175 días. Aunque esto pueda parecer un margen de error grande, los proyectos del estudio variaban en duración desde tan solo 92 días hasta tanto como 2,760 días, con una mediana de 669 días. En el contexto de la planificación temprana, donde aún no existe un cronograma detallado, este nivel de precisión ofrece un punto de partida valioso. El modelo no solo proporcionó un número; los investigadores también utilizaron herramientas para explicar cómo el modelo llegó a sus conclusiones, asegurando que los resultados no fueran un misterio de "caja negra".

El análisis de la lógica del modelo reveló que el costo estimado de un proyecto era el factor más importante para predecir cuánto tiempo tomaría. A medida que el costo aumentaba, la duración predicha generalmente aumentaba, lo cual se alinea con la intuición de que los proyectos más grandes y costosos tienden a tardar más. Sin embargo, el modelo también aprendió que el costo por sí solo no cuenta toda la historia. La ubicación geográfica y si el proyecto era público o privado también influyeron en el cronograma. Por ejemplo, con niveles de costo similares, se predijo que los proyectos en ciertas regiones tardarían más que en otras. El tipo de proyecto también importaba, con los proyectos de infraestructura y puertos mostrando patrones de duración diferentes en comparación con las fábricas o edificios comerciales, aunque estos factores fueron menos influyentes que el costo.

A pesar de estos resultados prometedores, los autores son cuidadosos al definir los límites de su trabajo. Enfatizan que esta herramienta no es un reemplazo para un cronograma de construcción detallado, el cual se crea más adelante en el proceso cuando todos los planes específicos son conocidos. El modelo está diseñado como una ayuda preliminar, una forma de comparar un cronograma propuesto contra datos históricos o de señalar posibles riesgos antes de presentar una oferta. Los investigadores también señalan que el rendimiento del modelo está ligado a los datos específicos con los que fue entrenado. Debido a que el conjunto de datos contenía solo 209 proyectos y estaba distribuido de manera desigual entre diferentes tipos y ubicaciones, el modelo podría comportarse de manera diferente si se aplicara a un país completamente nuevo o a una condición de mercado distinta. El estudio establece explícitamente que el modelo necesita ser probado con nuevos datos externos antes de que pueda ser confiable para decisiones críticas del mundo real.

En última instancia, esta investigación demuestra que, incluso con información muy limitada, es posible realizar conjeturas informadas sobre los cronogramas de construcción. Al enfocarse en las pocas variables que se conocen al inicio de un proyecto, el equipo creó un marco que ayuda a los tomadores de decisiones a navegar la incertidumbre de la fase inicial de planificación. El estudio muestra que, si bien una computadora no puede predecir el futuro con certeza perfecta, puede aprender del pasado para proporcionar una estimación razonable que es mejor que una simple suposición. Este enfoque ofrece una forma práctica de traer conocimientos basados en datos a las etapas más tempranas de la construcción, ayudando a gestionar las expectativas y a planificar los recursos antes de que se coloque el primer ladrillo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →