← 최신 논문
💻 computer science

Explainable Machine Learning for Early-Stage Construction Duration Prediction Using Limited Project Information

본 연구는 제한된 프로젝트 정보를 바탕으로 초기 단계의 건설 기간을 예측하기 위해 XGBoost 모델을 사용하는 설명 가능한 머신러닝 프레임워크를 제시하며, 해당 모델이 프로젝트 비용을 주요 동인으로 하여 강력한 예측 성능을 달성하는 반면, 그 결과는 데이터 분할에 대한 민감도 때문에 주의 깊은 해석이 필요함을 입증한다.

원저자: Mehmet Sena Kaşka, Işık Ateş Kıral

게시일 2026-09-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mehmet Sena Kaşka, Işık Ateş Kıral

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

모든 건설 프로젝트는 수정구슬 없이는 답하기 어려운 질문과 함께 시작됩니다. 바로 '건축하는 데 얼마나 걸릴 것인가?'라는 질문입니다. 설계도가 완전히 그려지기 전, 자재가 주문되기 전, 그리고 첫 삽을 뜨기 전에도 계약자와 고객은 타임라인을 결정해야 합니다. 이 결정은 예산, 인력 일정, 그리고 관련된 모든 이들의 재정적 리스크를 결정짓습니다. 전통적으로 이 질문에 답하기 위해서는 상세한 엔지니어링 계산과 모든 개별 작업에 대한 세부 내역이 필요했지만, 프로젝트 초기 계획 단계에서는 그러한 정보가 존재하지 않습니다. 이는 타임라인에 대한 필요성은 가장 높은 시점에, 타임라인을 만들기 위한 데이터는 가장 낮은 상태에 놓이게 되는 어려운 상황을 만듭니다.

이를 해결하기 위해 연구자들은 컴퓨터 프로그램이 정해진 규칙을 따르는 대신 데이터에서 패턴을 찾는 법을 배우는 컴퓨터 과학의 한 분야인 머신러닝에 주목했습니다. 건설업의 맥락에서 이러한 프로그램은 과거 프로젝트들을 살펴보고 비용이나 건물의 유형과 같은 특정 요인들이 공사 기간과 어떻게 연관되는지를 학습할 수 있습니다. 그러나 기존의 많은 시도들은 정확한 층수나 구체적인 현장 조건처럼 프로젝트가 이미 시작된 후에나 알 수 있는 데이터에 의존했습니다. 이는 가장 중요한 초기 의사결정 단계에서의 유용성을 제한합니다. 메흐메트 세나 카슈카(Mehmet Sena Kaşka)와 이식 아테쉬 키랄(Işık Ateş Kıral)의 새로운 연구는 프로젝트의 아주 초기에 가용한 기초 정보만을 사용하여 건설 기간을 예측하는 시스템을 구축함으로써 이 간극을 메웁니다.

연구진은 시스템을 학습시키기 위해 209개의 완료된 건설 프로젝트 데이터를 수집했습니다. 그들은 계획 단계에서 아직 알 수 없는 복잡한 세부 사항들을 의도적으로 무시했습니다. 대신, 컴퓨터에 네 가지 단순한 정보를 입력했습니다: 프로젝트 추정 비용, 소유주가 공공 기관인지 혹은 민간 기업인지 여부, 건물의 일반적인 유형, 그리고 지리적 위치입니다. 데이터셋에는 주거용 주택, 상업용 사무실부터 공장, 항만, 용수 송수관에 이르기까지 다양한 구조물이 포함되었으며, 중동, 북아프리카, 남아시아, 독립국가연합(CIS) 지역을 아우르는 다양한 지역을 포함했습니다. 이렇게 다양한 프로젝트를 활용함으로써 연구팀은 건설업의 좁은 단면이 아닌, 건설업의 복잡한 현실을 다룰 수 있는 모델을 만드는 것을 목표로 했습니다.

데이터를 분석하기 위해 연구팀은 여러 종류의 머신러닝 알고리즘을 테스트했습니다. 그들은 랜덤 포레스트(Random Forest), 엑스트라 트리(Extra Trees), 인공 신경망(Artificial Neural Networks), 그리고 XGBoost 모델을 비교했습니다. 이것들은 정보를 처리하는 방식이 각기 다른 수학적 접근법들입니다. 연구진은 단 한 번의 테스트로 승자를 결정하지 않도록 주의를 기울였습니다. 대신, 데이터의 분할 방식에 따른 우연한 결과가 아니라 결과가 안정적인지 확인하기 위해 데이터를 반복적으로 섞고 모델을 다양한 방식으로 테스트했습니다. 이러한 엄격한 테스트 결과, 일부 모델은 단일 테스트에서는 좋은 성능을 보였으나 데이터 변화에 민감하게 반응했습니다. 반면, 수많은 작은 결정 트리들을 구축하고 이를 결합하는 기술을 사용하는 XGBoost 모델이 이러한 반복 테스트 전반에 걸쳐 가장 일관된 성능을 보였습니다.

연구진이 선택한 최종 모델인 XGBoost는 데이터의 의미 있는 패턴을 포착했음을 시사하는 수준의 정확도를 달랐습니다. 모델이 본 적 없는 특정 프로젝트 세트로 테스트했을 때, 예측 오차는 평균 약 175일이었습니다. 이 수치가 큰 오차처럼 들릴 수도 있지만, 연구 대상 프로젝트의 기간은 최소 92일에서 최대 2,760일까지 다양했으며 중앙값은 669일이었습니다. 상세한 일정이 아직 존재하지 않는 초기 계획 단계라는 맥락에서 볼 때, 이 정도의 정밀도는 가치 있는 출발점을 제공합니다. 연구진은 단순히 숫자 하나만을 제공한 것이 아니라, 모델이 결론에 도달한 과정을 설명하는 도구들을 사용하여 결과가 '블랙박스' 같은 미스터리가 되지 않도록 했습니다.

모델의 논리를 분석한 결과, 프로젝트의 추정 비용이 기간을 예측하는 데 있어 가장 중요한 단일 요인으로 나타났습니다. 비용이 올라감에 따라 예측 기간도 일반적으로 증가했는데, 이는 규모가 크고 비싼 프로젝트일수록 더 오래 걸린다는 직관과 일치합니다. 그러나 모델은 비용만으로는 전체 이야기를 알 수 없다는 점도 학습했습니다. 지리적 위치와 프로젝트가 공공인지 민간인지 여부 또한 타임라인에 영향을 미쳤습니다. 예를 들어, 유사한 비용 수준에서도 특정 지역의 프로젝트가 다른 지역보다 더 오래 걸리는 것으로 예측되었습니다. 프로젝트 유형 또한 중요했는데, 인프라 및 항만 프로젝트는 공장이나 상업용 건물과는 다른 기간 패턴을 보였으나, 이러한 요인들은 비용보다는 영향력이 적었습니다.

이러한 유망한 결과에도 불구하고, 저자들은 자신들의 연구 한계를 명확히 정의하고 있습니다. 그들은 이 도구가 모든 구체적인 계획이 수립된 후 만들어지는 상세 건설 일정의 대체제가 아님을 강조합니다. 이 모델은 예비 보조 도구로서, 제안된 타임라인을 과거 데이터와 비교하여 벤치마킹하거나 입찰서를 제출하기 전에 잠재적 리스크를 식별하기 위한 용도로 설계되었습니다. 또한 연구진은 모델의 성능이 학습에 사용된 특정 데이터에 묶여 있다는 점을 언급했습니다. 데이터셋이 209개의 프로젝트만을 포함하고 있고 유형과 위치가 불균형하게 분포되어 있기 때문에, 완전히 새로운 국가나 다른 시장 상황에 적용될 경우 모델이 다르게 작동할 수 있습니다. 연구는 이 모델이 실제 중요한 의사결정에 신뢰받기 위해서는 새로운 외부 데이터에 대한 테스트가 필요하다고 명시하고 있습니다.

궁극적으로, 이 연구는 매우 제한적인 정보만으로도 건설 타임라인에 대해 정보에 기반한 추측을 하는 것이 가능하다는 것을 보여줍니다. 프로젝트의 아주 초기에 알려진 몇 가지 변수에 집중함으로써, 연구팀은 의사결정자들이 프로젝트 초기 단계의 불확실성을 헤쳐 나갈 수 있도록 돕는 프레임워크를 구축했습니다. 이 연구는 컴퓨터가 완벽한 확실성을 가지고 미래를 예측할 수는 없지만, 과거로부터 학습하여 단순한 추측보다 더 나은 합리적인 추정치를 제공할 수 있음을 보여줍니다. 이러한 접근 방식은 데이터 기반의 통찰력을 건설의 가장 초기 단계에 도입할 수 있는 실질적인 방법을 제시하며, 첫 벽돌을 쌓기 전 기대치를 관리하고 자원을 계획하는 데 도움을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →