← 최신 논문
💻 computer science

Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints

Handoff-H1은 전문화된 컴퓨터 비전 모델, 도구 활용 에이전트, 그리고 건설 지식 베이스를 통합하여 가공되지 않은 건축 설계도면으로부터 최첨단 자재 물량 산출을 수행함으로써, 커버리지와 정밀도 측면에서 프런티어 AI 모델과 독립적인 전문 견적사 모두를 능가하는 오케스트레이션된 비전 에이전트 시스템입니다.

원저자: Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla

게시일 2026-08-18
📖 6 분 읽기🧠 심층 분석

원저자: Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

집을 짓는 일은 하나의 약속에서 시작됩니다. 바로 건축가에게 무엇을 어떻게 지어야 하는지, 그리고 얼마나 많은 자재가 필요한지를 정확히 알려주는 도면 세트입니다. 이 청사진들은 단순한 스케치가 아닙니다. 선 하나가 벽을 의미하고, 주석 하나가 특정 종류의 목재를 암시하며, 치수 문자열이 보의 길이를 규정하는 복잡한 지침서입니다. 이 페이지들을 모든 스터드(stud), 모든 드라이월 시트, 모든 제곱피트의 지붕재를 세는 자재 목록으로 변환하는 작업은 '물량 산출(quantity takeoff)'이라고 불립니다. 수십 년 동안 이 영역은 수많은 페이지에 흩어진 정보를 읽고, 측정하고, 조정해야 하는 인간 전문가들의 영역이었으며, 종이 위에 나타나지 않는 지식을 통해 빈틈을 채워 넣어야 했습니다. 여기서 발생하는 실수는 단순한 계산 오류가 아닙니다. 그것은 수천 달러의 자재 낭비나, 잘못된 양의 콘크리트가 주문되어 프로젝트가 중단되는 상황을 의미할 수 있습니다.

오랫동안 컴퓨터 과학자들은 기계에게 이 작업을 가르치기 위해 노력해 왔습니다. 에세이를 쓰고 질문에 답할 수 있는 강력한 인공지능 시스템인 대규모 언어 모델(LLM)들이 이 도면들에 대해 테스트되었습니다. 이들은 텍스트를 읽고 단어를 이해할 수는 있지만, 청사진의 시각적 실체를 파악하는 데는 어려움을 겪습니다. 벽을 볼 수는 있지만 길이를 정확하게 측정하지 못하거나, 두 페이지에 걸쳐 나타나는 문을 두 개의 별개 문으로 셀 수도 있습니다. 이들은 숙련된 건축가들이 머릿속에 담고 있는 건설 관례(예를 들어, 벽이 정해진 간격으로 배치된 스터드로 구축된다는 점)와 같은 구체적이고 근거 있는 이해력이 부족합니다. 그 결과, 기계가 말할 수 있는 것과 실제로 계산할 수 있는 것 사이에는 격차가 발생했습니다.

Handoff AI Research의 연구팀은 이제 더 똑똑한 단일 기계를 만드는 것이 아니라, 서로 협력하는 전문화된 도구들의 팀을 구축함으로써 이 격차를 메우기 위해 설계된 Handoff-H1이라는 시스템을 선보였습니다. 실제 주거용 청사진을 기반으로 한 새로운 벤치마크로 평가된 이들의 연구는, 컴퓨터 비전, 특화된 소프트웨어 도구, 그리고 구조화된 지식 베이스를 결합한 시스템이 현재의 최고 수준 인공지능 모델들보다 더 철저할 뿐만 아니라, 인간 전문가의 정확성과 완결성에도 필적하는 자재 추정치를 생성할 수 있음을 보여줍니다.

문제의 핵심은 건설 도면이 정보를 전달하는 방식에 있습니다. 청사진은 모든 못이나 스터드를 나열하지 않습니다. 대신 구조를 보여주며 독자가 표준 규칙을 적용할 것을 전제로 합니다. 만약 도면에 벽이 그려져 있다면, 인간 추산가는 도면에 명시적으로 간격이 적혀 있지 않더라도 표준 간격에 따라 목재 스터드의 개수를 계산할 줄 압니다. 이는 평면도를 보고, 치수를 측정하고, 다른 페이지의 주석을 확인한 다음, 최종 수치에 도달하기 위해 경험적인 규칙을 적용하는 과정을 필요로 합니다. 이 과정은 세 가지 뚜로 된 과제를 포함합니다: 시각적 요소를 명확하게 보는 것, 여러 페이지를 가로질러 관련 정보를 연결하는 추론, 그리고 문서화되지 않은 업계 관례에 결과를 접목하는 것입니다.

Handoff-H1은 세 개의 레이어를 통해 이러한 과제들을 해결합니다. 첫 번째 레이어는 목적에 맞게 제작된 컴퓨터 비전 모델 세트입니다. 일반적인 이미지 판독기와 달리, 이 모델들은 유형화된 요소들(방, 벽, 문, 창문)을 식별하고 라벨링하도록 건설 도면에 특화되어 훈련되었습니다. 이들은 원본 PDF 파일로부터 기본 구조를 복구하는 시스템의 '눈' 역할을 합니다. 두 번째 레이어는 지속적인 프로젝트 기초(foundation)로, 눈이 본 것을 정리하는 구조화된 데이터베이스입니다. 이 기초는 공사 현장이 실제로 구축되는 방식과 유사하게 정보를 계층적으로 조직하며, 작업을 프레이밍, 배관, 전기와 같은 서로 다른 공종(trade)으로 구분합니다. 결정적으로, 이 기초는 선별된 건설 규칙 및 관례 지식 베이스에 근거하고 있어, 예를 들어 특정 유형의 지붕이 평면적인 도면에는 보이지 않는 특정 경사도 계산을 필요로 한다는 점을 시스템이 알 수 있게 해줍니다.

세 번째 레이어는 비전 에이전트(vision agents)의 오케스트레이션입니다. 이들은 기초로부터 얻은 정보와 비전 모델이 제공하는 도구를 사용하여 실제 계산과 측정을 수행하는 소프트웨어 작업자들입니다. 이들은 한꺼번에 모든 것을 하려고 하지 않습니다. 대신 한 번에 하나의 공종에 집중하여, 복잡한 계획을 개별 구성 요소로 분해합니다. 예를 들어 프레이밍 계획을 개별 스터드 하나하나로 나누는 식입니다. 만약 에이전트가 확신이 서지 않는다면, 단순히 추측하는 대신 특정 영역을 세거나 측정하기 위해 특화된 도구를 호출할 수 있습니다. 마지막으로, 독립적인 검증 단계가 작업을 감사하여, 최종 목록이 생성되기 전에 누락된 항목이나 불가능한 수량이 있는지 확인합니다.

시스템을 테스트하기 위해 연구진은 TAKEOFFBENCH-V1이라는 벤치마크를 만들었습니다. 이들은 허가를 받은 10개의 실제 주거용 청사진 세트를 수집하고, 이를 '골드 스탠다드(gold standard)' 자재 목록과 짝지었습니다. 이 골드 스탠다드는 한 명의 사람이 만든 것이 아니라, 여러 명의 독립적인 전문 추산가들이 동일한 도면을 가지고 작업한 후 그들의 결과를 조정하여 만들어낸 검증된 진실입니다. 이 접근 방식은 인간 전문가들조차 특정 측정값에 대해 의견이 다를 수 있다는 점을 인정하며, 따라서 이 벤치마크는 불가능한 이상향이 아닌 현실적이고 고품질인 기준을 반영합니다. 이 벤치마크에는 콘크리트와 프레이밍부터 드라이월과 지붕재에 이르기까지 9가지 다른 건설 공종을 아우르는 2,000개 이상의 검증된 품목이 포함되어 있습니다.

연구진이 테스트를 실행했을 때 결과는 놀라웠습니다. 그들은 Handoff-H1을 폐쇄형 및 오픈 웨이트 시스템을 모두 포함한 7개의 가장 진보된 인공지능 모델들과 비교했습니다. 이 모델들에게는 동일한 원본 PDF 파일이 주어졌고 자재 목록을 작성하도록 요청되었습니다. 가장 뛰어난 프런티어 모델들은 약 61%의 종합 점수를 기록했습니다. 반면, Handoff-H1은 81.6%의 점수에 도달했습니다. 약 20점의 이 격차는 상당한 것으로, 비전, 지식, 오케스트레이션의 결합인 Handoff-H1의 특화된 아키텍처가 범용 모델이 해결할 수 없는 문제를 해결하고 있음을 시사합니다.

아마도 더 중요한 점은, 이 시스템이 직접적인 '그라운드 트루스(ground truth)'를 만든 인간 전문가들과 직접 비교되었다는 것입니다. 이 인간들이 동일한 골드 스탠다드를 기준으로 점수를 매겼을 때, 그들은 77.6%의 종합 점수를 기록했습니다. H-H1은 인간의 평균을 능가했으며, 10개의 도면 세트 중 6개에서 인간 전문가보다 높은 점수를 받았습니다. 시스템은 더 철저하게 작업함으로써 이를 달성했습니다. 특히 인간 추산가들이 세부 사항을 놓치거나 범위를 건너뛰기 쉬운 프레이밍이나 지붕재와 같은 복잡한 영역에서 더 많은 항목을 찾아내고 계산했습니다. 인간 전문가들은 자신들이 찾은 항목에 대해서는 약간 더 정밀했지만, 시스템의 커버리지(coverage) 능력은 훨씬 우수했기에 전체적인 추정치에서 더 나은 결과를 냈습니다.

결과 분석을 통해 시스템이 탁월한 부분과 여전히 과제로 남은 부분을 밝혀냈습니다. 시스템은 면적과 경사도로부터 수량을 도출해야 하는 공종, 즉 인간 추산가들이 일관성을 유지하기 어려워하는 지붕재나 드라이월 작업에서 매우 뛰어난 성능을 보였습니다. 또한 배관 설비나 창문과 같은 카운팅 작업에서도 매우 우수한 성과를 냈습니다. 그러나 인간과 마찬가지로, 시스템 역시 연속적인 측정값(예: 벽의 정확한 길이 또는 지붕의 면적)을 가장 어려운 과제로 꼽았습니다. 이러한 작업은 치수선이 벽의 두께를 포함하는지 여부와 같이, 인간 전문가들 사이에서도 논쟁이 될 수 있는 도면상의 모호함을 해결해야 합니다. 이러한 측정에 대한 시스템의 정밀도는 인간 전문가보다 약간 낮았지만, 전반적인 커버리지는 훨씬 우수했습니다. 즉, 누락되는 항목이 더 적었다는 뜻입니다.

연구진은 이러한 성공이 단일한 인공지능의 돌파구 때문이 아니라, 서로 다른 역량들의 세심한 결합 덕분이라고 강조합니다. 가장 진보된 범용 모델이라 할지라도, 동일한 원본 입력을 받았을 때 인간 전문가나 Handoff-H1 시스템의 수준에 도달하지 못했습니다. 이 모델들은 유창해 보이지만 차원적 근거가 부족한 추정치를 내놓는 경향이 있었으며, 도면을 자재 목록으로 바꾸는 데 필요한 공종별 로직을 결여한 채 수량을 환각(hallucination)하거나 누락하곤 했습니다. Handoff-H1 시스템이 성공한 이유는 단일 모델이 모든 것을 하도록 두지 않았기 때문입니다. 대신 보는 것, 아는 것, 추론하는 것을 분리하는 구조화된 접근 방식을 사용했습니다.

이 연구는 인공지능이 전문 분야로 나아가는 경로를 제시합니다. 복잡한 현실 세계의 과제를 수행하는 데 있어 가장 효과적인 시스템은 가장 큰 언어 모델을 가진 시스템이 아니라, 해당 도메인의 구조와 규칙에 대한 깊은 이해를 바탕으로 구축된 시스템임을 입증합니다. 컴퓨터 비전을 큐레이션된 지식 베이스 및 구조화된 워크플로우와 결합함으로써, 시스템은 인간 전문가와 대등한 수준의 성능을 달 achievement 할 수 있었습니다. 연구진은 다른 이들이 자신의 시스템을 동일한 벤치마크로 테스트할 수 있도록 평가 도구를 공개하면서도, 시스템이 정답을 단순히 암기하는 것을 방지하기 위해 실제 청사진 데이터와 그라운드 트루스는 제한해 두었습니다. 이러한 접근 방식은 미래의 발전이 훈련 데이터를 회상하는 능력이 아니라 진정한 역량에 의해 측정되도록 보장합니다.

연구는 시스템이 완벽하지는 않지만, 오랫동안 인간 전문가들의 독점 영역이었던 작업을 자동화하는 데 있어 중요한 진전임을 결결론짓습니다. 이 시스템은 인간의 감독을 대체하는 것이 아니라, 혼자 일하는 인간보다 더 철저하고 일관될 수 있는 도구를 제공합니다. 단 한 번의 실수가 수천 달ender의 비용을 초래할 수 있는 분야에서, 일련의 도면으로부터 더 완전하고 정확한 자재 목록을 생성하는 능력은 실질적인 개선입니다. 범용 인공지능 모델과 평균적인 인간 추산가를 모두 능가한 시스템의 성능은 특화된 비전, 구조화된 지식, 그리고 오케스트레이션된 추론의 결합이 복잡한 현실 문제를 해결하는 강력한 접근 방식임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →