← 최신 논문
🤖 AI

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

이 논문은 건축 및 토목 공학을 위한 엄격한 벤치마크인 MMArch를 소개하며, 이는 분산된 시각적 증거를 공학적 원리와 결합하여 합성하는 멀티모달 거대 언어 모델의 능력을 평가함으로써 현재의 AI 시스템과 인간 전문가 사이의 상당한 성능 격차를 드러낸다.

원저자: Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 건축가가 되는 법을 가르치려 한다고 상상해 보세요. 단순히 사진 속의 물체가 집이라는 것을 인식하는 수준을 넘어, 왜 그 집이 무너지지 않는지까지 이해시키고 싶습니다. 이것이 바로 "멀티모달 거대 언어 모델(Multimodal Large Language Models, MLLMs)"의 세계입니다. 이 모델들을 텍스트를 읽는 동시에 이미지를 볼 수 있는 매우 똑똑한 디지털 두뇌라고 생각하면 됩니다. 이들은 "저것은 파란색 문이다"라거나 "이 차트는 선이 위로 올라가고 있다"라고 말하는 것처럼 자신이 보는 것을 설명하는 데 능숙합니다. 하지만 실제 공학의 세계에서는 무엇을 보고 있는지 아는 것만으로는 충분하지 않습니다. 도면, 물리 법칙, 그리고 안전 규정 사이의 점들을 연결하여 판단을 내려야 합니다. 이는 마치 형사가 범죄 현장 사진을 보고 특정 법률을 기억해 낸 뒤, 용의자가 유죄인지 결정해야 하는 것과 같습니다. 연구자들이 던진 큰 질문은 이것입니다. 이 AI 탐정들이 실제로 사건을 해결할 수 있을까요, 아니면 그저 보이는 단서들을 바탕으로 추측하고 있는 것일까요?

여기서 MMArch라는 새로운 연구가 등장합니다. 연구진은 AI가 정말로 엔지니어처럼 "생각할" 수 있는지 확인하기 위해 건축 및 토목 공학을 위한 거대하고 까క한 테스트를 구축했습니다. 그들은 단순히 이미지를 묘사하라고 요구하는 대신, 답이 도면의 여러 부분에 숨겨져 있고 이를 풀기 위해 특정 물리 법칙이 필요한 퍼즐을 제시했습니다. 결과는 다소 경종을 울리는 것이었습니다. 가장 똑똑한 AI 모델들이 질문의 약 절반 정도를 맞힐 수 있었던 반면, 인간 전문가 팀은 거의 모든 문제를 맞혔습니다. 이 연구는 AI가 실패하는 이유가 그림을 "볼 수 없어서"가 아니라, 그림을 올바른 규칙과 연결하고 수학적 계산을 수행하여 답을 도출하는 데 실패했기 때문임을 밝혀냈습니다. 이는 AI가 메뉴를 읽고 재료가 무엇인지 알 수는 있지만, 어떻게 요리를 해야 하는지는 모르는 것과 같습니다.

거대한 테스트: MMArch

연구진은 MMArch(Multimodal Architecture)라는 벤치마크를 만들었습니다. 이것을 AI를 위한 기말고사라고 생각하세요. 다만 객관식처럼 찍어서 맞출 수 있는 문제가 아니라, 단답형 시험입니다. 이 시험은 건물, 교량, 도시와 관련된 실제 피어 리뷰(peer-reviewed) 과학 논문에서 직접 추출한 1,212개의 질문으로 구성되어 있습니다. 이것들은 가공의 그림이 아닙니다. 엔지니어들이 자신의 설계가 작동함을 증명하기 위해 사용하는 실제 도면들입니다.

테스트는 건물이 지진 발생 시 어떻게 흔들리는지부터 디지털 도시 모델을 설계하는 방법까지 10가지 다른 분야를 다룹니다. AI가 지름길을 사용하지 못하도록 연구진은 영리한 "플래너-라이터(planner-writer)" 시스템을 사용했습니다. 먼저, "플래너"가 논문을 살펴보고 특정 정답(예: "철근 #6 및 #7")을 선택했습니다. 그런 다음, "라이터"는 그 답을 찾기 위해 반드시 그림을 보고 공학 법칙을 알아야만 하는 질문을 만들었습니다. AI는 텍스트만 읽거나 이미지의 작은 부분만 봐서는 안 되며, 전체 그림을 보고 올바른 단서를 찾아 규칙을 적용하여 문제를 풀어야 했습니다.

결과: AI vs 인간

18개의 AI 모델(무료 오픈 소스 모델과 고가의 최상위 상용 모델 모두 포함)을 이 테스트에 통과시켰을 때, 결과는 명확했습니다. AI는 여전히 진짜 엔지니어가 되려면 갈 길이 아주 멉니다.

  • 인간 전문가: 실제 건축가와 엔지니어로 구성된 패널은 **94.6%**의 정답률을 기록했습니다. 그들은 시험을 완벽하게 통과했습니다.
  • 최고의 AI: 가장 똑똑한 상용 AI 모델(GPT-5.5)은 단 **51.7%**만을 맞혔습니다.
  • 오픈 소스 AI: 가장 뛰어난 무료 모델은 약 **30%**를 기록했습니다.

그 격차는 40 퍼센트 포인트 이상입니다. 최고의 AI조차 겨우 합격 점수를 넘기는 수준인 반면, 인간은 완벽에 가까운 점수를 받았습니다. 연구진은 AI가 단순히 추측하거나 그림 대신 텍스트를 읽고 있는 것이 아닌지 확인했으며, AI가 실제로 추론 과정에서 어려움을 겪고 있다는 것을 확인했습니다.

왜 AI는 어려움을 겪는가?

연구팀은 단순히 점수만 매긴 것이 아니라, AI가 틀렸는지 분석했습니다. 그들은 문제가 AI가 그림을 "보지 못해서"가 아님을 발견했습니다. AI는 도면에서 올바른 선과 숫자를 찾아내는 데는 꽤 능숙했습니다. 진짜 문제는 AI가 자신이 본 것과 알고 있는 것을 결합하려고 할 때 발생했습니다.

그들은 실수를 다섯 가지 유형으로 분류했습니다:

  1. 지각 오류 (Perception Errors, 20.3%): AI가 그림을 잘못 읽었습니다 (예: 두 개의 유사한 선을 혼동함).
  2. 원리 오류 (Principle Errors, 21.7%): 그림은 제대로 보았으나 잘못된 규칙을 사용했습니다 (예: 그래프의 넓은 루프가 재료가 약해지는 것을 의미한다고 생각했지만, 실제로는 강해지는 것을 의미함).
  3. 구성 오류 (Composition Errors, 35.8%): 이것이 가장 큰 문제였습니다. AI는 올바른 숫자와 규칙을 찾았지만, 그것들을 결합하여 최종 답을 도출하려 할 때 단계를 빠뜨리거나 수학적 계산을 틀렸습니다. 이는 모든 재료와 레시피를 가지고 있으면서도, 재료를 섞는 순서를 틀려 케이크를 태워 먹는 것과 같습니다.
  4. 그라운딩 오류 (Grounding Errors, 14.5%): 무엇을 찾아야 할지는 알았지만 숫자를 잘못 읽었습니다 (예: -142 대신 +138이라고 말함).
  5. 일관성 오류 (Consistency Errors, 7.7%): 머릿속으로는 정답을 도출했으나 엉뚱한 답을 적었습니다.

가장 큰 시사점은 구성 오류가 전체 실수의 3분의 1 이상을 차지했다는 것입니다. 이는 AI의 가장 큰 약점이 점들을 연결하는 능력임을 의미합니다. AI는 증거를 볼 수 있고 규칙을 회상할 수 있지만, 복잡한 문제를 풀기 위해 이 둘을 신뢰성 있게 결합하지는 못합니다.

"단계별로 생각하기"가 도움이 될까?

AI에게 "단계별로 생각하라"고 말하는 것(Chain-of-Thought 기술)이 어려운 문제를 푸는 데 도움이 된다는 말을 들어보셨을 것입니다. 연구진은 MMArch에 이 방법을 시도했습니다. 그들은 AI에게 답을 내놓기 전에 추론 과정을 설명하도록 요청했습니다. 결과는 어땠을까요? 별로 도움이 되지 않았습니다. 어떤 모델에는 약간 도움이 되었지만, 어떤 모델에는 오히려 성능을 떨어뜨리기도 했습니다. 이는 문제가 AI에게 어떻게 생각해야 하는지 알려주지 못해서가 아니라, 올바른 사고의 사슬을 구축하기 위해 필요한 건축 및 공학의 구체적인 규칙에 대해 충분히 알지 못한다는 것을 시사합니다.

향-후 과제

이 연구는 단순히 AI를 더 크게 만들거나 더 많은 데이터를 준다고 해서 해결될 문제가 아니라고 결론짓습니다. 문제는 규모의 문제가 아니라, 깊이 있는 전문적 추론의 부재입니다. AI는 현재의 모델들이 할 수 없는 방식으로 시각적 증거를 도메인 지식과 결합하는 법을 배워야 합니다.

MMArch는 이제 다른 연구자들이 훈련장으로 사용할 수 있도록 공개되었습니다. 이는 AI가 정확히 어느 부분에서 실패하는지 진단하여 미래에 더 나은 모델을 구축할 수 있도록 돕는 도구입니다. 그때까지, 지진에도 무너지지 않는 마천루를 설계해야 한다면, 로봇에게 묻기보다는 여전히 인간 전문가를 고용하는 것이 훨씬 현명할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →