← 최신 논문
💻 computer science

Verication-driven closed-loop multi-agent large language modelframework for code-compliant structural design

이 논문은 외부 물리 기반 검증기와 이중 노드 수리 메커니즘을 통합하여 코드 위반 사항을 실행 가능한 제약 조건으로 변환함으로써, 구조 설계의 코드 준수 및 안전성을 크게 향상시키는 동시에 재료 사용량을 줄이는 검증 주도형 폐쇄 루프 멀티 에이전트 LLM 프레임워크를 소개한다.

원저자: Jianbin Luo, Weibin Lin, Yiran Lin, Qing Wei, Wei Guo

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Jianbin Luo, Weibin Lin, Yiran Lin, Qing Wei, Wei Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 건축가의 안전망

당신이 아주 똑똑한 로봇에게 다리를 건설하는 법을 가르치고 있다고 상상해 보십시오. 당신은 로봇에게 수백만 권의 책, 기사, 그리고 설계도를 학습한 뇌인 언어 모델(LLM)을 제공하여, 로봇이 당신의 요청을 이해하고 설계를 '꿈꿀' 수 있게 합니다. 이것이 바로 **거대 언어 모델(LLM)**의 세계입니다. 이들은 이야기를 쓰고, 소프트웨어를 코딩하며, 심지어 복잡한 물리학을 쉬운 단어로 설명하는 데 탁월합니다. 하지만 여기 함정이 있습니다. LLM은 언어의 달인이지만, 물리학의 달인은 아닙니다. LLM은 모든 적절한 기술 용어를 사용하여 완벽해 보이는 다리를 묘사할 수는 있지만, 실제로 그 다리를 건설한다면 수학적 계산이 맞지 않아 무너질 수도 있습니다. 이를 "환각(hallucination)"이라고 부릅니다. 로봇은 자신만만하지만, 틀린 것입니다.

현실 세계, 특히 마천루나 다리와 같은 구조물을 건설할 때는 "대체로 맞음" 정도로는 충분하지 않습니다. 반드시 **코드 준수(code compliance)**가 필요합니다. 즉, 설계가 안전을 보장하기 위해 규칙집(건축 법규)을 엄격히 따라야 한다는 뜻입니다. 수십 년 동안 엔지니어들은 컴퓨터를 사용하여 이러한 규칙을 확인해 왔지만, 인간의 아이디어를 컴퓨터 모델로 변환하고 이를 검증하는 과정은 느리고 수동적이었습니다. 연구자들이 던지는 핵심 질문은 이것입니다. 단순히 설계를 추측하는 것이 아니라, 실제로 자신의 작업을 검증하고, 실제 강철에 손을 대기도 전에 실수를 스스로 수정할 수 있는 AI를 만들 수 있을까? 이 논문은 바로 그 도전에 뛰어들어, 수다스러운 AI를 신뢰할 수 있고 안전을 의식하는 엔지니어로 바꾸고자 합니다.

"자기 수정"의 함정과 마법의 루프

연구자들은 흔히 사용하는 아이디어에서 시작했습니다. 만약 우리가 AI에게 "자신의 작업을 확인하고 다시 시도하라"고 요청하기만 하면 더 나아지지 않을까 하는 생각입니다. 하지만 그들은 놀라운 사실을 발견했습니다. 외부의 도움 없이 AI가 스스로 실수를 고치도록 내버려 두었을 때, AI는 상황을 악화시키거나 제자리걸음만 하는 경우가 많았습니다. 이는 마치 수학 시험에서 낙제한 학생에게 선생님이나 계산기 없이 그냥 "다시 해봐"라고 말하는 것과 같습니다. 학생은 똑같은 오답을 더 자신만만하게 적어낼 뿐일 것입니다. 이 논문은 자기 수정(self-correction)만으로는 안전이 중요한 작업에서 신뢰할 수 없다고 주장합니다.

대신, 연구팀은 **검증 주도형 폐쇄 루프 프레임워크(verification-driven closed-loop framework)**를 구축했습니다. 이것을 단 한 명의 학생이 아니라, 매우 엄격하고 눈을 떼지 않는 안전 검사관을 동반한 건설 팀이라고 생각하십시오. 시스템은 다음과 같이 작동합니다.

  1. 몽상가 (AI): 일련의 AI 에이전트들이 협력하여 보(beam)나 트러스(truss)와 같은 구조물을 설계합니다.
  2. 검사관 (물리 검증기): 설계가 승인되기 전, 설계안은 물리 시뮬레이터 역할을 하는 "하드" 컴퓨터 프로그램(유한 요소 해석기)으로 보내집니다. 이것은 AI의 추측이 아니라, 하중과 응력 하에서 구조물이 정확히 어떻게 반응할지를 계산하는 수학 엔진입니다.
  3. 규칙집 (코드 검사기): 두 번째 도구가 실제 건축 법규(콘크리트의 경우 GB 50010, 강철의 경우 GB 50017 등)에 따라 설계를 검사합니다.
  4. 루프 (Loop): 설계가 실패하면 시스템은 단순히 "다시 시도하라"고 말하는 데 그치지 않습니다. 대신 AI에게 구체적인 메모를 보냅니다: "당신의 보는 21% 더 얇습니다" 또는 "응력이 너무 높습니다." 그러면 AI는 이 확정된 데이터를 바탕으로 설계를 조정하고 다시 시도합니다. 이 순환은 설계가 모든 테스트를 통과할 때까지 반복됩니다.

무엇을 발견했는가: "아마도"에서 "확실히"로

연구팀은 이 시스템을 5가지 유형의 구조물(단순 보, 캔틸레버 보, 연속 보, 트러스, 프레임)을 포함한 44가지의 서로 다른 설계 사례에 대해 테스트했습니다. 결과는 극적이었습니다.

이 엄격한 루프 없이 AI가 작업하게 했을 때(오픈 루프 방식), AI가 설계를 제대로 완성한 비율은 **56.8%**에 불과했습니다. 즉, 거의 절반의 경우 AI가 안전 규칙을 위반하는 설계를 내놓았다는 뜻입니다. 하지만 외부 물리 검증기와 함께 폐쇄 루프 시스템을 가동하자 성공률은 **98.6%**로 급등했습니다.

단순히 통과하는 것뿐만 아니라 효율성 또한 높았습니다. 루프를 거친 AI 설계는 그렇지 않은 설계보다 약 5.8% 적은 재료를 사용했습니다. 이는 AI가 안전을 위해 불필요하게 크게 만드는 '과잉 설계'를 멈추고, 구조물은 안전하면서도 자원을 덜 사용하는 "최적의 지점"을 찾아냈음을 의미합니다. 전체적인 설계 품질 점수는 63.8에서 71.4로 상승했습니다.

"2단계 노드"의 수리 방식

논문은 수리 과정을 두 가지 뚜렷한 "노드" 또는 단계로 나누어 설명하며, 이는 도구 상자의 서로 다른 도구처럼 작동합니다.

  • 노드 1 (강제 수정 - The Hard Fix): 만약 설계가 규칙을 위반하면(예: 보가 너무 많이 휘는 경우), 이 노드는 이를 강한 제약 조건으로 취급합니다. 이 노드는 AI에게 "반드시 이것을 더 크게 만들어야 한다"라고 명령합니다. 이는 마치 엄격한 코치가 "제대로 할 수 있을 때까지 달려라"라고 말하는 것과 같습니다. 이 단계는 크고 위험한 오류들을 해결했습니다.
  • 노드 2 (부드러운 다듬기 - The Soft Polish): 설계가 안전해지면, 이 노드는 4차원 점수(안전성, 비용, 효율성, 지속 가능성)를 살펴봅니다. 만약 점수가 조금 낮다면, 이 노드는 안전을 위협하지 않으면서도 설계를 더 좋게 만들기 위해 AI를 부드럽게 유도합니다.

연구진은 **노드 1이 처음부터 잘못된 설계에 대해 핵심적인 역할(heavy lifting)**을 수행한 반면, 노드 2는 이미 안전한 설계를 다듬는 역할을 담당했다는 것을 발견했습니다. 만약 두 노드 중 하나라도 제거한다면 시스템 성능이 떨어졌으며, 이는 "강제 수정"과 "부드러운 다듬기"가 모두 필요함을 입증합니다.

"블랙박스" 문제의 해결

AI에 대한 가장 큰 우려 중 하나는 그것이 "블랙박스"라는 점, 즉 답은 얻었지만 그런 결과가 나왔는지 알 수 없다는 점입니다. 이 시스템은 이를 해결합니다. 검색 증강 생성(RAG) 시스템을 사용하기 때문에, AI가 실수를 할 때마다 단순히 "틀렸다"고 말하는 것이 아니라, 위반된 건축 법규의 정확한 페이지와 문단을 찾아 제시합니다. 이는 학생이 문제를 틀렸을 때, 규칙을 설명하는 교과서의 특정 문장을 직접 가리키는 것과 같습니다. 이 덕분에 AI의 결정은 감사가 가능하며(auditable) 추적이 가능합니다.

한계와 미래

이 논문은 이 시스템이 아직 할 수 없는 것에 대해서도 매우 솔직합니다. AI는 보의 크기나 강철의 양(파라미터)을 조절하는 데는 뛰어나지만, 원래의 형상이 근본적으로 결함이 있는 경우 건물 전체의 형태(토폴로지)를 재설계할 수는 없습니다. 예를 들어, AI가 건너야 할 간격에 비해 너무 짧은 다리를 수정하려고 한다면, 보의 크기를 아무리 조절해도 소용이 없습니다. 이런 경우 시스템은 "크게 실패(fails loudly)"합니다. 즉, 동작을 멈추고 인간 엔지니어에게 "나는 이것을 고칠 수 없습니다. 설계를 변경해야 합니다"라고 알립니다. 위험한 답을 내놓기를 거부하는 것입니다.

연구진은 또한 다른 AI 두뇌(하나의 대규모 모델에서 다른 모델로 전환)를 사용했을 때도 이 방식이 작동하는지 테스트했습니다. 그들은 어떤 AI 모델을 사용하든 성공률이 동일하게 유지됨을 발견했습니다. 이는 안전성이 AI가 얼마나 "똑똑한가"가 아니라, 외부 물리 검증기로부터 온다는 것을 시사합니다. 쇼를 안전하게 유지하는 것은 공중 곡예사가 아니라 안전망입니다.

결론

이 논문은 우리가 안전한 건물을 짓기 위해 AI가 스스로 "생각"하기만을 기다려서는 안 된다는 것을 보여줍니다. 대신, AI가 창의적인 작업을 수행하되, 수학에 기반한 엄격한 검사관이 모든 단계를 확인하는 시스템을 구축해야 합니다. "만들기"와 "확인하기" 사이의 루프를 닫음으로써, 연구진은 성공률이 **56.8%**에 불과했던 시스템을 **98.6%**의 성공률을 가진 시스템으로 탈바꿈시켰으며, 더 적은 재료를 사용하면서도 규칙을 완벽하게 준수하게 만들었습니다. 이는 AI가 단순히 공학에 대해 이야기하는 것을 넘어, 실제로 우리 모두를 위해 더 안전하고, 스마트하며, 효율적인 구조물을 짓는 데 도움을 주는 미래를 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →