← 최신 논문
💻 computer science

ARCHER: Agentic Rule and Compliance Harness for Executable Regulations

이 논문은 규제 문서로부터 감사 가능한 검증 코드를 생성하여 확장 가능하고 투명하며 매우 정확한 건축물 준수 여부 점검을 달성하는 결정론적 다중 에이전트 프로그램 합성 하네스인 ARCHER를 소개하며, 셀프 호스팅된 오픈 웨이트 모델이 비용을 극히 일부만 사용하면서도 프런티어 API 성능에 필적할 수 있음을 입증한다.

원저자: Chiraag Singh Anand, Xue Wen Tan, Lionel Teo, Eric Tan

게시일 2026-07-29
📖 5 분 읽기🧠 심층 분석

원저자: Chiraag Singh Anand, Xue Wen Tan, Lionel Teo, Eric Tan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 집을 짓기 위한 매우 엄격한 규칙 세트를 따르도록 가르치려 한다고 상상해 보십시오. 문제는 로봇이 게으른 것이 아니라, 규칙서가 "복도가 충분히 넓은지 확인하라"와 같은 모호한 문구로 가득 찬 인간의 언어로 쓰여 있다는 점입니다. 로봇은 오직 수학과 기하학만을 이해할 뿐입니다. 건축 분야에서 이러한 규칙들은 "건축 법규(building codes)"라고 불리며, 설계도는 BIM(Building Information Modeling)이라 불리는 디지털 3D 모델입니다. 수십 년 동안 설계가 규칙을 준수하는지 확인하는 작업은 거대한 비용이 드는 골칫거리였으며, 대개 수천 줄의 코드와 기하학적 형상을 수동으로 스캔하기 위해 군대 규모의 전문가 인력이 필요했습니다. 이는 마치 백만 권의 책이 있는 도서관에서 돋보기를 들고 모든 페이지를 일일이 읽으며 단 하나의 오타를 찾아내려는 것과 같습니다.

최 최근, 과학자들은 이를 돕기 위해 스스로 생각하고, 계획하며, 코드를 작성할 수 있는 똑똑한 컴퓨터 프로그램인 "AI 에이전트"를 사용하기 시작했습니다. 하지만 여기에는 함정이 있습니다. 만약 당신이 똑똑한 AI에게 단순히 "규칙 검사기를 작성하라"고 요청한다면, AI는 종종 혼란에 빠져 존재하지 않는 규칙을 만들어내거나, 실행 시 충돌이 발생하는 코드를 작성하곤 합니다. 이는 마치 레시피 없이 유능하지만 무질서한 요리사에게 케이크를 구워달라고 부탁하는 것과 같습니다. 그들은 맛있는 것을 만들어낼 수도 있지만, 주방을 홀랑 태워버릴 수도 있습니다. 연구자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 AI 에이전트가 단순히 추측하는 것이 아니라, 우리가 신뢰할 수 있는 안정적이고 작동 가능한 도구를 실제로 구축하도록 조직화할 것인가? 이 퍼즐을 풀기로 결정한 팀은 싱가포르 정보통신미디어개발청(IMDA)의 연구진입니다.

ARCHER: AI 건축가 팀

이 논문은 ARCHER(Agentic Rule and Compliance Harness for Executable Regulations)라고 불리는 새로운 시스템을 소개합니다. ARCHER를 단일한 초지능이 아니라, 모든 구성원이 특정 직무를 가지고 엄격하고 깨지지 않는 일정을 따르는 고도로 조직화된 건설 현장 팀이라고 생각하십시오.

과거에 연구자들은 하나의 AI 모델에게 큰 프롬프트를 주고 운 좋게 잘 되기를 바라는 방식을 시도했습니다. 저자들은 이를 "블라인드(Blind)" 방식이라고 부릅니다. 이는 학생에게 복잡한 수학 문제를 건네주며, 검토할 기회도 주지 않은 채 "알아서 풀어봐"라고 말하는 것과 같습니다. 논문은 이 방법이 신뢰할 수 없다는 것을 발견했습니다. 가장 똑똑한 AI 모델조차 너무 늦기 전까지 자신의 실수를 볼 수 없기 때문에 정답을 맞히는 데 실패하는 경우가 많았습니다.

ARCHER는 **결정론적 오케스트레이션(deterministic orchestration)**을 갖춘 멀티 에이전트 시스템을 사용하여 게임의 판도를 바꿉니다. 이를 비유로 풀어보겠습니다:

당신이 모호한 설명서를 바탕으로 완벽한 레고 성을 만들려고 한다고 가정해 봅시다.

  1. 플래너(Planner): 먼저, "플래너" 에이전트가 설명서를 읽고 성을 어떻게 쌓을지에 대한 단계별 스케치를 그립니다. 아직 브릭을 만지지는 않고, 오직 계획만 세웁니다.
  2. 제너레이터(Generator): 다음으로, "제너레이터" 에이전트가 그 스케치를 따라 실제 컴퓨터 코드를 작성하며 레고 브릭을 조립하기 시작합니다.
  3. 이밸류에이터(Evaluator): 그다음, 엄격한 "이밸류에이터" 에이전트가 성을 검사합니다. 원래의 규칙에 따라 모든 벽을 측정하고 모든 브릭의 개수를 셉니다. 만약 벽이 너무 짧다면, 이밸류에이터는 단순히 "틀렸다"라고 말하는 데 그치지 않습니다. 정확히 그 짧은 벽을 가리키며 "이 특정 브릭을 수정하라"고 지시합니다.
  4. 루프(Loop): 그러면 제너레이터는 실수를 수정하고 다시 시도합니다. 이 순환은 최대 30번까지 반복됩니다. 만약 이밸류에이터가 (단순히 브릭의 문제가 아니라) 계획 자체가 잘못되었다는 것을 깨달으면, 작업을 플래너에게 돌려보내 스케치를 다시 그리게 합니다.

이 "계획-생성-평가(Plan-Generate-Evaluate)" 루프가 바로 비법입니다. 논문은 AI가 자신의 작업을 반복적으로 확인하고 특정 오류를 수정하도록 강제함으로써, "주차 구역은 2.4미터 너비여야 한다"와 같은 모호한 규칙을 수천 개의 3D 모델을 즉각적으로 검사할 수 있는 완벽하고 작동하는 컴퓨터 프로그램으로 바꿀 수 있음을 보여줍니다.

발견한 점: 구조의 힘

연구진은 이 시스템을 열 가지 실제 건축 규칙과 3D 모델이 포함된 새로운 데이터셋을 사용하여 테스트했습니다. 그들은 ARCHER 크루를 단일한 혼란스러운 로봇부터 서로 다투는 로봇 팀에 이르기까지 여섯 가지 다른 AI 활용 방식과 비교했습니다.

주요 결과는 다음과 같습니다:

  • 구조가 원시 지능보다 우세하다: 가장 놀라운 발견은 잘 조직된 "약한" AI 모델들의 팀이 혼자 일하는 단일 "초지식" AI 모델보다 더 나은 성능을 보였다는 것입니다. AI가 단 한 번의 추측에 의존했을 때(블라인드 방식)는 평균적으로 약 **47%**의 정답률을 보였습니다. 그러나 ARCHER 루프를 사용했을 때 정확도는 평균 **85%**로 급증했습니다. 이는 기본 방식보다 82% 향상된 수치입니다.
  • "오케스트레이터(Orchestrator)"가 중요하다: 팀은 크루를 운영하는 두 가지 방식을 테스트했습니다. 한 방식은 AI가 누구와 대화할지 결정하게 하는 방식(혼란스러운 회의와 같음)이었고, 다른 방식은 고정되고 변하지 않는 일정을 사용하는 방식(군사 훈련과 같음)이었습니다. 그들은 고정된 일정(ARCHER)이 훨씬 더 신뢰할 수 있다는 것을 발견했습니다. 이는 일부 모델에서 혼란스러운 버전보다 정확도를 최대 24.5 퍼센트 포인트 높였습니다.
  • 저렴한 것이 항상 저렴한 것은 아니다: 팀은 값비싼 최상위 "프런티어(frontier)" 모델부터 개인 컴퓨터에서 실행할 수 있는 저렴한 자체 호스팅 모델에 이르기까지 네 가지 다른 AI 모델을 테스트했습니다.
    • 비싼 모델들은 훌륭했지만, 논문은 ARCHER 시스템을 실행하는 저렴한 자체 호스팅 모델이 비싼 모델 정확도의 **97.8%**에 도달할 수 있다는 것을 발견했습니다.
    • 더욱 놀랍게도, 이 저렴한 설정은 비용이 4분의 1밖에 들지 않았습니다.
    • 이는 조직들이 훌륭한 결과를 얻기 위해 반드시 가장 비싼 AI에 거액을 들일 필요는 없으며, 단지 저렴한 AI를 안내할 올바른 시스템(ARCHER)이 필요하다는 것을 시사합니다.

이것이 왜 중요한가

이 논문은 건축 컴플라이언스 체크(compliance checking)가 너무 오랫동안 "수동" 시대에 머물러 있었다고 주장합니다. 기존 도구들은 종 often 비싸고 독점적인 소프트웨어에 묶여 있어 아무도 내부를 보거나 수정할 수 없습니다. 규칙이 모호하면 소프트웨어는 그냥 실패하며, 사용자는 인간을 불러야 합니다.

ARCHER는 새로운 방향을 제시합니다: 투명하고, 적응 가능하며, 확장 가능한 방식입니다. 시스템이 일반적인 프로그래밍 언어인 표준 파이썬(Python) 코드를 작성하기 때문에, 인간은 AI가 건물의 안전 여부를 어떻게 결정했는지 확인하기 위해 그 코드를 실제로 읽을 수 있습니다. 만약 AI가 무언가를 잘못했다면, 인간은 코드를 보고 논리를 파악하여 수정할 수 있습니다.

저자들은 이것이 모든 문제를 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 언급합니다. 어떤 건축 규칙은 (예를 들어, 기묘한 모양의 계단이 인간의 직관이 필요한 방식으로 "안전한지" 판단하는 것과 같이) 컴퓨터가 완벽하게 측정하기에는 너무 복잡할 수 있습니다. 그런 경우를 위해 시스템은 인간이 확인할 수 있도록 플래그를 지정(MANUAL_CHECK로 표시)하도록 설계되었습니다. 하지만 "문이 충분히 넓은가?" 또는 "주차 구역의 크기가 적절한가?"와 같은 수천 가지의 표준 규칙에 대해서는, ARCHER가 높은 정확도와 낮은 비용으로 무거운 작업을 자동화할 수 있음을 시사합니다.

요컨대, 이 논문은 AI에게 엄격한 직무 기술서와 전문가 팀, 그리고 숙제를 검사할 루프를 제공한다면, AI가 복잡하고 혼란스러운 건축 규칙을 명확하고 작동하는 코드로 바꿀 수 있음을 증명합니다. 이는 AI라는 "블랙박스"를 투명하고 감사 가능한 도구로 바꾸어, 언젠가 모두를 위해 더 안전하고, 빠르고, 저렴하게 건물을 지을 수 있게 만들 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →