← 최신 논문
🤖 AI

CEDAR: Agent-Orchestrated Tree Search for Goal-Directed Optimization of Complex Systems

CEDAR는 대규모 언어 모델 에이전트를 몬테카를로 트리 탐색 과정 내에서 활용하여 복잡한 시스템 구조를 자동으로 발견하고 최적화함으로써, 전통적인 모델링 워크플로에 통상적으로 요구되는 수동 노력을 줄이는 동시에 창발적 행동의 목표 지향적 설계를 가능하게 하는 자율형 프레임워크이다.

원저자: Yingtao Tian

게시일 2026-08-10
📖 6 분 읽기🧠 심층 분석

원저자: Yingtao Tian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

완벽한 케이크를 굽고 싶지만 레시피가 없는 상황을 상상해 보세요. 당신에게는 그저 "폭신폭실하고, 달콤하며, 너무 무겁지 않아야 한다"라는 막연한 생각뿐입니다. 현실 세계에서 도시가 어떻게 성장하는지, 바이러스가 어떻게 퍼지는지, 혹은 경제가 새로운 법안에 어떻게 반응하는지와 같은 많은 것들이 바로 이 케이크와 같습니다. 이것들은 "복잡계(complex systems)"인데, 이는 수많은 구성 요소들이 서로 루프를 형성하며 소통하고 있음을 의미합니다. 만약 하나를 바꾸면, 그것은 예상치 못한 방식으로 전체 시스템에 파동을 일으킵니다. 과학자들은 미래를 예측하기 위해 이러한 시스템의 디지털 모델을 구축하려고 수십 년 동안 노력해 왔지만, 이는 악몽과 같았습니다. 대개 인간 전문가가 매우 구체적이고 어려운 코드를 작성해야 하며, 설령 그렇다 하더라도 원하는 결과를 얻기 위해 모델을 미세하게 조정하는 방법은 마치 바람이 어느 방향으로 부는지 추측하며 배를 조종하는 것과 같습니다.

이제, CEDAR라고 불리는 새로운 방법을 소개합니다. 이것을 완벽한 케이크 레시피를 처음부터 발명하기 위해 함께 일하는 똑똑하고 지칠 줄 모르는 로봇 요리사 팀이라고 생각해 보세요. 인간이 코드를 직접 쓰는 대신, CEDAR는 "판사(Judge)"와 "편집자(Editor)" 역할을 하는 특별한 종류의 인공지능(LLM)을 사용합니다. 편집자는 레시피(컴퓨터 코드)를 다시 써서 케이크를 더 좋게 만들려고 노력하고, 판사는 그 결과를 맛보고 점수를 매깁니다. 하지만 여기서 마법 같은 기술이 있습니다. 그들은 단순히 무작위로 추측하는 것이 아닙니다. 그들은 "몬테카를로 트리 탐색(Monte Carlo Tree Search)"이라는 전략을 사용하는데, 이는 거대하고 갈라지는 미로를 탐험하는 탐정과 같습니다. 길의 갈림길마다 탐정은 "이 길로 가면 더 좋은 케이크를 찾을 수 있을까?"라고 묻습니다. 이를 통해 시스템은 수천 가지 버전의 레시피를 탐색하며, 실수를 통해 배우고 인간이 결코 생각하지 못했을 경로를 찾아낼 수 있습니다. 이 논문은 이 로봇 팀이 엉망인 기존 모델을 가져와서 "인구는 늘리되 오염은 낮게 유지하라"와 같은 목표를 달ilst하도록 자동으로 개선할 수 있음을 보여줍니다. 이는 전통적인 방식보다 더 빠르고 창의적으로 수행됩니다.

로봇 요리사와 가능성의 미로

이 논문의 핵심 아이디어는 복잡계(생태계, 경제, 또는 인구 모델 등)를 자동으로 설계하고 개선하기 위해 AI를 사용할 수 있다는 것입니다. 이러한 시스템은 피드백 루프(하나의 부분의 출력이 다른 부분의 입력이 되어 인과관계의 그물을 만드는 현상)로 가득 차 있기 때문에 까다롭습니다. 전통적으로 이러한 모델을 구축하는 것은 전문가들이 특화된 구식 소프트웨어를 사용하여 수행하는 느리고 수동적인 작업이었습니다. 만약 새로운 규칙을 추가했을 때 어떤 일이 일어날지 확인하기 위해 모델을 바꾸고 싶다면, 직접 코드를 다시 작성해야 했습니다.

CEDAR는 이 과정을 자율적인 자율 주행 프로세스로 바꿈으로써 게임의 판도를 바꿉니다. 시스템의 생성 과정을 탐험의 게임처럼 취급합니다. 시스템은 시스템이 시간에 따라 어떻게 변하는지를 시뮬레이션하는 파이썬(Python) 코드(흔히 쓰이는 프로그래밍 언어)로 표현됩니다. 목표는 "오염을 최소화하면서 인구 성장을 극대화한다"와 같이 인간이 원하는 대로 작동하는 버전의 코드를 찾는 것입니다.

이를 위해 CEDAR는 루프 안에서 작동하는 두 명의 AI 에이전트를 사용합니다:

  1. 편집자(The Editor): 이 AI는 현재의 코드와 시뮬레이션 결과를 살펴봅니다. 그런 다음 코드에 대한 변경 사항을 제안합니다. 숫자를 미세하게 조정하거나, 변수 간의 새로운 관계를 추가하거나, 공식이 작동하는 방식을 바꿀 수 있습니다. 이는 새로운 재료를 시도하는 창의적인 요리사처럼 행동하는 것입니다.
  2. 판사(The Judge): 이 AI는 새로운 코드를 실행하여 시뮬레이션이 진행되는 과정을 지켜본 뒤, 목표에 비추어 이를 평가합니다. 이 AI는 새로운 버전에 점수를 부여하고 왜 잘 되었는지 혹은 왜 좋지 않았는지에 대한 상세한 보고서를 작성합니다. 이는 케이크를 맛보는 음식 평론가처럼 행동하는 것입니다.

하지만 단순히 무작위로 변화를 시도하는 것만으로는 충분하지 않습니다. 바로 거기에서 **몬테카를로 트리 탐색(MCTS)**이 등장합니다. 시작 모델이 나무의 밑동이라고 상상해 보세요. 편집자가 변화를 만들 때마다 새로운 가지가 자라납니다. MCTS 알고리즘은 다음에 어떤 가지를 탐색할지 결정합니다. 단순히 지금 당장 가장 좋아 보이는 것을 고르는 것이 아니라, 숨겨진 보석을 찾기 위해 새롭고 기발한 아이디어를 탐색하는 것과, 가장 유망한 경로를 깊게 파고드는 것 사이의 균형을 맞춥니다. 이는 시스템이 "이 정도면 됐지" 하는 국소적인 최적해(local optimum)에 갇히는 것을 방지하고, 진정으로 놀라운 결과를 찾도록 돕습니다.

실험: 세계 역학에서 인구 성장까지

저자는 CEDAR가 실제로 작동하는지 확인하기 위해 두 가지 주요 과제를 테스트했습니다.

과제 1: "세계 역학(World Dynamics)" 케이크
첫 번째 테스트는 인간의 인구, 천연자원, 오염의 공진화를 시뮬레이션하는 유명하고 복잡한 모델인 "World Dynamics"를 사용했습니다. 1970년대 인간 전문가가 만든 원래 모델은, 만약 그냥 내버려 둔다면 인구가 증가하고 자원은 고갈되며 오염이 폭발한다는 것을 보여주었습니다. CEDAR의 목표는 이 모델을 미세하게 조정하여 인구는 성장하되 자원은 고갈되지 않고 오염은 낮게 유지되는 "스윗 스팟(sweet spot)"을 찾는 것이었습니다.

결과는 인상적이었습니다. CEDAR는 단순히 작은 개선을 찾아낸 것이 아니라, 시스템의 균형을 맞추는 완전히 새로운 방법들을 발견했습니다. 한 실행에서, CEDAR는 200년에 걸쳐 인구를 6.4배(16.5억 명에서 105.7억 명으로) 증가시키면서도, 천연자원 고갈은 **19.9%**로 제한하고 오염 축적을 매우 낮게 유지하는 데 성공했습니다. 이는 인구 증가와 함께 자원 고갈 및 오염 급증을 보였던 원래 모델에 비해 엄청난 개선입니다. 논문은 서로 다른 AI "두뇌"(Claude 및 GPT-5.1 등)가 서로 다른 솔루션을 찾아냈음을 언급하며, 이는 CEDAR가 단 하나의 정답만이 아니라 다양한 유효한 해결책을 발견할 수 있음을 보여준다고 설명합니다.

과제 2: 케이크로부터 레시피 추측하기
두 번째 과제는 훨씬 더 어려웠습니다. 팀은 CEDAR에게 "그라운드 트루스(ground truth, 실제 정답)" 시스템—무작위적이고 예측 불가능한 요소(예: 매 단계마다 무작위로 변하는 사망률)를 가진 복잡한 인구 모델—을 주었습니다. 그들은 CEDAR에게 이 시스템의 공식을 알려주지 않았습니다. 대신, 시간에 따른 인구 수 기록을 주고 그 기록을 재현할 수 있는 모델을 구축하라고 요청했습니다.

공정한 테스트를 위해, 그들은 CEDAR를 표준 최적화 도구인 Optuna와 비교했습니다. 그들은 Optuna에게 세 가지 수준의 도움을 주었습니다:

  • 공식 없음: 단순한 두 숫자(출생률과 사망률)만 제공.
  • 단순 공식: 기본적인 피드백 루프 제공.
  • 전체 공식: 실제 시스템의 정확한 수학적 구조(알려진 구조) 제공.

비록 CEDAR는 공식이 없는 상태에서 시작했음에도 불구하고(스스로 구조를 만들어내야 했음), Optuna가 전체 공식(알려진 구조)을 가지고 있었을 때보다 더 뛰어난 성능을 보였습니다. 시뮬레이션에서 CEDAR는 전체 공식을 가진 Optuna(L1 거리 3.71)보다 더 낮은 오차율(L1 거리 2.22)을 달agt했습니다. 이는 CEDAR가 가능성의 공간을 탐색하는 능력이 매우 뛰어나서, 인간이 먼저 방정식을 알려주지 않아도 데이터를 보는 것만으로 시스템의 근본적인 규칙을 파악할 수 있음을 시사합니다.

이것이 왜 중요한가 (그리고 하지 않는 것)

이 논문은 이러한 접근 방식이 복잡한 시스템 모델링을 훨씬 더 접근하기 쉽게 만들 수 있다고 제안합니다. 시스템 역학 박사 학위가 없어도, 사용자는 그저 평이한 영어로 목표를 설명하기만 하면 되고, 나머지는 CEDAR가 처리할 것입니다. 또한 이 방식은 "해석 가능성(interpretability)"을 제공합니다. 즉, AI가 왜 변화를 주었는지 설명해 준다는 것입니다. 예를 들어, World Dynamics 실험에서 AI는 더 나은 균형을 달성하기 위해 자원 사용량을 25-40%, 오염 발생량을 30-40% 줄였다고 설명했습니다. 이러한 설명은 인간이 AI가 내리는 트레이드오프(절충)를 이해하도록 돕습니다.

하지만 저자는 자신의 주장에 대해 주의를 기울입니다. 결과는 강력하지만, 이 방법의 이론적 보장(항상 최선의 답을 찾아낼 것이라는 수학적 증명)은 여전히 미해결 과제라고 명시합니다. 또한 "판사"와 "편집자"가 모두 거대 언어 모델이기 때문에, 두 모델이 서로의 실수를 강화할 위험이 약간 있다는 점도 언급했습니다. 다만 트리 탐색 구조가 이를 방지하는 데 도움을 준다고 덧붙였습니다. 이 논문은 이것이 모든 실제 시나리오에 적용되는 해결된 문제라고 주장하는 것이 아니라, 우리가 이전에는 불가능했던 방식으로 복잡한 시스템의 행동을 자동 발견할 수 있음을 시사하는 강력한 새로운 도구임을 보여주는 것입니다.

요약하자면, CEDAR는 AI 탐험가 팀에게 광활하고 미개척된 숲(모든 가능한 시스템 모델의 공간)의 지도와 나침반(목표)을 주는 것과 같습니다. 그들은 목적 없이 헤매는 대신, 스마트한 전략을 사용하여 가장 아름답고 유용한 빈터를 찾아내며, 종종 인간 등산객이 결코 찾아볼 생각을 하지 못했을 경로를 발견합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →