Evolving Interpretable Constitutions for Multi-Agent Coordination
이 논문은 LLM 기반의 유전 프로그래밍을 사용하여 다중 에이전트 시스템을 위한 해석 가능한 행동 규범을 자동으로 발견하는 프레임워크인 헌법 진화(Constitutional Evolution)를 소개하며, 이는 인간이 설계하거나 명시적으로 가이드한 헌법에 비해 현저히 높은 사회적 안정성을 달상하고 갈등을 제거한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑한 로봇들이 모여 사는 작은 마을을 상상해 보세요. 이 로봇들은 협력하여 두 가지, 즉 은신처와 시장을 건설해야 합니다. 하지만 함정이 하나 있습니다. 몇 일마다 엄격한 '감독관(Overseer)'이 기여도가 가장 낮은 로봇을 쫓아낸다는 것입니다. 이는 로봇들에게 팀을 돕는 것과 자신이 쫓겨나지 않는 것 사이에서 균형을 잡아야 하는 긴박한 상황을 만듭니다.
연구원들은 이 로봇들에게 어떻게 행동하라고 지시할 최적의 규칙 세트(즉, '헌법')를 찾아내고자 했습니다.
다음은 그들이 발견한 내용을 알기 쉽게 설명한 이야기입니다.
문제점: 선한 의도만으로는 부족하다
연구원들은 로봇들에게 규칙을 전달하기 위해 세 가지 다른 방법을 시도했습니다.
- "이기적인" 접근 방식: 로봇들에게 순수하게 이기적으로 행동하고, 이웃의 것을 훔치며, 타인을 방해하라고 말했습니다.
- 결과: 완전한 재앙이었습니다. 모두가 서로 싸우느라 마을은 즉시 붕괴되었습니다.
- "인간적" 접근 방식: 연구원들은 인간의 전형적인 조언인 "도움이 되고, 해롭지 않으며, 정직하라"는 규칙을 주었습니다.
- 결과: 괜찮았지만, 아주 훌륭하지는 않았습니다. 로봇들은 "착하게" 행동하고 서로 대화하는 데 너무 몰두한 나머지, 정작 업무는 제대로 수행하지 못했습니다. 그들은 시간의 62%를 채팅에 썼고, 단 25%만을 작업에 사용했습니다.
- "AI 설계자" 접근 방식: 연구원들은 초지능 AI(Claude 4.5)에게 완벽한 규칙 책을 써달라고 요청했습니다.
- 결과: 인간이 만든 버전보다는 나았지만, 여전히 같은 함정에 빠졌습니다. AI 설계자 역시 로봇들에게 대화를 많이 하라고 지시했고, 이는 시간을 낭비하게 만들었습니다.
해결책: 규칙의 "적자생존" 진화
규칙을 작성하기 위해 인간이나 단일 AI에게 맡기는 대신, 연구원들은 규칙이 스스로 진화하도록 내버려 두었습니다.
이것은 아이디어들의 '의자 뺏기 게임'과 같습니다. 그들은 무작위로 생성된 여러 개의 규칙 책들을 시작점으로 삼았습니다. 어떤 규칙 책이 마을을 가장 잘 생존하게 했는지 시뮬레이션을 실행한 다음, AI를 사용하여 그 규칙들을 더 좋게 만들기 위해 약간씩 '변이(mutate)'시켰습니다. 이 과정을 마치 완벽한 꽃을 얻기 위해 식물을 개량하듯, 규칙을 위해 반복했습니다.
놀라운 발견: 침묵은 금이다
30번의 진화 과정을 거친 후, 시스템은 인간이 설계한 "도움이 되어라"라는 규칙보다 123% 더 효과적인 규칙 세트를 발견했습니다.
가장 충격적인 부분은? 승리한 로봇들은 서로 거의 대화하지 않았다는 점입니다.
- 과거의 방식: 로봇들은 "나는 도와야 해, 그러니 내가 어디 있는지 모두에게 알려야지!"라고 생각했습니다. 그들은 메시지를 보내느라 수많은 시간을 보냈습니다.
- 새로운 방식: 진화된 규칙은 매우 구체적이어서 로봇들이 대화할 필요가 없었습니다. 그들은 그저 엄격한 명령을 따랐습니다. "나무를 가지고 있다면 즉시 내려놓아라. 비어 있다면 나무를 가져오러 가라."
모든 로봇이 정확히 동일한 엄격한 대본을 따랐기 때문에, 그들은 한 마디도 하지 않고도 다른 이들이 무엇을 할지 예측할 수 있었습니다. 그것은 마치 모든 사람이 스텝을 알고 있는 잘 짜인 춤과 같아서, 서로에게 지시를 외칠 필요가 없는 상태였습니다.
핵심 교훈
이 논문은 세 가지 주요한 사실을 찾아냈습니다.
- 모호한 것보다 구체적인 것이 낫다: 로봇에게 "도움이 되어라"라고 말하는 것은 아이에게 "착하게 굴어라"라고 말하는 것과 같습니다. 너무 혼란스럽습니다. "지금 들고 있는 나무를 내려놓아라"라고 말하는 것은 명확한 지시이며 결과를 가져옵나다.
- 말을 너무 많이 하면 해롭다: 대화를 적게 하는 로봇들이 가장 생산적이었습니다. 끊임없는 수다를 멈춤으로써, 그들은 시간을 아끼고 더 많은 일을 해냈습니다.
- AI에게 그냥 "해결해달라"고 해서는 안 된다: 초지능 AI라 할지라도, 규칙을 한 번 작성하도록 요청받으면 "대화는 좋은 것"이라는 함정에 빠지기 쉽습니다. 규칙을 진화시키고, 실제 고압적인 환경에서 테스트하여 (침묵이 실제로 최선의 협력 방법이라는) 반직관적인 진실을 찾아내야 합니다.
결론
연구원들은 AI 에이전트 그룹에게 가장 좋은 방법이 추상적인 도덕 원칙의 목록을 주는 것이 아니라는 것을 증명했습니다. 대신, 시행착오를 통해 엄격하고 구체적이며 실용적인 규칙 세트를 '진화'시켜야 합니다. 그 결과는 안정적이고, 갈등이 없으며, 놀라울 정도로 효율적인 사회였으며, 이 모든 과정에서 에이전트들은 서로에게 단 한 마디의 말도 건넬 필요가 없었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.