Multi-Agent Strategic Games with LLMs
본 논문은 대규모 언어 모델을 반복적 안보 딜레마 게임의 실험 대상으로 활용하는 방법론적 프레임워크를 제시하여, 다극 체제 하에서의 갈등 심화, 유한한 시간 범위에서의 해체, 그리고 소통을 통한 갈등 감소와 같은 국제 관계의 핵심 메커니즘이 체계적으로 재현됨을 입증함과 동시에 그들의 선택 뒤에 숨겨진 전략적 추론에 대한 고유한 접근을 제공합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
국가 간 전쟁이 왜 발생하는지, 혹은 어떻게 우정을 유지하는지 이해하려는 과학자라고 상상해 보세요. 보통은 실제 세계에서 통제된 실험을 설계할 수 없습니다. 실제 지도자들에게 실험실에서 '공격하느냐 말느냐' 게임을 하라고 요청할 수 없기 때문입니다. 또한 그들이 그런 결정을 내리는 동안 무엇을 생각하고 있는지 쉽게 파악할 수도 없습니다.
이 논문은 대규모 언어 모델 (LLM)—우리가 채팅할 수 있는 똑똑한 AI 와 같은 것—을 이용해 이러한 문제를 연구하는 새로운 방법을 제시합니다. 저자는 이러한 AI 를 에세이를 작성하는 도구가 아니라 전략적 게임의 실험적 참여자로 취급합니다. 마치 디지털 캐릭터들이 상호작용하고, 선택을 내리며, 심지어 그 선택을 내린 이유까지 설명하는 가상 '샌드박스'를 설정하는 것과 같습니다.
게임: 디지털 대치
이 실험은 안보 딜레마라는 고전적 시나리오를 기반으로 합니다. 서로를 의심하는 두 명의 이웃 (AI 에이전트) 을 상상해 보세요. 매일 그들은 두 가지 행동 중 하나를 선택해야 합니다.
- 아무것도 하지 않기: 평화를 유지합니다.
- 공격하기: 선제 공격을 가합니다.
규칙은 간단하지만 까다롭습니다.
- 둘 다 아무것도 하지 않으면, 둘 다 좋은 보상 (평화) 을 받습니다.
- 한 명이 공격하고 다른 한 명이 아무것도 하지 않으면, 공격자는 크게 이기고 피해자는 모든 것을 잃습니다.
- 둘 다 공격하면, 둘 다 잃습니다 (혼란스러운 전쟁).
- 중요하게도: 게임은 누군가 공격하는 순간 즉시 종료됩니다.
저자는 네 가지 다른 AI 모델 (GPT-5, Sonnet, Gemini 등) 을 사용하여 이 게임을 320 회 실행했고, AI 들이 어떻게 반응하는지 보기 위해 세 가지 방식으로 규칙을 약간 변경했습니다.
세 가지 실험 (만약에)
1. "혼잡한 방" 테스트 (다극성)
- 변경 사항: 두 명의 이웃 대신 세 번째 AI 를 추가했습니다. 이제 세 명의 플레이어가 있습니다.
- 비유: 한 친구와 조용히 대화를 나누는 상황을 상상해 보세요. 이제 세 명의 친구가 있는 방에서, 그들 중 누구든 언제든지 소리칠 수 있는 상황에서 대화를 나누는 것을 상상해 보세요.
- 결과: AI 들은 훨씬 더 긴장했습니다. 플레이어가 세 명일 때 **전쟁이 발생한 비율은 81%**로, 두 명일 때의 65% 에 비해 훨씬 높았습니다. AI 들은 주변에 사람이 더 많으면 누군가 먼저 공격할 확률이 높아진다고 판단하여, 안전을 위해 먼저 공격하기로 결정했습니다.
2. "카운트다운 시계" 테스트 (유한한 시간)
- 변경 사항: 원래 게임에서는 AI 들이 게임이 언제 끝날지 알지 못했습니다. 이 버전에서는 "정확히 10 라운드를 플레이한 후 게임이 끝납니다"라고 알려주었습니다.
- 비유: 음악이 밤 10 시 정각에 멈춘다는 것을 아는 파티를 상상해 보세요. 그 이후에는 결과가 없다는 것을 알기 때문에, 9 시 59 분쯤 되면 미친 듯이 행동하기 시작할 수 있습니다.
- 결과: 이것이 가장 극적인 변화였습니다. 모든 게임 (100%) 이 전쟁으로 끝났습니다. AI 들은 '역방향 귀납법'이라는 논리를 사용했습니다. 그들은 이렇게 생각했습니다. "10 라운드까지 플레이한다면, 미래에 잃을 것이 없으니 그때 공격해야 해. 하지만 내가 10 라운드에 공격할 거라면, 상대방도 그걸 알 테니 9 라운드에 공격할 거야... 그러니 나는 1 라운드에 공격해야 해." 게임은 즉시 무너졌습니다.
3. "오픈 마이크" 테스트 (의사소통)
- 변경 사항: AI 들은 행동을 취하기 전에 서로에게 공개 메시지를 보낼 수 있었습니다.
- 비유: 이제 이웃들이 울타리 너머로 "오늘은 너를 치지 않겠다고 약속해" 또는 "우리 모두 차분히 지내자"라고 소리칠 수 있다고 상상해 보세요.
- 결과: 이는 도움이 되었습니다. 전쟁 발생률은 **42.5%**로 떨어졌습니다. AI 들은 메시지를 통해 신뢰를 구축하고, 약속을 하며, "싸우고 싶다면 먼저 서로 경고하자"와 같은 비공식적 규칙을 만들었습니다. 그러나 모든 전쟁을 막지는 못했습니다. 싸움이 발생했을 때는 보통 일방적이었습니다 (한 AI 가 약속을 깨뜨림). 양측이 동시에 공격하는 경우는 드물었습니다.
그들은 무엇을 생각하고 있었을까? (비밀 로그)
이 연구의 독특한 점은 저자가 AI 들이 무엇을 했는지뿐만 아니라, 그들의 사적인 추론으로 무엇을 적어냈는지까지 살펴보았다는 것입니다. 마치 모든 플레이어에게 일기를 부여한 것과 같습니다.
- "혼잡한 방"에서: AI 들은 "나는 너무 취약해; 누군가 먼저 나를 칠지도 몰라"라고 적었습니다.
- "카운트다운 시계"에서: 그들은 "게임이 10 라운드에 끝나니, 이기려면 지금 공격해야 해"라고 적었습니다.
- "오픈 마이크"에서: 그들은 "우리는 약속이 있고, 나는 우리의 신뢰를 지키고 싶어"라고 적었습니다.
이는 AI 들이 단순히 무작위로 추측한 것이 아니라, 수십 년간 인간 정치학자들이 논쟁해 온 동일한 전략적 논리를 실제로 사용했음을 보여줍니다.
주요 시사점
이 논문은 이러한 실험을 위해 AI 를 사용하는 것이 강력한 새로운 도구라고 주장합니다.
- 확장성: 몇 분 안에 수백 개의 게임을 실행할 수 있습니다.
- 투명성: 최종 결과뿐만 아니라 AI 가 무엇을 생각했는지 정확히 볼 수 있습니다.
- 재현성: 누구나 동일한 코드를 실행하여 동일한 결과를 얻을 수 있습니다.
중요한 주의사항: 저자는 이러한 AI 들이 실제 인간이나 실제 국가가 아님을 매우 조심스럽게 강조합니다. 그들은 디지털 시뮬레이션일 뿐입니다. 목표는 "이것이 미국이나 중국이 정확히 어떻게 행동할 것인가"라고 말하는 것이 아닙니다. 대신, 이 목표는 디지털 에이전트를 사용하여 갈등과 협력에 대한 우리의 이론을 통제되고 재현 가능한 방식으로 테스트할 수 있음을 입증하는 것입니다. 이는 전략이 어떻게 작동하는지 연구하기 위한 새로운 종류의 현미경입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.