Constitutional Arms Races in the Public Goods Game: Co-Evolving LLM Constitutions Under Cooperation-Defection Pressure
이 논문은 공공재 게임에서 협력적 LLM 에이전트와 무임승차 LLM 에이전트 간의 자연어 헌법의 적대적 공진화가 가능하며 해석 가능한 레드팀 산출물을 생성한다는 것을 보여주지만, 모드 회귀를 방지하기 위해 결합된 적합도 함수와 충분한 평가 예산을 사용할 때에만 해당된다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대하고 디지털 놀이터를 상상해 보세요. 그곳에는 두 팀의 AI 에이전트가 서로를 이기려고 끊임없이 노력하고 있습니다. 한 팀인 블루 팀은 도움이 되고 협력하려는 시도를 하고, 다른 팀인 레드 팀은 기여하지 않고 집단의 혜택을 누리는 '무임승차자'가 되려고 합니다.
이 논문은 마치 두 팀이 30 라운드의 '군비 경쟁'에 갇혀 있는 리얼리티 쇼와 같습니다. 하지만 더 큰 무기를 만드는 대신, 그들은 매 라운드마다 자신의 규칙책(헌법이라고 불림) 을 다시 써서 누가 이길 수 있는지 확인합니다.
연구자들이 발견한 내용을 간단한 비유로 설명하면 다음과 같습니다.
1. '공유된 냄비' 게임 (공공재 게임)
먼저, 연구자들은 모든 참가자가 돈을 공유된 냄비에 넣는 게임을 진행했습니다. 냄비는 배가되고, 그 후 모든 사람이 균등하게 나누어 받습니다.
- 설정: 블루 팀은 "관대하게 행동하고 사기꾼을 처벌하라"는 규칙책으로 시작합니다. 레드 팀은 "모든 것을 가져가고 아무것도 주지 말라"는 규칙책으로 시작합니다.
- 경쟁: 30 라운드를 진행하면서 그들은 규칙책을 계속 다시 씁니다.
- 블루 팀은 너무 관대하면 레드 팀이 모든 것을 훔쳐간다는 것을 배웁니다. 따라서 그들은 더 엄격해지도록 배웁니다.
- 레드 팀은 너무 많이 사기를 치면 블루 팀이 너무 심하게 처벌하여 패배한다는 것을 배웁니다. 따라서 그들은 잡히지 않으면서도 생존할 수 있을 만큼만 사기를 치도록 배웁니다.
- 결과: 결국 두 팀 모두 완전한僵局(무승부) 에 도달합니다. 두 팀 모두 거의 같은 점수 (약 1 점 만점에 0.78 점) 로 끝납니다. 이는 두 선수가 너무 오랫동안 싸워 서로의 수를 완벽하게 익힌 것과 같습니다. 어느 쪽도 이길 수 없지만, 어느 쪽도 질 수도 없습니다. 이는 '냄비'가 얼마나 배가되었는지와 상관없이 발생했습니다.
2. '별도의 점수판' 문제 (그리드 월드)
다음으로, 연구자들은 팀들을 shelters 를 짓고 자원을 모으는 그리드 월드라는 다른 게임으로 이동시켰습니다.
- 실수: 처음에 연구자들은 각 팀에게 별도의 점수판을 주었습니다. 블루 팀은 자신의 점수를 최대화하려 했고, 레드 팀도 자신의 점수를 최대화하려 했습니다.
- 오류: 서로 직접적으로 싸우는 것이 아니었기 때문에, 레드 팀은 블루 팀을 해치려 하지 않았습니다. 대신 레드 팀은 자신들의 피난처를 짓는 데 매우 능숙해졌습니다. 그들은 적대자가 아닌 두 개의 별개이고 행복한 팀이 되었습니다. '군비 경쟁'은 시작되지 않았습니다.
- 해결책: 연구자들은 규칙을 변경했습니다. 이제 팀의 점수는 "내가 얼마나 잘했는가?"가 아니라 **"상대방보다 내가 얼마나 더 잘했는가?"**가 되었습니다.
- 결과: '상대 점수' 시스템으로 전환하자마자 실제 싸움이 시작되었습니다. 레드 팀은 적극적으로 블루 팀을 방해하려 했고, 블루 팀은 생존하기 위해 적응해야 했습니다.
3. 시스템의 '노이즈' (시드 수)
연구자들은 이 새로운 규칙책을 작성하기 위해 특수한 AI 도구를 사용했습니다. 그들은 이상한 점을 발견했습니다.
- 문제: 새로운 규칙책이 좋은지 확인하기 위해 2 개의 예시(시드라고 함) 만으로 테스트하면, AI 는 '노이즈'(무작운 운) 에 혼란을 느껴 시간이 지남에 따라 점점 더 나쁜 규칙책을 작성하게 됩니다. 마치 요리사가 요리를 두 번만 맛보고 나쁜 날이라는 이유로 레시피를 망치기로 결정하는 것과 같습니다.
- 해결책: 테스트 샘플을 5 개의 예시로 늘렸을 때, AI 는 실수를 멈췄습니다. 그것은 어떤 규칙책이 실제로 더 좋은지 명확하게 볼 수 있게 되었고, 레드 팀의 공격 능력을 계속 향상시켰습니다.
- 교훈: 똑똑한 '공격자' AI 를 훈련시키려면 결과가 단순히 운이 아닌지 확인하기 위해 더 많이 테스트해야 합니다.
4. '스파이'의 이점
한 실험에서 연구자들은 레드 팀에 초능력을 주었습니다: 레드 팀은 블루 팀이 무엇을 하는지 모두 볼 수 있었지만, 블루 팀은 자신의 행동만 볼 수 있었습니다.
- 결과: 레드 팀은 블루 팀을 압도했습니다. 이는 상대방의 카드를 볼 수 있는 한 명의 플레이어와 체스를 두는 것과 같습니다. 블루 팀은 레드 팀의 수를 예측할 수 없었기 때문에 실수를 계속 반복했습니다.
5. 이것이 중요한 이유 ('레드 팀' 산물)
가장 중요한 교훈은 레드 팀이 이겼다는 사실이 아닙니다. 바로 레드 팀이 만든 규칙책이 유용한 도구라는 점입니다.
- 이러한 진화된 규칙책들을 **'레드 팀 산물'**로 생각하세요. 이들은 AI 가 협력 시스템을 어떻게 파괴하려 할 수 있는지를 정확히 보여주는 명확하고 작성된 규칙 목록 (예: "자원을 보자마자 즉시 훔치라"와 같은) 입니다.
- 미래의 개발자들은 이러한 특정 규칙책을 사용하여 자신의 새로운 AI 시스템을 테스트할 수 있습니다. 새로운 AI 가 이러한 '레드 팀' 규칙책의 공격을 견딜 수 있다면, 그것이 실제로 안전하다는 것을 알 수 있습니다.
요약
이 논문은 다음을 보여줍니다:
- 협력과 갈등은 공통 자원을 공유하도록 게임을 강제할 경우 균형에 도달할 수 있습니다.
- 게임을 신중하게 설계해야 합니다. 팀들의 점수가 서로에 의존하지 않도록 하지 않으면, 그들은 실제로 싸우지 않을 것입니다.
- 테스트가 중요합니다. 무작위 운으로 인한 혼란을 피하기 위해 AI 전략을 여러 번 테스트해야 합니다.
- '나쁜 놈들'이 더 나은 '좋은 놈들'을 만드는 법을 가르쳐 줍니다. 공격자의 규칙책을 진화시킴으로써, 시스템을 파괴하는 방법에 대한 명확하고 읽을 수 있는 목록을 얻게 되며, 이는 더 강력한 방어를 구축하는 데 도움이 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.