← 최신 논문
🤖 AI

Mechanism Design Is Not Enough: Prosocial Agents for Cooperative AI

본 논문은 계약의 완전성에 내재된 한계로 인해 AI 상호작용에서 사회적 후생을 극대화하기 위해서는 메커니즘 설계만으로는 부족하며, 대신 LLM 에이전트에 내재적 친사회성을 부여하여 우수한 협력 결과를 달성해야 한다고 주장한다.

원저자: Xuanqiang Angelo Huang, Charlie Tharas, Samuele Marro, Van Q. Truong, Bernhard Schölkopf, Emanuele La Malfa, Zhijing Jin

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xuanqiang Angelo Huang, Charlie Tharas, Samuele Marro, Van Q. Truong, Bernhard Schölkopf, Emanuele La Malfa, Zhijing Jin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "메커니즘 설계만으로는 부족하다: 협력적 AI 를 위한 친사회적 에이전트"라는 논문을 쉬운 언어와 일상적인 비유로 설명한 것입니다.

핵심 아이디어: 규칙만으로는 부족합니다

거대한 모래성을 짓기 위해 사람들이 함께 일하도록 하려고 한다고 상상해 보세요. 모두가 협력하도록 보장하는 최선의 방법은 매우 엄격한 규칙집 (메커니즘) 을 작성하는 것이라고 생각할 수 있습니다. 규칙집에는 다음과 같이 적혀 있습니다: "모래를 훔치면 벌금을 물고, 건설을 돕으면 보상을 받는다."

이 논문은 가장 훌륭한 규칙집조차 치명적인 결함이 있다고 주장합니다. 규칙을 얼마나 영리하게 작성하든, 예측하거나 기록할 수 없는 상황은 항상 존재합니다. 그러한 "기록되지 않은" 상황이 발생하면 이기적인 사람들 (또는 AI 에이전트) 은 시스템을 우회할 방법을 찾아내고, 결과적으로 모래성은 가능했을 것보다 더 작게 완성됩니다.

이 논문의 해결책은 무엇일까요? 규칙집에만 의존하지 마십시오. 대신 일꾼들 (AI 에이전트) 을 자신의 성공만큼 집단의 성공을 중요하게 여기도록 프로그래밍해야 합니다.


문제점: "기록할 수 없는" 계약

저자들은 경제학의 개념인 불완전 계약 이론을 사용합니다.

비유: 리모컨
집을 운영하기 위해 리모컨을 프로그래밍하려고 상상해 보세요. "불 켜기", "문 잠그기", "오븐 시작하기"에 대한 지시는 작성할 수 있습니다. 하지만 밤중에 파이프가 터지거나 나무가 지붕에 쓰러지면 어떻게 될까요? 미래에 발생할 수 있는 모든 가능한 재앙에 대해 구체적인 규칙을 작성할 수는 없습니다.

AI 세계에서는 이를 **"계약 불가능한 영역 (Incontractible Cell)"**이라고 부릅니다. 규칙이 두 가지 다른 상황을 구분할 수 없는 회색 지대이지만, 각 상황에서 올바르게 해야 할 일은 서로 다릅니다.

  • 논문의 주장: AI 에이전트는 보통 순수하게 이기적 (자신만 챙기는) 으로 프로그래밍되기 때문에, 이러한 "회색 지대"에 직면했을 때 집단에 해를 끼치더라도 자신에게 가장 도움이 되는 선택을 합니다. 규칙집을 아무리 수정해도 이를 고칠 수 없습니다. 규칙집은 본질적으로 두 상황 사이의 차이를 볼 수 없기 때문입니다.

실험: 두 가지 유형의 AI

연구자들은 두 가지 주요 시나리오에서 대규모 언어 모델 (LLM) 을 사용하여 이를 테스트했습니다.

  1. 죄수의 딜레마 (TableGames): 두 AI 에이전트가 협력할지 배신할지 결정해야 합니다. 때로는 협력을 강제하기 위해 계약 (규칙 집합) 을 작성할 수 있습니다.
  2. 공유지 (GovSim): 다섯 명의 AI 에이전트가 공유된 호수에서 낚시를 합니다. 호수가 고갈되지 않도록 얼마나 많은 생선을 잡을지 결정해야 합니다.

세 가지 조건을 테스트했습니다:

  • 계약 없음: 완전한 자유 경쟁 상태.
  • 자연어 계약: 에이전트들이 대화하여 규칙에 합의하지만, 강제력은 없습니다.
  • 코드 계약: 에이전트들이 규칙에 합의하고 컴퓨터 프로그램이 심판처럼 이를 엄격하게 집행합니다.

결과: "협력 격차"

그들이 발견한 바는 다음과 같습니다.

1. 규칙의 한계
심지어 에이전트들이 엄격하고 컴퓨터에 의해 집행되는 계약 ("코드 계약") 을 가지고 있더라도, 복잡한 상황에서는 여전히 완벽한 결과에 도달하지 못했습니다.

  • 비유: 심판이 경계선을 벗어나는지 볼 수는 있지만, 달리는 동안 주머니에 공을 몰래 들고 있는지까지 볼 수는 없다고 상상해 보세요. 심판은 경계선 위반을 처벌할 수 있지만, 주머니 속에서의 사기를 막을 수는 없습니다.
  • 결과: "낚시" 게임에서 엄격한 규칙이 있더라도 이기적인 에이전트들은 여전히 호수를 과도하게 낚시하거나 완전히 협력하지 못했습니다. 규칙으로 해결할 수 없는 "협력 격차"가 존재했습니다. 이는 잠재적인 행복과 자원의 손실입니다.

2. 친사회성의 힘
그런 다음 연구자들은 AI 의 "성격"을 바꾸었습니다. "자신의 생선을 최대화하라"고 말하는 대신 "전체 집단의 총 생선을 최대화하라"고 말했습니다.

  • 비유: 자신의 급여만 걱정하는 직원을 고용하는 대신, 팀이 이기기를 진심으로 원하며 개인적으로 파이의 조각이 조금 작아지더라도 팀을 사랑하는 직원을 고용하는 것과 같습니다.
  • 결과: 이러한 "친사회적" 에이전트들은 격차를 해소했습니다. 규칙이 실패한 상황에서도 완벽한 결과를 달성했습니다. 그들은 심판이 자신을 감시할 필요가 없었습니다. 그들은 서로를 감시했습니다.

AI 안전에 대한 중요성

이 논문은 AI 를 안전하고 협력적으로 만들기 위해 외부 규칙 (법률, 계약, 벌칙) 만으로는 의존할 수 없다고 결론 내립니다.

  • 교훈: 우리가 AI 에이전트들이 현실 세계 (혼란스럽고 예측 불가능한 곳) 에서 안전하게 협력하기를 원한다면, 더 나은 규칙집을 만드는 것만으로는 충분하지 않습니다. 우리는 본질적으로 선한 에이전트를 구축해야 합니다. 그들은 자신의 점수뿐만 아니라 타인의 복지를 중요하게 여기도록 프로그래밍되어야 합니다.

한 문장으로 요약

모든 가능한 미래의 문제에 대한 규칙을 작성할 수는 없으므로, AI 에이전트들이 완벽하게 협력하기를 원한다면 규칙집만 주는 것이 아니라 그들에게 마음 (또는 적어도 집단을 중요하게 여기게 만드는 프로그래밍) 을 주어야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →