← 최신 논문
🧬 biology

Decoding fairness: a reinforcement learning perspective

원저자: Guozhong Zheng, Jiqiang Zhang, Xin Ou, Shengfeng Deng, Li Chen

게시일 2026-02-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Guozhong Zheng, Jiqiang Zhang, Xin Ou, Shengfeng Deng, Li Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

거대한 질문: 우리는 왜 공정할까?

당신과 친구가 피자를 나누어 먹는다고 상상해 보세요. 전통적인 "경제학" 관점에서 보면, 당신과 친구는 오직 더 큰 조각을 얻는 것에만 관심이 있는 로봇과 같습니다. 제안자(proposer)인 당신은 친구에게 아주 작은 부스러기 하나만을 제안할 것이고, 응답자(responder)인 친구는 "아무것도 없는 것보다는 낫다"며 그 부스러기를 먹을 것입니다.

하지만 현실에서는 그런 일이 일어나지 않습니다. 만약 당신이 아주 작은 부스러기 하나를 제안한다면, 친구는 화가 나서 피자 전체를 던져버릴 것입니다. 결국 두 사람 모두 굶게 됩니다. 그럼에도 불구하고 실제 실험에서 사람들은 보통 공정한 배분(예: 50 대 50)을 제안하며, 낮은 제안은 거절당합니다.

미스터리: 인간은 왜 이렇게 행동할까요? 우리가 착하게 살도록 교육받았기 때문일까요(외부적 요인)? 아니면 우리 뇌 속에 자연스럽게 공정함을 향하도록 밀어붙이는 무언가가 있는 걸까요?

새로운 접근법: "비디오 게임" 같은 뇌

기존의 연구들은 사람들이 이웃을 어떻게 모방하는지(예: 똑똑한 반 친구를 따라 하는 학생)에 주목했습니다. 이 논문은 다른 접근 방식을 취합니다. 이 논문은 인간을 시간에 따라 총점을 극대화하려는 비디오 게임 속 플레이어처럼 다룹니다.

연구진은 **Q-러닝(Q-learning)**이라는 컴퓨터 기법을 사용했습니다. 이것을 모든 가능한 상황에 대해 "점수판(Q-table)"을 기록하는 뇌라고 생각하면 됩니다.

  • 제안자의 점수판: "내가 공정한 조각을 제안한다면, 장기적으로 나는 얼마나 얻게 될까?"
  • 응답자의 점수판: "내가 작은 조각을 수락한다면, 장기적으로 나는 얼마나 얻게 될까?"

플레이어들은 단순히 '지금 당장' 받는 피자 조각만을 보는 것이 아닙니다. 그들은 자신들의 과거와 미래를 봅니다.

공정함을 만드는 두 가지 핵심 요소

연구 결과, 플레이어들에게 두 가지 특정 특성이 있을 때만 공정함이 나타난다는 것을 발견했습니다.

  1. 과거를 기억함 (낮은 "망각률"): 그들은 매 게임마다 점수판을 깨끗이 지우지 않습니다. 그들은 이전에 일어났던 일로부터 배웁니다.
  2. 장기적인 비전 (높은 "미래 가치"): 그들은 지금 당장 진행 중인 한 판의 게임이 아니라, 1,000번의 게임 동안 얻게 될 총점에 관심을 둡니다.

비유하자면:
당신이 오늘 동전 하나를 훔쳐서 내일의 게임을 망칠 수도 있고, 혹은 오늘 공정하게 나누어 공유함으로써 게임을 계속 이어갈 수도 있는 게임을 하고 있다고 상상해 보세요.

  • 만약 당신이 근시안적이라면(오늘만 중요하게 생각함) 또는 망각하기 쉽다면(훔치는 행위가 지난번 게임을 망쳤다는 사실을 기억하지 못함), 당신은 탐욕스러운 로봇처럼 행동할 것입니다. 당신은 아주 작은 부스러기를 제안할 것이고, 거래는 자주 실패하여 모두를 아무것도 얻지 못하게 만들 것입니다.
  • 만약 당신이 현명하다면(과거를 기억하고 미래를 생각함), 당신은 깨닫게 될 것입니다. "헤이, 내가 공정한 조각을 제안한다면 내 친구도 수락할 것이고, 그러면 우리는 계속 게임을 하며 영원히 동전을 벌 수 있어."

공정함이 나타나는 과정 (두 단계의 여정)

논문은 플레이어들이 이를 알아가는 과정을 두 단계로 설명합니다.

1단계: "시행착오"를 통한 정리
처음에는 모두가 추측하는 단계입니다. 어떤 이들은 너무 관대하게(너무 큰 조각을) 제안하고, 어떤 이들은 아주 작은 부스러기를 제안합니다.

  • "너무 관대한" 제안은 제안자가 너무 많은 것을 잃기 때문에 실패합니다.
  • "작은 부스러기" 제안은 응답자가 거절하기 때문에 실패합니다.
  • 결과: 시스템은 자연스럽게 나쁜 전략들을 걸러냅니다. 실제로 거래가 성사되는 전략들만이 살아남습니다.

2단계: "안정화"
이제 플레이어들은 두 가지 주요 전략 사이에서 갈등합니다.

  1. 공정한 전략: 50%를 제안하고, 50%를 수락함.
  2. 합리적(탐욕적) 전략: 최소한을 제안하고, 최소한을 수락함.

연구에 따르면, 플레이어들이 미래를 가치 있게 여길 때 그들은 거의 항상 공정한 전략으로 흐르게 됩니다. 왜일까요? "합리적 전략"은 위험하기 때문입니다. 만약 당신이 너무 탐욕스럽게 행동하면 상대방이 당신을 거절할 수 있고, 그러면 당신은 0을 얻게 됩니다. 공정한 전략은 "돈 버는 기계"를 원활하게 계속 돌아가게 만드는 가장 안전한 선택입니다.

공정함이 실패할 때는 언제인가?

논문은 플레이어들이 "지혜"를 잃었을 때 어떤 일이 벌어지는지도 테스트했습니다.

  • 망각하기 쉽다면: 그들은 실수로부터 배울 수 없습니다. 그들은 계속 탐욕스럽게 행동하려 하고, 계속 실패합니다.
  • 근시안적이라면: 그들은 즉각적인 조각에만 관심을 가집니다. 그들은 당장 무언가를 얻기 위해 아주 작은 부스러기도 수락하며, 이는 제안자가 훨씬 더 탐욕스럽게 행동하도록 부추깁니다.
  • 결과: 이런 경우, 시스템은 혼돈이나 순수한 이기주의로 무너집니다. 공정함은 사라집니다.

결론

이 논문은 우리가 사회, 종교, 혹은 법(외부적 요인)으로부터 공정함을 "배울" 필요가 없다고 주장합니다. 대신, 공정함은 똑똑하고 자기 이익을 챙기는 학습의 자연스러운 결과입니다.

만약 당신이 과거를 기억하고 미래를 생각하는 합리적인 존재라면, 장기적으로 승리하기 위해 공정하게 행동하는 것이 최선이라는 것을 자연스럽게 깨닫게 될 것입니다. 이것은 "착해지는 것"에 대한 문제가 아니라, "똑똑해지는 것"에 대한 문제입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →