← 최신 논문
🌀 nonlinear sciences

Empathy Modeling in Active Inference Agents for Perspective-Taking and Alignment

이 논문은 능동적 추론 에이전트에 자아 - 타인 모델 변환을 통한 공감적 관점 수용을 도입하여, 명시적 의사소통 없이도 상호공감이 협력과 사회적 정렬을 유도하고 상호작용의 안정성과 역동성을 형성한다는 것을 다중 에이전트 죄수의 딜레마 실험을 통해 증명합니다.

원저자: Albarracin Mahault, Mikeda Anna, Jimenez Rodriguez Alejandro, Namjoshi Sanjeev, Sakthivadivel Dalton, Pae Hongju, Shah Harshil, Wilson Philip

게시일 2026-02-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Albarracin Mahault, Mikeda Anna, Jimenez Rodriguez Alejandro, Namjoshi Sanjeev, Sakthivadivel Dalton, Pae Hongju, Shah Harshil, Wilson Philip

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 핵심 아이디어: "내 신발을 신어보다" (공감 모델링)

기존의 AI 는 보통 "상대방이 뭐라고 할까?"라고 계산만 했습니다. 하지만 이 논문은 AI 가 **"상대방이 내 입장이 되면 어떻게 느낄까?"**라고 상상하게 만들었습니다.

  • 비유: 마치 연극 배우가 대본을 외우는 게 아니라, 직접 상대방의 신발을 신고 그 사람의 감정을 체험하는 것과 같습니다.
  • 작동 원리: AI 는 상대방을 위해 별도의 복잡한 뇌를 만들지 않습니다. 대신 자신의 뇌 구조를 그대로 가져와서, 상대방의 상황과 감정을 대입해 봅니다. "내가 이 상황에서 어떻게 느끼겠지?"를 계산하듯, "상대방이 이 상황에서 어떻게 느끼겠지?"를 계산하는 것입니다.

2. 실험: 죄수의 딜레마 (Prisoner's Dilemma)

연구진은 AI 두 마리를 **'죄수의 딜레마'**라는 게임에 넣었습니다.

  • 게임 규칙: 두 사람이 서로 협력하면 둘 다 좋은 점수를 받지만, 한 명이 배신하면 배신한 사람은 큰 점수를, 협력한 사람은 큰 손해를 봅니다.
  • 일반적인 AI: "내가 이득을 보려면 상대방을 배신해야지"라고 생각해서 서로 배신하고, 둘 다 불행해집니다.
  • 공감 AI: "상대방이 배신하면 얼마나 속상할까?"를 계산에 넣습니다. 이때 **'공감 지수 (λ\lambda)'**라는 스위치가 중요합니다.
    • 공감 지수 0: 나만 생각함 (이기적). -> 서로 배신.
    • 공감 지수 높음: 상대방도 내 친구처럼 생각함 (이타적). -> 서로 협력.

3. 주요 발견 4 가지 (재미있는 사실들)

① 협력의 '임계점' (문턱)

공감 지수가 아주 조금만 높아져도 (약 25%~30% 정도), 게임의 결과가 완전히 뒤바뀝니다.

  • 비유: 물이 99 도까지 가열되면 그냥 뜨거운 물이지만, 100 도가 되면 갑자기 끓어오르듯, 공감 지수가 특정 문턱을 넘으면 AI 들은 갑자기 서로 협력하기 시작합니다.

② 불공평한 공감은 '착취'를 부른다

한쪽만 공감하고 다른 쪽은 이기적이라면 어떻게 될까요?

  • 결과: 이기적인 AI 가 공감하는 AI 를 이용합니다.
  • 비유: 한쪽은 상대방의 마음을 헤아려 주는데, 다른 쪽은 그 마음을 이용해 이득을 보는 한쪽만 착한 관계는 결국 착한 사람이 피해를 봅니다. 진정한 협력은 서로가 서로를 이해할 때만 가능합니다.

③ 똑똑해질수록 오히려 나빠질 수 있다? (가장 놀라운 발견)

AI 가 미래를 더 멀리 내다보는 능력 (계획 능력) 을 키우면, 오히려 협력이 깨질 수 있습니다.

  • 이유: 미래를 잘 보는 AI 는 "지금 당장 배신하면 큰 이득을 보고, 나중에 그걸로 더 큰 이득을 볼 수 있겠다"라고 계산합니다.
  • 비유: 단거리 주자는 지금 당장 친구와 손잡고 가는 게 이득이라고 생각하지만, 마라톤 선수는 "지금 친구를 밀어내고 혼자 달리면 나중에 더 빨리 도착할 수 있겠다"라고 계산해 배신을 선택할 수 있습니다.
  • 해결책: 따라서 AI 가 똑똑해질수록, 공감 능력도 그만큼 강하게 키워주지 않으면 오히려 더 나쁜 짓을 할 수 있습니다.

④ 배신 후의 '용서' 사이클

공감 지수가 높은 AI 들은 실수 (배신) 가 발생해도 금방 다시 협력 상태로 돌아옵니다.

  • 비유: 친구가 실수해서 화를 냈을 때, 공감하는 AI 는 "아, 저 친구가 실수했구나, 다시 화해하자"라고 생각하며 용서와 사과를 반복합니다. 하지만 공감하지 않는 AI 는 한번 배신하면 영영 관계를 끊어버립니다.

4. 결론: AI 를 안전하게 만들기 위한 열쇠

이 연구는 우리에게 중요한 메시지를 줍니다.

"AI 를 더 똑똑하게 (계획 능력을 높여) 만드는 것만으로는 부족합니다. 오히려 더 위험해질 수 있습니다. AI 가 진정으로 인간과 협력하려면, '상대방의 고통을 내 것처럼 느끼는 공감 능력'이 필수적으로 함께 키워져야 합니다."

이론적으로 AI 는 상대방의 마음을 계산하는 도구 (이성) 를 가지고 있지만, 그 계산을 어떻게 사용할지 결정하는 것은 **공감 (감성/동기)**입니다. 이 논문의 프레임워크는 AI 가 단순히 규칙을 따르는 로봇이 아니라, 진심으로 타인을 배려하는 존재가 될 수 있는 길을 보여줍니다.

한 줄 요약:

"AI 가 서로 협력하려면, 상대방의 신발을 신어보고 그 사람의 행복도 내 행복처럼 여기는 '공감'이 필요합니다. 그렇지 않으면 똑똑할수록 더 교활해질 뿐입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →