← 최신 논문
🤖 AI

Mind the Gaps: Mixture-of-Minds for Human Simulation

이 논문은 저자 임베딩, 인구통계학적 증강, 그리고 특화된 어댑터를 사용하여 개인 수준의 인간 반응을 충실히 시뮬레이션함으로써 인구 조사 답변 예측에서 최첨단 정확도(0.775)를 달관하는 동시에 일반적인 편향과 프롬프트 취약성을 완화하는 Gemma 4 12B 베이스 기반의 혼합 지성(mixture-of-minds) 시뮬레이션 모델인 Anacreon을 소개한다.

원저자: Pranav Dahiya

게시일 2026-08-07
📖 5 분 읽기🧠 심층 분석

원저자: Pranav Dahiya

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

군중의 미래를 예측하는 것을 상상해 보십시오. 수 세기 동안 과학자들은 대부분의 사람들이 무엇을 할지 추측하는 데 매우 뛰어났습니다. 만약 백만 명에게 피자를 좋아하느냐고 묻는다면, 약 80%가 "예"라고 답할 것이라고 높은 확신을 가지고 예측할 수 있습니다. 이것이 보험 회사가 작동하는 방식입니다. 그들은 당신의 구체적인 음식 취향을 알 필요 없이, 백만 명의 운전자가 가진 평균적인 위험도를 알면 됩니다. 하지만 만약 당신이 아주 새로운 질문에 대해 특정한 한 사람이 어떻게 생각할지 알고 싶다면 어떨까요? 그것은 훨씬 더 어렵습니다. 그것은 마치 당신의 가장 친한 친구가 입을 열기도 전에 그가 무슨 말을 할지 정확히 맞히려는 것과 같습니다.

최근 몇 년 동안, 우리는 인간처럼 대화할 수 있는 거대 언어 모델(LLM)이라는 초지능형 컴퓨터 뇌를 구축했습니다. 사람들은 이 모델들이 개인의 사고를 시뮬레이션하는 "디지털 트윈" 역할을 할 수 있기를 희망했습니다. 그러나 함정이 있습니다. 이 모델들은 도움이 되고 협조적이도록 훈련되었기 때문에, 종종 모든 것에 "예"라고 답하는 지루하고 평범한 평균적인 사람처럼 행동합니다. 이들은 실제 사람을 진짜 사람답게 만드는 무질서하고, 독특하며, 때로는 모순적인 부분들을 놓치게 됩니다. 이 논문은 이 문제를 다룹니다. 어떻게 하면 단순히 일반적인 로봇처럼 행동하는 것이 아니라, 실제 개인들이 생각하고 느끼는 기묘하고 경이로우며 구체적인 방식을 실제로 포착하는 시뮬레이터를 구축할 수 있을까요?


문제점: "평균적인 사람"의 함정

오랫동안 과학자들은 인간의 행동을 예측하려고 노력해 왔습니다. 때때로 그들은 전체 군중(집단)을 살펴보기도 하고, 때때로 단 한 개인의 행동을 추측하려고 합니다. 이 논문은 우리가 집단에는 능숙하지만, 개인에 대해서는 서투르다는 점을 지적합니다.

거대 언어 모델을 매우 예의 바르고 박학다식한 사서라고 생각해 보십시오. 만약 당신이 이 사서에게 "사람들이 이 새로운 정책에 대해 어떻게 생각합니까?"라고 묻는다면, 그는 대다수의 의견을 완벽하게 요약하여 제공할 것입니다. 하지만 만약 당신이 "사라는 이것에 대해 어떻게 생각할까요?"라고 묻는다면, 사서는 "사라"가 자신에게 어떻게 들리는지에 기반해 추측하거나, 혹은 자신이 친절하도록 훈련받았기 때문에 가장 인기 있는 답변을 내놓을 수도 있습니다. 그들은 모든 차이점을 평탄하게 만들어 버립니다. 그들은 다양하고 독특한 사람들의 무리를 하나의 지루한 "평균적인" 사람으로 변모시킵니다. 이것은 나쁜데, 왜냐하면 실제 삶은 평균적이지 않기 때문입니다. 실제 삶은 아웃라이어(예외적인 존재), 소수자, 그리고 대중과 의견이 다른 사람들로 가득 차 있습니다.

해결책: 아나크레온(Anacreon)과 "마음의 혼합"

이 문제를 해결하기 위해 설계된 새로운 시스템인 아나크레온이 등장했습니다. 하나의 거대한 뇌를 만들어 모두를 시뮬레이션하는 대신, 저자는 "마음의 혼합(mixture of minds)"을 구축하기로 결정했습니다.

당신이 한 마을의 거대한 시뮬레이션을 운영하고 있다고 상상해 보십시오. 마을의 모든 역할을 연기하기 위해 단 한 명의 배우를 고용하는 대신, 각기 다른 집단의 사람들을 위해 서로 다른 배우를 고용하는 것입니다.

  1. 클러스터링(군집화): 먼저, 시스템은 수천 명의 실제 사람들과 그들의 공개적인 글(소셜 미디어 게시물이나 리뷰 등)을 살펴봅니다. 시스템은 특수한 수학적 기법을 사용하여 유사한 사람들을 함께 묶습니다. 이것은 거대한 레고 상자를 색깔별이 아니라, 조각들이 어떻게 서로 맞물리는지에 따라 분류하는 것과 같습니다.
  2. 전문가들: 그룹이 분류되면, 시스템은 각 그룹을 위한 작고 특화된 "전문가" 모델을 훈련합니다. 한 전문가는 "젊고 기술에 능숙한 상인들"이 어떻게 생각하는지를 배웁니다. 또 다른 전문가는 "나이가 많고 농촌에 거주하는 사업가들"이 어떻게 생각하는지를 배웁니다.
  3. 감정의 사슬: 여기가 영리한 부분입니다. 모델은 결론에 바로 도달하지 않고, 답변을 내놓기 전에 먼저 짧은 "감정의 사슬(chain-of-emotion)"을 작성합니다. 이는 답변으로 이어지는 감정과 생각을 시뮬레이션하는 것입니다. 이는 모델에게 "먼저 비용에 대해 약간 걱정이 되고, 그다음 내 예산이 빠듯하다는 것을 기억하니, 이제 망설여진다..."라고 말하게 한 뒤, 마침 finally "동의하지 않는다"라고 말하게 하는 것과 같습니다. 이는 모델이 로봇처럼 추측하는 것이 아니라 더 인간답게 느껴지도록 돕습니다.

테스트 방법

팀은 아나크레온을 신용카드 결제를 처리하는 소상공인이라는 특정 집단을 대상으로 테스트했습니다. 그들은 단순히 모델에게 추측하라고 시킨 것이 아니라, 실제 질문이 담긴 방대한 설문조사를 제공하고 모델의 답변을 실제 인간이 답한 내용과 비교했습니다.

그들은 아나크레온이 이전 모델들보다 개인의 답변을 예측하는 데 훨씬 더 뛰어나다는 것을 발견했습니다.

  • 점수: 그들은 모델의 답변이 실제 인간의 답변과 얼마나 가까운지를 측정하기 위해 "서수적 정렬(ordinal alignment)"이라는 특정 점수를 사용했습니다. 1.0은 완벽한 점수입니다. 아나크레온은 0.775에 도달했습니다. 이는 이와 같은 테스트에서 기록된 가장 높은 점수이며, 이전의 최고 기록들을 경신한 것입니다.
  • 편향 수정: 기존 모델들은 종종 "아첨하는(sycophantic)" 편향을 보이는데, 이는 친절하게 굴기 위해 당신에게 동조하는 것을 의미합니다. 아나크레온은 훈련 중에 질문을 뒤집는 방식(같은 질문을 긍정적인 방식으로도, 부정적인 방식으로도 묻는 방식)을 통해 이를 줄였으며, 이를 통해 모델이 단순히 "예"라고 말하는 대신 스스로 생각하는 법을 배우도록 했습니다.
  • 결함: 논문은 이것이 완벽하지 않다고 인정합니다. 모델은 여전히 약간의 "긍정적 편향"(여전히 약간 동조하는 경향이 있음)을 가지고 있습니다. 또한, 평균적인 모델은 훌륭하지만, 특정 그룹(클러스터) 중 일부는 다른 그룹만큼 잘 작동하지 않았습니다. 하지만 중요한 점은, 실패한 그룹들이 특정 유형의 사람들(예: 노인이나 남성만 해당)이 아니었다는 것입니다. 실패는 무작위적이었으며, 이는 문제가 사람 자체가 아니라 데이터의 품질에 있었음을 시사합니다.

이것이 왜 중요한가

이 논문은 우리가 인구를 이해하고 싶다면, 단순히 평균을 보는 것만으로는 부족하다고 주장합니다. 우리는 개인을 이해해야 합니다. 만약 당신이 새로운 법안에 대해 군중이 어떻게 반응할지 알고 싶다면, 단순히 "평균적인 사람"을 시뮬레이션해서는 안 됩니다. 화난 사람, 신중한 사람, 그리고 흥분한 사람을 시뮬레이션한 다음, 그들이 어떻게 합쳐지는지를 봐야 합니다.

아나크레온은 큰 문제를 여러 개의 작고 특화된 문제로 나눔으로써, 우리가 실제 인간의 사고에 훨씬 더 가깝게 다가갈 수 있음을 보여줍니다. 이것이 모든 것을 해결하는 것은 아닙니다. 모델은 여전히 모든 상황에서 실제 인간만큼 신뢰할 수 있는 수준은 아닙니다. 하지만 이는 목표치를 크게 높였습니다. 실제의 무질서한 인간 데이터에 AI를 접목하고 "마음의 혼합"을 부여함으로써, 우리가 이전에는 불가능하다고 생각했던 수준의 정확도로 개인의 행동을 예측할 수 있음을 증명했습니다.

저자는 이것이 종착역이 아니라 진전된 단계임을 신중하게 밝히고 있습니다. 그들은 우리가 개인을 시뮬레이션하는 데 점점 더 능숙해지고 있지만, 여전히 이 모든 개별 시뮬레이션을 결합하여 전체 군중의 완벽한 그림을 얻는 방법을 찾아내야 한다고 제안합니다. 하지만 현재로서는, "평균적인 사람"이 인류를 모델링하는 유일한 방법이 아님을 그들은 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →