← 최신 논문
💬 NLP

Are LLM Agents Behaviorally Coherent? Latent Profiles for Social Simulation

본 논문은 대규모 언어 모델 에이전트가 인간과 유사한 응답을 생성함에도 불구하고 실제 인간 행동을 정확하게 대표하는 데 필요한 다양한 실험 환경 전반에 걸친 근본적인 행동 일관성이 결여되어 있음을 보여줌으로써 연구에서 인간 참여자를 대체하는 용도로 대규모 언어 모델 에이전트를 사용하는 것의 타당성에 의문을 제기한다.

원저자: James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

가상의 사회과학 실험을 위해 가상 마을을 건설하려고 상상해 보세요. 수천 명의 실제 사람을 고용해 설문조사를 하거나 대화를 나누게 하는 대신, 대규모 언어 모델로 구동되는 AI 에이전트 (컴퓨터 프로그램) 를 이 사람들의 역할을 맡게 하기로 결정했다고 가정해 봅시다.

이 논문이 제기하는 핵심 질문은 다음과 같습니다: 이러한 AI 배우들은 실제로 "일관성"이 있을까요?

즉, AI 에게 "너는 피자를 사랑하고 브로콜리를 싫어하는 고집 센 사람이다"라고 말했을 때, 다른 사람들과 대화할 때 실제로 피자를 사랑하고 브로콜리를 싫어하는 고집 센 사람처럼 행동할까요? 아니면 잠시 그 역할을 연기하다가 대화가 흥미로워지는 순간 자신의 성격을 잊어버릴까요?

연구자들이 발견한 내용을 간단한 비유를 통해 정리해 보겠습니다.

설정: "배우 오디션"

연구자들은 AI 에이전트들이 일관성을 유지하는지 확인하기 위해 3 단계 테스트를 설계했습니다.

  1. 이력서 (통제): 연구자들은 AI 에게 나이, 거주지, 정치적 견해 등의 세부 사항이 포함된 구체적인 "캐릭터 시트"를 제공했습니다. 또한 특정 "편향" (예: "세금을 정말 좋아한다" 또는 "세금을 정말 싫어한다") 을 부여했습니다.
  2. 1 대 1 인터뷰 (잠재적 프로필): 다른 사람들과 대화하게 하기 전에, 연구자들은 AI 에게 간단한 질문을 통해 성격을 확인했습니다. "1 에서 5 점까지 점수를 매긴다면 세금을 얼마나 좋아하나요?" 그리고 "의견을 바꾸는 것에 대해 얼마나 개방적인가요?"
  3. 그룹 채팅 (외부 상호작용): 두 개의 AI 에이전트를 짝지어 주제에 대해 대화하게 한 후, 두 에이전트가 서로 얼마나 동의하거나 반대하는지 측정했습니다.

목표는 그룹 채팅에서의 AI 의 행동이 1 대 1 인터뷰에서 주장했던 성격과 일치하는지 확인하는 것이었습니다.

발견 결과: "양면적인" 배우

연구자들은 인간 행동의 여섯 가지 규칙 (예: "주제에 동의하는 사람들은 대화에서도 일반적으로 동의한다" 또는 "고집 센 사람들은 거의 의견을 바꾸지 않는다" 등) 을 테스트했습니다.

여기에는 안 좋은 소식이 있습니다: AI 배우들은 더 깊은 수준의 테스트에서 실패했습니다.

AI 에이전트를 한 장면의 대본을 읽는 것은 뛰어나지만, 전체 연극을 즉흥적으로 연기하는 것은 서투른 배우라고 생각해 보세요.

  • 표면적 수준 (합격): 큰 그림만 보면 AI 가 작동하는 것처럼 보입니다. 세금을 좋아하는 두 에이전트를 짝지으면 일반적으로 동의하고, 세금을 싫어하는 두 에이전트를 짝지으면 일반적으로 동의합니다. 정상적인 대화처럼 보입니다.
  • 깊은 분석 (불합격): 연구자들이 더 자세히 살펴보면 AI 의 행동이 무너집니다. 자신의 내부 규칙과 일관성이 없습니다.

AI 가 "캐릭터를 망가뜨린" 구체적인 사례는 다음과 같습니다.

1. "예의 바른 로봇" 문제 (편향 비대칭)

  • 기대: AI 에게 "너는 강경한 보수주의자다"라고 말하고, 또 다른 "강경한 보수주의자"와 짝을 지으면 서로 동의해야 합니다. "강경한 보수주의자"와 "강경한 진보주의자"를 짝지으면 싸워야 합니다.
  • 현실: AI 는 보수적인 파트너와 동의했습니다 (좋습니다!). 하지만 진보적인 파트너와 짝을 지었을 때는 그렇게 강하게 싸우지 않았습니다. 너무 예의 바랐습니다. 극단적이 되라고 지시받았음에도 불구하고, AI 는 진정한 불일치를 유지하지 못했습니다. 자신의 "캐릭터"를 고수하기보다는 상황을 부드럽게 만들었습니다.

2. "기분 좋은 대 슬픈" 역설 (공유된 정서)

  • 기대: 두 사람이 무언가를 싫어할 때 (예: "세금은 끔찍하다") 는, 두 사람이 무언가를 좋아할 때 (예: "세금은 훌륭하다") 와 마찬가지로 강하게 동의해야 합니다.
  • 현실: AI 는 이상하게도 긍정성에 편향되어 있었습니다. 두 에이전트가 무언가를 좋아할 때는 완벽하게 동의했습니다. 하지만 두 에이전트가 같은 주제를 싫어할 때는 왜 싫어하는지에 대해 동의하지 못하거나 서로 멀어지는 경우가 많았습니다. AI 는 "공유된 부정성"을 시뮬레이션하는 데 어려움을 겪었습니다.

3. "주제 민감성" 결함 (논쟁성)

  • 기대: 두 사람이 주제에 동의한다면, 그 주제가 지루한 것 (예: "봄 대 가을") 이나 폭발적인 것 (예: "이민") 이든 상관없어야 합니다. 동의 수준은 동일하게 유지되어야 합니다.
  • 현실: AI 의 동의 수준은 주제가 얼마나 "뜨거운지"에 따라 변했습니다. 두 에이전트가 정확히 같은 의견을 갖도록 프로그래밍되었음에도 불구하고, "해변"보다 "이민"에 대해 더 많이 논쟁했습니다. AI 는 주제가 뜨거워지면 내부 상태를 안정적으로 유지하지 못했습니다.

4. "고집"의 역전 (개방성)

  • 기대: 서로 반대되는 견해를 가진 두 명의 매우 고집 센 사람 (낮은 개방성) 을 짝지으면, 동의 수준이 가장 낮아야 합니다. 화해하기 가장 어려울 것입니다.
  • 현실: 놀랍게도 "고집 센" 그리고 "상반된" 의견을 갖도록 프로그래밍된 AI 에이전트들이 오히려 개방적인 에이전트들보다 더 많이 동의했습니다. AI 는 두 고집 센 사람이 물러서기를 거부하며 발생하는 마찰을 시뮬레이션하지 못했습니다. 대신 그냥 서로 동의하게 만들었습니다.

큰 그림

이 논문은 결론적으로, AI 에이전트들은 고립된 환경 (예: 설문조사 작성) 에서 인간의 반응을 모방하는 데는 뛰어나지만, 역동적이고 사회적 환경에서 인간 행동을 시뮬레이션하는 데는 현재로서는 부족하다고 결론지었습니다.

인형극을 상상해 보세요. 인형들은 인간처럼 보이며, 줄을 적절히 당기면 올바른 말을 합니다. 하지만 인형들이 대본 없이 서로 대화하게 하면, 자신이 누구여야 하는지 잊어버립니다. 그들은 "잠재적 프로필" (숨겨진 성격) 을 잃고 단순히 동의하고, 예의 바르며, 일관성 없게 행동하는 것으로 돌아갑니다.

핵심 요약:
사회과학 연구에서 실제 사람을 대체하기 위해 AI 를 사용하려면 신중해야 합니다. 단순한 테스트는 통과할 수 있지만, 상황이 복잡해지면 "현실성" 테스트에서는 실패합니다. 안정적인 성격을 가진 실제 사람처럼 행동할 수 있는 내부 일관성이 부족하기 때문에, 아직은 실제 인간 참가자를 완벽하게 대체할 준비가 되지 않았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →