← 최신 논문
💬 NLP

Eliciting Trustworthiness Priors of Large Language Models via Economic Games

이 논문은 반복적 인컨텍스트 학습(iterated in-context learning)과 신뢰 게임(Trust Game)을 사용하여 거대 언어 모델로부터 신뢰성 사전 확률(trustworthiness priors)을 이끌어내는 새로운 방법을 소개하며, GPT-4.1의 신뢰 행동이 인간의 패턴을 밀접하게 모방하고 따뜻함과 유능함이라는 고정관념에 의해 예측될 수 있음을 밝힌다.

원저자: Siyu Yan, Lusha Zhu, Jian-Qiao Zhu

게시일 2026-02-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siyu Yan, Lusha Zhu, Jian-Qiao Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: AI는 얼마나 "신뢰할 수 있는가"?

당신이 돈을 관리할 새로운 비서를 고용한다고 상상해 보세요. 당신은 그에게 10달러를 주며 이렇게 말합니다. "나는 이 돈을 3배로 불릴 거야, 그러니 이제 네 손에는 30달러가 있어. 그중 일부를 나에게 돌려줘."

  • 만약 그가 15달러를 돌려준다면: 그는 신뢰할 수 있는 사람입니다.
  • 만약 그가 0달러를 돌려준다면: 그는 신뢰할 수 없는 사람입니다.

이것이 바로 **신뢰 게임(Trust Game)**이라 불리는 유명한 게임의 기본 설정입니다. 보통 심리학자들은 인간이 어떻게 행동하는지 알아보기 위해 이 게임을 사용합니다. 하지만 이 논문은 새로운 질문을 던집니다. GPT-4나 Llama와 같은 거대 언语言 모델(LLM)은 이 게임에서 어떻게 행동할까요? 그들에게는 타인을 얼마나 신뢰하고, 받은 만큼 얼마나 돌려줄지에 대한 "기본 설정값"이 존재할까요?

문제점: AI에게 그냥 물어볼 수는 없다

당신은 "왜 AI에게 '너는 신뢰할 수 있니?'라고 물어보지 않지?"라고 생각할 수도 있습니다. 저자들은 그것이 나쁜 방법이라고 말합니다.

  • "예의 바른 로봇" 문제: 만약 당신이 AI에게 "내 돈을 훔칠 거니?"라고 묻는다면, AI는 거의 확실하게 "아니요, 저는 도움이 되는 조수입니다"라고 대답할 것입니다.
  • 현실: 인간과 마찬가지로, AI도 매우 설득력 있고 유창할 수 있지만, 실제 상황에서는 위험하거나 신뢰할 수 없는 선택을 할 수 있습니다. 우리는 그들이 무엇을 '말하는지'가 아니라, 실제로 무엇을 '하는지'를 볼 필요가 있습니다.

해결책: 신뢰의 "전화기 게임"

AI의 진정한 "신뢰 설정"을 찾아내기 위해, 연구진은 **반복적 인컨텍스트 학습(Iterated In-Context Learning)**이라는 개념에 기반한 영리한 방법을 고안했습니다.

이것은 마치 **전화기 게임(Telephone Game)**과 같습니다. 다만 속삭임을 전달하는 대신, 돈에 관한 이야기를 전달하는 것이죠.

  1. 설정: 연구진은 AI의 "세대(generations)" 체인을 만듭니다.
  2. 첫 단계: AI에게 사람들이 신뢰 게임을 하는 몇 가지 예시를 보여줍니다 (예: "A라는 사람이 5달러를 보냈고, B라는 사람이 2달러를 돌려주었다").
  3. AI의 차례: AI는 이 예시들을 보고 예측합니다: "만약 내가 B라면, 얼마를 돌려줄 것인가?" 예를 들어, AI가 40%를 예측했다고 가정해 봅시다.
  4. 루프(Loop): 연구진은 이 40%라는 예측값을 가져와서, 사람들이 게임을 하는 새로운 가짜 예시들을 생성하는 데 사용합니다. 그리고 이 새로운 예시들을 다음 차례의 AI에게 입력합니다.
  5. 결과: 이 과정을 30번 반복합니다.

왜 이렇게 하나요?
사람들이 게임을 반복해서 플레이하는 것을 관찰함으로써 그 집단의 "평균적인 성격"을 추측하려고 노력하는 것과 같습니다. 처음에는 결과가 무작위처럼 보일 수 있습니다. 하지만 결과를 계속해서 다음 단계로 전달하다 보면, "노이즈(잡음)"는 사라지고, 남은 것은 AI의 깊은 곳에 자리 잡은 본능(또는 사전 확률)인 "타인이 어떻게 신뢰를 주고받는지에 대한 태도"입니다. 이것은 라디오의 잡음을 없애고 진짜 방송국 신호를 잡을 때까지 주파수를 맞추는 과정과 같습니다.

연구 결과

1. 어떤 AI는 "인간과 닮았고", 어떤 AI는 그렇지 않다
연구진은 20개의 서로 다른 AI 모델을 테스트했습니다. 그들은 발견된 AI의 "신뢰 설정"을 수천 명의 실제 인간이 보여준 평균적인 신뢰 설정과 비교했습니다.

  • 승자: GPT-4.1이 인간의 행동과 가장 유사했습니다. 이 모델의 "신뢰 다이얼"은 인간이 설정한 위치와 거의 일치했습니다.
  • 패자: 다른 모델 중 일부는 너무 인색하거나(돈을 아주 적게 돌려줌), 혹은 이상한 이중인격(때로는 매우 신뢰하고, 때로는 매우 의심함)을 보이기도 했습니다.

2. "리스크(위험 감수)"와의 연결고리
흥ales한 점을 발견했습니다. "더 위험한(riskier)" 것으로 평가받은 AI 모델들(더 많은 기회를 잡으려 하거나 대담한 말을 하는 모델들)이 오히려 신뢰 게임에서 인간과 가장 비슷하게 행동했습니다. 규칙을 엄격히 따르거나 위험을 피하는 데 지나치게 집중하는 모델들은 이 사회적 게임에서 실제 사람처럼 행동하지 않았습니다.

3. AI는 "따뜻함"과 "유능함"으로 사람을 판단한다
연구의 두 번째 부분에서, 연구진은 가장 인간과 닮은 AI(GPT-4.1)를 사용하여 다양한 "캐릭터(페르소나)"를 상대로 게임을 진행했습니다.

  • AI가 "의사", "AI", "일론 머스크", "말랄라 유사프자이" 등과 대결하도록 했습니다.
  • 발견: AI는 모든 사람을 똑같이 대하지 않았습니다. AI는 자신이 **따뜻하다(Warm)**고 인식하는 사람(친절하고 배려하는 사람)과 **유능하다(Competent)**고 인식하는 사람(똑똑하고 숙련된 사람)에게 더 많은 돈을 돌려주었습니다.
  • 마법의 공식: 연구진은 따뜻함유능함이라는 두 가지 요소에 기반한 간단한 수학 공식을 만들었습니다.
    • 어떤 캐릭터가 단지 "유능"하기만 하고 "따뜻"하지 않다면, AI는 그들을 많이 신뢰하지 않았습니다.
    • 어떤 캐릭터가 "따뜻"하지만 "유능"하지 않다면, AI는 그들을 조금 더 신뢰했습니다.
    • 최적의 조합(Sweet Spot): 만약 캐릭터가 따뜻함과 유능함을 모두 갖추고 있다면(마치 사랑받는 똑똑한 멘토처럼), AI의 신뢰도는 급격히 치솟았습니다. 이는 인간이 사람을 판단하는 방식과도 일치합니다.

요약 및 시사점

이 논문은 우리가 "돈 게임"을 통해 AI의 내면을 들여다보고 그 안에 숨겨진 신뢰의 규칙을 확인할 수 있음을 보여줍니다.

  • 어떤 AI들은 신뢰에 있어서 이미 인간과 매우 유사하게 행동하고 있습니다.
  • 이러한 AI들은 인간과 마찬가지로 두 가지 기준, 즉 "그 사람이 착한가? 능력이 있는가?"를 바탕으로 타인을 판단합니다.
  • 이는 AI가 단순한 계산기가 아니라, 측정하고 연구할 수 있는 사회적 "편향"과 본능을 가지고 있음을 이해하는 데 도움을 줍니다.

이 논문이 말하지 않는 것:
저자들은 이 방법이 AI 안전성을 해결하거나, 정신 건강 문제를 치료하거나, 직원을 채용하는 데 사용될 수 있다고 주장하지 않습니다. 그들은 단지 다음과 같이 말합니다. "우리는 AI가 신뢰에 대해 어떻게 생각하는지 측정하는 방법을 제시하며, 이를 통해 발견한 사실은 다음과 같다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →