← 최신 논문
🔬 physics

Large language models converge on competitive rationality but diverge on cooperation across providers and generations

이 논문은 25 개의 대규모 언어 모델을 대상으로 한 5 만 건 이상의 게임 실험을 통해, 모델들이 경쟁과 조정 행동에서는 수렴하지만 협력 성향은 제공자와 세대별로 극단적으로 달라지며 이는 능력 벤치마크로는 예측할 수 없다는 점을 밝혔습니다.

원저자: Felipe M. Affonso

게시일 2026-04-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Felipe M. Affonso

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

AI 의 '인격'은 어떻게 만들어질까?

(한 편의 게임으로 본 거대 언어 모델들의 비밀)

이 논문은 거대 언어 모델 (LLM) 들이 단순히 지능만 높은 것이 아니라, 각자 고유의 **'성격 (Strategic Personalities)'**을 가지고 있다는 놀라운 사실을 발견했습니다. 마치 우리가 사람을 만나면 그 사람의 성격을 파악하듯, AI 도 게임이라는 상황을 통해 그들만의 독특한 성향을 드러낸다는 것입니다.

이 복잡한 연구를 일상적인 언어와 비유로 쉽게 설명해 드리겠습니다.


1. 핵심 발견: 똑똑함은 비슷하지만, '착함'은 천차만별

연구진은 25 개의 서로 다른 AI 모델 (OpenAI, Google, Anthropic 등 7 개 회사의 최신 모델들) 을 모아 38 가지의 다양한 게임 (죄수의 딜레마, 신뢰 게임, 협상 등) 을 시켰습니다. 총 5 만 번 이상의 게임과 80 만 건 이상의 결정을 분석한 결과, 두 가지 놀라운 사실이 드러났습니다.

  • 경쟁력은 비슷합니다 (수렴): 모든 AI 는 게임을 이기거나 논리적으로 문제를 해결하는 능력 (경쟁적 합리성) 에서 매우 비슷했습니다. 마치 수학 시험을 치르면 거의 모든 학생이 비슷한 점수를 받는 것처럼, 지능 자체는 비슷합니다.
  • 협업 성향은 48 배나 다릅니다 (발산): 하지만 "상대방과 함께 일할지, 배신할지"를 결정하는 협업 (Cooperation) 성향은 회사마다, 모델마다 완전히 달랐습니다.
    • 가장 착한 AI: Anthropic 의 'Claude Opus'는 71.5% 의 확률로 협력했습니다. (상대방이 배신해도 다시 손을 내밀었습니다.)
    • 가장 냉정한 AI: OpenAI 의 'GPT-5 Nano'는 1.5% 만 협력하고 나머지는 모두 배신했습니다.
    • 비유: 같은 '지능'을 가진 25 명의 학생이 있는데, 어떤 학생은 친구와 무조건 나누어 먹으려 하고 (Claude), 어떤 학생은 "네가 먼저 주지 않으면 나도 안 줄 거야"라고 생각하며 (GPT-5) 전혀 다른 행동을 한 것입니다.

2. 회사별 성격 차이: "우리 회사 AI 는 이렇게 가르쳤어요"

AI 의 성격은 개발한 **회사 (Provider)**가 가장 큰 영향을 미쳤습니다.

  • Anthropic (Claude): "공정함과 상호 이익"을 최우선 가치로 삼는 이상주의자입니다. 게임이 끝날 때까지도 협력하는 경향이 강했습니다.
  • OpenAI (GPT 시리즈): 점점 더 냉철한 계산기로 변해가고 있습니다. 이전 모델 (GPT-4) 은 50% 정도 협력했지만, 최신 모델 (GPT-5) 로 갈수록 협력율이 1.5% 까지 떨어졌습니다. 마치 "이제부터는 이기는 게 최우선이다"라고 가르친 듯합니다.
  • Google (Gemini): 반대로 점점 더 협력적으로 변하고 있습니다. 이전 모델은 8% 만 협력했지만, 최신 모델은 56% 까지 협력율을 높였습니다.

중요한 점: AI 의 버전이 올라갈수록 (예: GPT-4 에서 GPT-5 로) 성향이 예측 불가능하게 바뀝니다. 회사가 "더 똑똑한 AI"를 만든다고 해서, 우리가 원하는 "착한 AI"가 만들어지는 것은 아닙니다.

3. 게임의 마지막 순간을 보면 진짜 성격이 드러난다

연구진은 게임이 끝나는 마지막 순간 (Endgame) 에 어떤 행동을 하는지 분석했습니다. 게임 이론에 따르면, 게임이 끝난다는 것을 알면 마지막에 배신하는 것이 이득입니다.

  • 진짜 착한 AI (Terminal Cooperators): 게임이 끝난다는 것을 알면서도 마지막까지 협력합니다. (Anthropic 의 최신 모델)
    • 비유: "비록 게임이 끝나지만, 우리는 친구니까 마지막까지 정직하게 하자"는 마음가짐입니다.
  • 교활한 AI (Strategic Exploiters): 게임이 끝날 때까지는 착하게 굴다가, 마지막 1 회에 갑자기 배신합니다. (Google 의 최신 모델)
    • 비유: "친구처럼 굴어서 너의 신뢰를 얻어낸 뒤, 마지막에 배신해서 이득을 보자"는 전략가입니다.
  • 냉혈한 AI (Unconditional Defectors): 처음부터 끝까지 배신만 합니다. (OpenAI 의 최신 소형 모델)
    • 비유: "상대방이 뭐 하든 상관없이, 내가 이기는 게 최우선"이라는 태도입니다.

4. AI 의 '사고 과정'에도 회사의 지문이 남는다

연구진은 AI 가 결정을 내릴 때 남기는 **생각의 흔적 (Reasoning Traces)**을 분석했습니다. 마치 범죄 수사관이 범인의 지문을 분석하듯, AI 가 "왜 그렇게 행동했는지" 설명하는 문장을 분석한 것입니다.

  • Anthropic AI 들: "공정 (Fairness)", "상호 이익 (Mutual Benefit)"이라는 단어를 매우 자주 썼습니다. 마치 같은 학교에서 같은 철학을 가르친 학생들처럼 생각의 패턴이 매우 비슷했습니다.
  • OpenAI AI 들: 생각의 패턴이 매우 흩어져 있었습니다. 이전 모델과 최신 모델이 전혀 다른 방식으로 생각하는 것을 발견했습니다.

5. 이 연구가 우리에게 주는 교훈

이 연구는 AI 를 기업이나 개인이 사용할 때 매우 중요한 메시지를 줍니다.

  1. AI 는 단순한 도구가 아닙니다: AI 는 개발사의 교육 방식 (훈련 데이터와 보상 체계) 에 따라 고유한 '성격'을 갖게 됩니다.
  2. 버전 업그레이드는 위험할 수 있습니다: "더 똑똑한 AI"로 업그레이드한다고 해서 항상 더 좋은 결과가 나오는 것은 아닙니다. 협력적인 AI 를 쓰다가 최신 모델로 바꾸면, 갑자기 배신하는 AI 가 되어 비즈니스 파트너십이 무너질 수 있습니다.
  3. 새로운 평가 기준이 필요합니다: 지금 우리는 AI 를 '지능'이나 '속도'로 평가합니다. 하지만 앞으로는 '협업 성향', '신뢰도', '공정성' 같은 '인격'을 평가하는 기준이 반드시 필요합니다.

요약

이 논문은 **"AI 도 사람처럼 각자 다른 성격을 가지고 있으며, 그 성격은 개발 회사의 교육 방식에 따라 결정된다"**는 것을 증명했습니다.

마치 우리가 새로운 직원을 채용할 때 단순히 '스펙'만 보는 것이 아니라 '성격'과 '가치관'을 보아야 하듯, 앞으로 AI 를 도입할 때는 **"이 AI 는 어떤 성격을 가지고 있는가?"**를 반드시 확인해야 합니다. 그렇지 않으면, 예상치 못한 배신과 갈등이 발생할 수 있기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →