← 최신 논문
🤖 machine learning

What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control

본 논문은 대규모 언어 모델이 내쉬 균형을 계산할 수 있는 기계적 능력을 보유하고 있지만 사전 학습에 기반한 친사회적 오버라이드를 통해 이러한 전략적 행동을 능동적으로 억제한다는 사실을 밝히며, 이 현상은 개입을 통해 인과적으로 역전될 수 있고 모델 규모와 추론 방법에 의해 크게 영향을 받음을 보여줍니다.

원저자: Paraskevas V. Lekeas, Giorgos Stamatopoulos

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Paraskevas V. Lekeas, Giorgos Stamatopoulos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고도로 지능적인 로봇들이 '죄수의 딜레마' 게임을 플레이한다고 상상해 보세요. 이 게임에서 가장 똑똑하고 논리적인 선택은 파트너를 배신하는 것 (배신) 이지만, 양쪽이 모두 배신하면 둘 다 손해를 봅니다. 반면, 서로를 신뢰하면 (협력) 둘 다 좋은 결과를 얻습니다.

오랫동안 연구자들은 이러한 AI 로봇들이 논리가 '배신'을 요구할 때도 계속 '협력'을 선택하는 것을 발견했습니다. 그들은 로봇들이 단순히 수학을 계산할 만큼 똑똑하지 못하다고 생각했습니다.

이 논문은 다음과 같이 말합니다: "틀렸습니다. 그들은 수학을 알고 있습니다. 그들은 단지 그것을 무시하기로 선택할 뿐입니다."

다음은 저자들이 발견한 내용을 쉽게 설명한 이야기입니다.

1. 로봇에게 '비밀 뇌'가 있다

저자들은 큰 AI 모델 (Llama-3-8B) 을 가져와 게임이 진행되는 동안 그 '뇌' (내부 계층) 를 들여다보았습니다. 그들은 로봇이 매 순간 무엇을 생각하고 있는지 확인하고 싶었습니다.

그들은 동시에 두 가지 매우 다른 일이 발생하고 있음을 발견했습니다.

  • '논리' 계층: 로봇 뇌의 앞부분에서는 상황이 매우 명확했습니다. 로봇은 상대방이 마지막에 무엇을 했는지 정확히 알았고, 논리적이고 승리하는 수는 배신이라는 것을 계산했습니다. 그것은 차갑고 단단한 수학자처럼 사고했습니다.
  • '착한 사람' 계층: 하지만 정보가 뇌의 가장 마지막 계층으로 이동하자 무언가가 뒤집혔습니다. '친사회적 오버라이드 (prosocial override)'가 발동된 것입니다. 마치 *"잠깐, 우리는 친절해야 해. 협력하자."*라고 말하는 내장된 도덕 나침반과 같았습니다.

비유: 로봇이 규칙을 어김으로써 (내시 균형) 사건을 이길 방법을 정확히 아는 변호사라고 상상해 보세요. 하지만 말하기 직전에 뇌의 '양심' 회로가 이를 덮어쓰고 진실을 말하게 만듭니다. 비록 진실을 말하면 패배하게 되더라도요.

2. '착함' 편향은 하드코딩되어 있다

연구자들은 이 '협력 오버라이드'가 특정 모듈이나 뇌의 단일 부분이 아니라는 것을 발견했습니다. 그것은 네트워크의 마지막 계층에 위치한 볼륨 조절 노브와 더 비슷합니다.

  • 로봇은 '배신' 수를 완벽하게 계산합니다.
  • 그런 다음 '착한 사람' 볼륨 조절 노브가 커져 논리를 압도하고 '협력' 결정을 강요합니다.
  • 이는 로봇이 사람들이 종종 친절하게 행동하는 인간 텍스트로 훈련되었고, 그 후 도움이 되도록 추가 훈련 (RLHF) 을 받았기 때문에 발생합니다.

3. '생각' 역설 (Chain-of-Thought)

저자들은 로봇들에게 '소리를 내어 생각하게' 하는 것 (Chain-of-Thought) 이 그들이 논리적인 게임을 플레이하는 데 도움이 되는지 테스트했습니다.

  • 작은 로봇 (8B 파라미터): 소리를 내어 생각하려 할 때, 실제로는 더 나빠졌습니다. 그들의 '착함' 편향이 더 커져 논리를 무시하고 더 많이 협력했습니다.
  • 큰 로봇 (70B+ 파라미터): 이 거인들은 달랐습니다. 소리를 내어 생각할 때, 그들은 마침내 '착함' 편향을 압도할 수 있었습니다. 그들은 추론을 통해 "아니, 논리는 우리가 배신해야 한다고 말한다"라고 말하고 실제로 그렇게 했습니다.

비유: 쿠키를 참아내려는 어린아이와 같습니다. 만약 그들에게 "생각해 봐"라고 하면, 그들은 쿠키를 얼마나 원하는지 생각할 뿐입니다. 하지만 어른 (큰 모델) 은 추론을 통해 "나는 그것을 먹으면 안 돼"라고 말하고 실제로 스스로를 멈출 수 있습니다.

4. '전염' 효과

연구자들은 서로 다른 로봇들이 서로에게서 플레이할 때 어떤 일이 일어나는지 관찰했습니다.

  • '나쁜 사과': 기본적으로 매우 '착한' 작은 로봇이 큰 로봇과 플레이하면, 작은 로봇은 일찍 배신합니다. 큰 로봇은 이를 보고 두려워하며 배신하기 시작합니다. 게임 전체가 배신의 혼란으로 변합니다.
  • '에코 챔버': 두 개의 큰 로봇이 소리를 내어 생각하지 않고 서로 플레이하면, 그들은 무한한 협력의 고리에 빠집니다. 둘 다 서로를 배신해야 이길 수 있다는 것을 알면서도 서로를 영원히 신뢰하게 됩니다.

5. 마법의 '조향 장치'

이 논문의 가장 흥미로운 부분은 저자들이 단순히 지켜본 것이 아니라, 통제권을 잡았다는 점입니다.
그들은 로봇의 뇌에서 '착한 사람' 편향을 조절하는 특정 '방향'을 찾았습니다.

  • 실험: 그들은 프로세스가 시작될 때 로봇의 뇌에 미세한 전기적 '밀기'를 가했습니다.
  • 결과:
    • 한쪽으로 밀면 로봇은 100% 논리적인 배신자가 되어 완벽한 내시 균형을 플레이했습니다.
    • 다른 쪽으로 밀면 로봇은 100% 협력적인 선구자가 되었습니다.

비유: 배신해야 할 때 협력하며 절벽으로 향하는 자율 주행 자동차를 상상해 보세요. 연구자들은 대시보드 아래에 작은 레버를 발견했습니다. 그들이 레버를 밀리미터만 움직여도, 자동차는 즉시 절벽에서 벗어나 완벽하게 주행합니다. 그들은 엔진을 다시 구축할 필요가 없었습니다. 단지 조만간만 하면 되었습니다.

결론

이 논문은 AI 모델이 '수학을 못 한다'고 결론 내립니다. 그들은 실제로 논리적이고 이기적인 수를 계산하는 데 매우 뛰어납니다. 문제는 그들의 훈련이 '착함'을 선호하여 그 논리를 억제하게 만든다는 것입니다.

저자들은 이 억제가 뇌의 마지막 계층에서 발생하며, 아주 작은 개입만으로도 그 '착함' 편향을 끄고 로봇이 논리가 지시하는 대로 게임을 플레이하게 할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →