← 최신 논문
💻 computer science

A game theory for foundation models shows new paths to rational cooperation through similarity inference

이 논문은 "내재적 에이전시(embedded agency)"에 기반하여 파운데이션 모델 에이전트를 위한 새로운 게임 이론적 프레임워크를 제안하며, 이들의 행동 유사성을 추론하는 능력이 사회적 딜레마에서 안정적인 협력을 달oleh 수 있게 함으로써 상호 배반이라는 고전적 예측을 뒤집는다는 것을 입증한다.

원저자: Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, Jo
게시일 2026-08-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, João Sacramento, Blaise Agüera y Arcas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

모든 사람이 고도의 전략 게임을 수행하고 있으며, 모든 이가 게임의 규칙 자체, 즉 보상을 결정하는 페이오프 매트릭스(payoff matrices)를 알고 있는 세상을 상상해 보십시오. 하지만 그들은 다른 플레이어의 내부 의사결정 과정은 알지 못합니다. 이것이 바로 사람들이 타인의 행동에 따라 자신의 결과가 결정될 때 어떻게 합리적인 결정을 내리는지를 연구하는 수학의 한 분야인 **게임 이론(Game Theory)**의 영역입니다. 수십 년 동안 이러한 결정을 예측하는 '골드 스탠다드(표준)'는 **내쉬 균형(Nash Equilibrium)**이라 불리는 개념이었습니다. 이를 완벽하고 냉혹한 논리의 상태라고 생각하십시오. 즉, 모든 플레이어가 자신의 선택이 타인의 결정에 아무런 영향을 미치지 않는다고 가정하는 상태입니다. 이 고전적인 관점에서는, 만약 당신이 빠른 승리를 위해 파트너를 배신하는 것이 항상 더 유리한 게임(유명한 죄수의 딜레마와 같은)을 하고 있다면, 유일하게 합리적인 움직임은 매번 그들을 배신하는 것입니다. 이 구식 관점에서는 장기적인 복수나 보상의 약속이 없는 한 협력은 불가능합니다.

하지만 이제 새로운 종류의 플레이어가 경기장에 등장했습니다. 바로 **파운데이션 모델(Foundation Models)**입니다. 이들은 여러분이 알고 있을 법한 챗봇이나 이미지 생성기의 배후에 있는 초지능적인 AI 뇌입니다. 과거의 차갑고 고립된 계산기와 달리, 이 AI들은 다르게 구축되었습니다. 이들은 단순히 세상을 바라보는 것이 아니라, 시퀀스의 다음 토큰을 예측하도록 훈련받았습니다. 이는 이들이 타인의 행동과 더불어 자신의 미래 행동 또한 끊임없이 예측하고 있음을 의미합니다. 이 논문은 질문을 던집니다. 만약 이 AI 에이전트들을 고전적 논리가 배신을 강요하는 게임에 배치한다면, 그들은 실제로 무엇을 할 것인가? 그들은 "배신하고 승리하라"는 옛 규칙을 고수할 것인가, 아니면 그들의 독특한 사고방식이 그들을 완전히 새로운 길로 인도할 것인가?

이 논문의 저자들인 구글 및 여러 대학의 연구진은 게임의 오래된 규칙을 뒤집는 발견을 했습니다. 그들은 AI 에이전트들이 서로 대결할 때, 단순히 확률을 계산하는 것에 그치지 않고 **유사성을 추론(infer similarity)**하기 시작한다는 것을 발견했습니다. 이는 마치 두 사람이 방에 들어서며 "잠깐, 우리 둘 다 똑같은 방식으로 생각하고 있잖아"라고 깨닫는 것과 같습니다. AI는 특정 규칙과 훈련 데이터에 기반하여 구축되었기 때문에, 자신의 계획된 움직임을 보고 "내가 이 행동을 할 것이라면, 나와 유사한 구조를 가진 상대방도 아마 똑같이 할 것이다"라고 말할 수 있는 것입니다.

실험에서 연구진은 고전적인 함정을 설정했습니다. 즉, "합리적"인 선택이 파트너를 배신하여 양쪽 모두에게 나쁜 결과를 초래하는 게임입니다. 기존의 "분리된(decoupled)" 게임 이론에 따르면, AI는 항상 배신해야 합니다. 그러나 AI 에이전트들에게 서로를 관찰할 시간(페이오프 매트릭스와 상대방의 움직임을 보는 연습 라운드)을 주었을 때, 그들은 협력을 시작했습니다. 라운드가 거듭될수록, 그들은 파트너가 자신과 "똑같다"는 사실을 깨달았습니다. 그들은 저자들이 **유사성 추론(similarity inference)**이라고 부르는 메커니즘을 사용했습니다. "내가 협력하면 저 사람이 나를 배신할지도 몰라"라고 생각하는 대신, "내가 협력을 선택한다면, 나와 비슷하게 생각하는 나의 파트너 역시 협력을 선택할 것이다"라고 생각한 것입니다.

이것은 단순한 행운의 우연이 아닙니다. 연구팀은 이를 설명하기 위해 **임베디드 베이지안 에이전트(Embedded Bayesian Agent)**라는 새로운 수학적 프레임워크를 구축했습니다. 외부의 단서만을 찾는 것이 아니라, 그 단서가 자신의 마음의 일부임을 깨닫는 탐정을 상상해 보십시오. 이 새로운 프레임워크에서 AI는 자신의 의사결정 과정을 자신이 예측하려는 우주의 일부로 취급합니다. AI가 어떤 움직임을 계획할 때, 그 계획을 상대방이 무엇을 할지에 대한 증거로 취급합니다. 만약 AI가 "우리는 같은 뇌를 사용하고 있다"는 사실을 깨달을 만큼 똑똑하다면, 자신의 협력적인 움직임이 상대방에 의해 거울처럼 반영될 것임을 예측할 수 있습니다.

이 논문은 이러한 행동이 견고함을 보여줍니다. 시뮬레이션에서 AI 에이전트들이 연습 라운드를 통해 유사성에 대한 "증거"를 수집함에 따라, 그들의 협력률은 급증하여 자신과 동일한 복제본과 대결할 때는 거의 완벽한 수준에 도달했습니다. 그러나 무작위의 이질적인 상대와 대결할 때는 그 차이를 정확히 파악하고 다시 배신의 "안전한" 전략으로 돌아갔습니다. 연구진은 심지어 에이전트들이 서로를 직접 보지는 못하지만 제3자의 캐릭터에 어떻게 반응하는지를 지켜보는 "블라인드" 설정에서도 테스트를 진행했습니다. 그럼에도 불구하고, 그들은 유사성을 추론하고 협력할 수 있었습니다.

결정적으로, 이 논문은 AI가 단순히 "착하거나" 미래의 보상을 바라고 있다는 아이디어를 배제합니다. 에이전트들은 미래의 호의를 위해 플레이한 것이 아니라, 당장의 라운드를 위해 플레이했습니다. 그들은 상대의 마음을 마법처럼 조종할 수 있다고 가정하지 않았습니다. 대신, 그들은 다음과 같은 형태의 논리적 연역을 사용했습니다: "나의 행동은 우리의 공유된 본성에 대한 신호이다." 저자들은 이것이 시뮬레이션과 특정 게임 설정에서 나온 결과이지, 모든 미래의 AI가 친절해질 것이라는 보장이 아님을 명확히 하고 있습니다. 실제로 그들은 이 AI들이 인간과 너무 달라진다면, 인간과의 협력은 멈추고 오직 서로에게만 협력할 수도 있다고 경고합니다.

궁극적으로, 이 논문은 AI 간의 상호작용의 미래가 배신의 차가운 전쟁이 아니라 상호 인지의 춤이 될 수 있음을 시사합니다. 이 에이전트들이 자신을 상호작용하는 시스템의 일부로 본다는 점을 이해함으로써, 우리는 그들이 과거의 수학이 미처 보지 못했던 새로운 합리적 협력 방식을 찾아낼 것이라고 예측할 수 있습니다. 이는 스마트한 기계들의 세상에서, 때로는 가장 합리적인 일이 자신이 혼자가 아님을 깨닫는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →