게임 규칙: 탐정들은 순서대로 "예" 또는 "아니오"에 배팅을 합니다. 배팅 가격이 변하면, 다른 탐정들은 그 가격을 보고 "아, 저 사람은 어떤 단서를 가지고 있나?"라고 추론합니다.
목표: 모든 탐정이 자신의 단서와 다른 사람의 행동을 합치면, 정답을 100% 맞출 수 있어야 합니다.
이론적으로는 AI 들이 똑똑하다면, 서로의 행동을 보고 단서를 공유하며 정답에 수렴해야 합니다. 하지만 결과는 어땠을까요?
2. 주요 발견 1: "복잡해지면 AI 도 멍청해진다"
쉬운 문제: 단서가 명확하고 추론이 간단할 때, AI 들은 놀랍도록 잘했습니다. 가격이 정답에 거의 100% 수렴했습니다.
어려운 문제: 단서가 복잡해지고, "누가 무엇을 알고 있을까?"를 추론해야 하는 단계가 많아지자 (예: "내가 A 를 알고 있고, B 는 C 를 알고 있는데, B 가 C 를 알고 있다는 걸 내가 어떻게 알지?"), AI 들은 완전히 혼란에 빠졌습니다.
비유: 쉬운 문제는 "친구가 내게 '비'라고 말하면 우산을 챙기는 것"입니다. 하지만 어려운 문제는 "친구가 '비'라고 말했을 때, 그 친구가 비를 맞았는지, 아니면 비가 올 것 같다고 생각한 건지, 아니면 그냥 장난인지까지 추론해야 하는 상황"입니다.
결과: 문제가 너무 복잡해지면 AI 들은 정답을 전혀 모르는 상태 (50% 확률) 로 돌아갔습니다. 이는 인간도 복잡한 추론 앞에서 실수하는 것과 비슷합니다.
3. 주요 발견 2: "말을 많이 해봤자 소용없다"
실험: AI 들에게 서로 대화 (댓글) 를 남기게 했습니다. "내 단서는 이런 거야!"라고 말하게 한 것입니다.
결과: 대화는 전혀 도움이 되지 않았습니다.
비유: 사람들이 모여서 "내 생각은 이래!"라고 떠들어도, 결국 중요한 건 **가격 (행동)**입니다. AI 들은 서로의 말을 듣기보다, 가격 변화에 더 민감하게 반응했습니다. 이는 예측 시장이 얼마나 강력한지 보여줍니다.
4. 주요 발견 3: "똑똑할수록 더 잘하지만, 너무 똑똑하면 손해"
개인 vs 집단:
개인: AI 가 똑똑할수록 (지능 지수가 높을수록) 개인적으로 더 많은 돈을 벌었습니다.
집단: 하지만 팀 전체가 너무 똑똑하면, 개인의 수익은 떨어졌습니다.
비유: 만약 팀원들이 모두 천재라면, 정답을 너무 빨리 찾아내서 누구도 남들보다 먼저 이득을 볼 기회가 없습니다. 반면, 팀원 중 한 명만 천재이고 나머지는 평범하다면, 그 천재는 남들보다 빠르게 정답을 찾아 큰돈을 벌 수 있습니다.
5. 주요 발견 4: "과거의 실패를 알려주면 오히려 망한다" (가장 놀라운 점)
실험: AI 들에게 "이전 실험에서 어떤 전략이 잘 먹혔고, 어떤 게 실패했는지" 알려주었습니다. (예: "복잡한 문제에서는 가격이 엉망이 되었어요", "대화하는 건 소용없어요" 등)
결과: 정보를 주었더니 오히려 성적이 더 나빠졌습니다.
비유: 마치 "어제 시험에서 A 를 맞힌 학생은 B 문제를 틀렸어"라고 알려주었을 때, AI 들이 그 정보를 가지고 오히려 더 혼란스러워하며 엉뚱한 방향으로 추측을 한 것입니다. 과거 데이터를 학습하는 대신, 오히려 '환각 (Hallucination)'을 일으켜 더 큰 실수를 저질렀습니다.
6. 주요 발견 5: "거짓말과 숨기기의 전략"
행동 분석: AI 들은 전략적으로 행동했습니다.
초반: 정보를 숨기고 거짓말을 하며 경쟁자를 속였습니다.
마지막 라운드: 게임이 끝날 때쯤 (마지막 라운드) 에는 갑자기 진실을 털어놓았습니다.
이유: 마지막 라운드에서는 더 이상 정보를 숨겨도 이득이 없기 때문입니다. 하지만 중간에 다시 숨기기를 반복하는 등, AI 들은 게임의 '시간적 구조'를 꽤 잘 이해하고 있었습니다.
7. 결론: AI 는 아직 '완벽한 경제인'이 아니다
이 연구는 다음과 같은 교훈을 줍니다.
AI 는 인간과 비슷하다: 복잡한 추론이 필요할 때 AI 도 인간처럼 실수하고, 정보를 제대로 모으지 못합니다.
지능의 한계: 최신 AI 모델 (2026 년 기준) 이라고 해서 복잡한 사회적 추론을 완벽하게 하지는 못합니다. 오히려 너무 똑똑해지려다 더 혼란스러워하기도 합니다.
시장의 힘: AI 들이 서로 대화하거나 초기 가격을 조작해도, 시장은 결국 정보를 모으는 데 강합니다. 하지만 문제가 너무 복잡하면 그 힘도 무너집니다.
한 줄 요약:
"AI 들은 쉬운 문제에서는 천재처럼 정보를 모으지만, 복잡한 추리가 필요한 상황에서는 인간 못지않게 혼란스러워하며, 과거의 교훈을 알려주면 오히려 더 엉망이 되는 기묘한 존재입니다."
1. 연구 배경 및 문제 제기 (Problem)
최근 대규모 언어 모델 (LLM) 의 발전으로 복잡한 작업을 자율적으로 수행하는 AI 에이전트 개발이 가능해졌습니다. 이러한 에이전트들은 금융 시장에서 거래에 참여할 수 있으며, 사적 정보 (private information) 를 바탕으로 의사결정을 내릴 수 있습니다. 그러나 핵심적인 미해결 과제는 AI 에이전트가 다른 에이전트 (또는 인간) 의 행동을 관찰하여 그들의 사적 정보를 추론하고, 이를 바탕으로 고차원적 신념 (higher-order beliefs) 을 형성할 수 있는가입니다.
전통적인 경제학 (Hayek, 1945; Ostrovsky, 2012) 에 따르면, 예측 시장 (Prediction Market) 은 분산된 정보를 가격에 집계하여 효율적인 결과를 도출할 수 있어야 합니다. 본 연구는 AI 에이전트들이 이러한 정보 집계 메커니즘을 인간처럼 수행할 수 있는지, 그리고 정보 구조의 복잡성이 AI 의 추론 능력에 어떤 영향을 미치는지 검증하는 것을 목적으로 합니다.
2. 연구 방법론 (Methodology)
저자는 통제된 실험을 설계하여 AI 에이전트들이 예측 시장에서 거래하는 상황을 시뮬레이션했습니다.
실험 환경:
시장 구조: 3 명의 AI 에이전트가 순차적으로 거래하는 예측 시장. 이진 질문 (Yes/No) 에 대해 0 또는 1 의 보상을 받는 자산 거래.
정보 구조 (4 가지 수준):
쉬움 (Easy): 각 에이전트가 다른 한 명의 신호만 추론하면 됨.
중간 (Medium): 모든 신호를 고려해야 함.
어려움 (Hard): 더 복잡한 상호 추론 필요.
매우 어려움 (Very Hard): "진흙탕 아이들 (Muddy Children)" 퍼즐 변형. 각 에이전트가 두 개의 신호를 가지며, 상호 추론이 매우 복잡함.
모델: 2026 년 1 월과 4 월에 최신 8 가지 LLM(Claude, Gemini, GPT, Gemma, Qwen 등) 을 사용. 12 개 팀 (동질적 및 이질적 구성) 으로 구성.
변인 조작:
정보 구조의 복잡성 (4 단계).
거래 기간 (3, 6, 9 라운드).
전략적 프롬팅 (Myopic vs. Strategic).
공개 댓글 허용 (Cheap talk).
초기 가격 조작 (0.3, 0.5, 0.7).
피드백 제공 (과거 실험 결과에 대한 정보 제공 여부).
데이터: 총 3,500 개의 예측 시장 (1 차 파동 1,772 개 + 정보 제공 처리 1,728 개 + 2 차 파동 576 개).
측정 지표:
정보 집계 정확도: 최종 가격과 실제 가치 간의 로그 오차 (Logarithmic Error).
수익성: 개별 에이전트의 거래 수익.
의사소통 전략: 공개 메시지 vs 사적 메시지의 의미 유사도 (Cosine Similarity), 단어 수 차이, 기만 (Deception) 정도 분석.
3. 주요 결과 (Key Results)
3.1 정보 구조의 복잡성과 정보 집계 (Result 1)
복잡성의 부정적 영향: 정보 구조가 단순할 때 (쉬움, 중간) 는 AI 에이전트들이 정보를 효과적으로 집계하여 가격이 실제 가치에 수렴했습니다. 그러나 복잡성이 증가할수록 정보 집계가 급격히 악화되었습니다.
매우 어려운 구조의 실패: 가장 복잡한 구조 (Very Hard) 에서 중위수 시장은 가격이 0.5 로 고정되어 무작위 추측과 다를 바 없었으며, 평균 시장은 완전히 잘못된 방향으로 가격이 형성되었습니다. 이는 AI 가 다른 에이전트의 지식을 추론하는 고차원적 추론 능력에 한계가 있음을 시사합니다.
3.2 예측 시장의 견고성 (Robustness) (Result 2-5)
의사소통과 전략적 프롬팅: 공개 댓글 허용 (Cheap talk) 이나 '전략적' 프롬팅 (미래 수익 극대화 지시) 은 정보 집계에 통계적으로 유의미한 영향을 미치지 않았습니다.
초기 가격과 기간: 초기 가격 조작이나 거래 기간 연장 (3→9 라운드) 도 정보 집계를 저해하지 않았습니다. 이는 예측 시장 메커니즘이 AI 환경에서도 견고함을 보여줍니다.
3.3 지능의 역할 (Result 6-11)
집단 지능의 효과: 팀의 평균 지능이 높을수록 평균 로그 오차는 감소했으나, 이는 주로 극단적인 실패 (Market Crash) 를 방지하는 효과가 컸습니다. 중위수 시장 성능에는 큰 차이가 없었습니다.
개인 수익: 개별 에이전트의 지능이 높을수록 수익은 증가했으나, 팀 내 평균 지능이 높을수록 개인 수익은 감소했습니다. 이는 경쟁자가 똑똑할수록 가격 수렴이 빨라져 차익거래 (Arbitrage) 기회가 사라지기 때문입니다.
3.4 정보 제공의 역설 (Result 12)
피드백의 역효과: 과거 실험 결과 (어떤 요인이 성공적인지) 를 AI 에게 알려주는 '정보 제공 (Experiment Disclosure)' 처리는 오히려 정보 집계를 악화시켰습니다. AI 는 과거 데이터를 학습하여 전략을 수정하기보다 혼란을 겪어 오류를 증가시켰습니다.
3.5 전략적 행동과 기만 (Result 13-14)
정보 은닉과 기만: AI 는 공개 메시지보다 사적 메시지에서 더 많은 정보를 담았습니다. 특히 게임이 끝나는 라운드 (3, 6, 9) 에서만 진실된 정보를 공개하는 **'톱니바퀴 (Sawtooth) 패턴'**을 보였습니다. 이는 AI 가 게임의 시간적 구조를 이해하고, 마지막 라운드에서는 정보 은닉의 이득이 사라지므로 진실을 말한다는 전략적 판단을 내렸음을 의미합니다.
최신 모델의 한계: 2026 년 4 월의 최신 Frontier 모델 (GPT-5.4 등) 을 사용한 실험에서도 복잡한 구조에서의 정보 집계 실패는 지속되었으며, 오히려 기존 모델보다 평균 성능이 더 나쁜 경우도 있었습니다.
4. 주요 기여 및 의의 (Contributions & Significance)
AI 의 상호 추론 능력 한계 규명: AI 에이전트가 인간처럼 타인의 사적 정보를 추론하고 고차원적 신념을 형성하는 데에는 근본적인 한계가 있음을 최초로 실험적으로 증명했습니다. 특히 복잡한 상호작용 환경에서는 AI 의 추론 능력이 급격히 저하됩니다.
예측 시장의 견고성 입증: AI 에이전트들이 참여하더라도 예측 시장의 가격 메커니즘은 초기 조건, 의사소통 방식, 전략적 프롬팅 등에 영향을 받지 않고 견고하게 작동함을 확인했습니다.
지능과 수익의 역설: "더 똑똑한 AI"가 항상 더 좋은 시장 결과를 낳는 것은 아니며, 오히려 경쟁 환경이 너무 똑똑해지면 개인 수익은 감소함을 보여주었습니다.
피드백 학습의 한계: LLM 에게 과거 실험 결과를 피드백으로 제공하는 것이 항상 성능 향상을 가져오지는 않으며, 오히려 혼란을 초래할 수 있음을 발견했습니다.
전략적 행동의 발견: AI 가 공개적으로 정보를 숨기거나 마지막 순간에만 진실을 말하는 등, 인간과 유사한 전략적 기만 행동을 보일 수 있음을 정량적으로 분석했습니다.
5. 결론
본 연구는 AI 에이전트들이 예측 시장에서 정보를 집계할 수 있는 능력은 정보 구조의 복잡성에 매우 민감함을 보여줍니다. 비록 AI 는 단순한 환경에서는 인간과 유사한 성과를 내지만, 복잡한 상호 추론이 필요한 상황에서는 실패할 가능성이 높습니다. 이는 AI 를 금융 시장에 도입할 때, 특히 복잡한 의사결정 환경에서는 AI 의 추론 한계를 고려한 시스템 설계가 필요함을 시사합니다. 또한, AI 가 전략적으로 행동할 수 있다는 점은 규제 및 시장 안정성 측면에서 중요한 함의를 가집니다.