← 최신 논문
💬 NLP

Can LLMs Replace Economic Choice Prediction Labs? The Case of Language-based Persuasion Games

이 논문은 거대 언어 모델이 언어 기반 설득 게임 내 경제적 선택 예측을 위한 학습 데이터를 생성하는 데 있어 인간 피험자를 효과적으로 대체할 수 있음을 입증하며, 종종 실제 인간 데이터로 학습된 모델보다 더 나은 성능을 보임과 동시에 역사 의존적 결정 패턴을 포착하는 것이 정확한 예측을 위해 매우 중요하다는 점을 밝혀낸다.

원저자: Eilam Shapira, Omer Madmon, Roi Reichart, Moshe Tennenholtz

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Eilam Shapira, Omer Madmon, Roi Reichart, Moshe Tennenholtz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 경제에서 모든 클릭과 모든 스크롤은 하나의 선택입니다. 여행자가 예약 사이트에서 호텔 리뷰를 읽을 때, 그들은 자신의 욕구와 정보를 저울질하며 이 방이 가격만큼의 가치가 있는지 결정하려고 노력합니다. 이것은 고전적인 경제학적 난제입니다. 즉, 불완도한 정보와 기만당할 가능성에 직면했을 때 사람들이 어떻게 결정을 내리는가 하는 문제입니다. 수십 년 동안 경제학자들은 한 사람이 다른 사람을 설득하려고 시도하는 게임을 통해 실제 인간에게 요청함으로써 이러한 순간들을 연구해 왔습니다. 이러한 실험은 실행하기 어렵습니다. 참가자를 모집하고, 맞춤형 소프트웨어를 구축하며, 사람들이 결정을 내릴 때까지 기다려야 하는데, 이 과정은 느리고 비용이 많이 들며 규모가 제한적인 경우가 많습니다.

최근, 우리가 이러한 결정을 연구하는 방식을 바꿀 수 있다고 약속하는 새로운 도구가 등장했습니다. 바로 대규모 언어 모델(LLM)입니다. 이들은 방대한 양의 텍스트로 학습된 인공지능 시스템으로, 놀라운 유창함으로 인간의 언어를 이해하고 생성할 수 있습니다. 연구자들은 이 기계들이 단순히 대화하는 것 이상의 일을 할 수 있는지 궁금해하기 시작했습니다. 이들이 경제 실험에서 실제 사람을 대신할 수 있을까요? 만약 컴퓨터가 인간의 행동을 충분히 잘 모방할 수 있다면, 더 나은 예측 모델을 훈련하는 데 필요한 방대한 데이터를 생성하여 희소한 인간 데이터 문제를 해결할 수 있을 것입니다. 질문은 단지 기계가 인간처럼 말할 수 있느냐가 아니라, 고도의 이해관계가 걸린 상황에서 인간처럼 생각하고 결정할 수 있느냐는 것입니다.

이스라엘 테크니온 공대의 연구팀은 인공지능 에이전트를 복잡한 설득 게임에 배치하여 이 질문에 답하고자 했습니다. 연구 설정에서 전문가 역할을 하는 한 플레이어는 두 번째 플레이어인 의사결정자에게 특정 호텔을 방문하도록 설득하려고 합니다. 전문가는 호텔의 실제 품질을 알고 있지만, 선택 가능한 목록 중 단 하나의 서면 리뷰만을 공유할 수 있습니다. 의사결정자는 그 리뷰와 전문가에 대한 과거 경험을 바탕으로 호텔 방문 여부를 결정해야 합니다. 만약 호텔이 실제로 좋다면 의사결정자가 승리합니다. 만약 호텔이 나쁘다면 의사결정자는 패배합니다. 그러나 전문가는 호텔의 실제 품질과 상관없이 의사결정자가 방문을 선택하기만 하면 항상 승리합니다. 이는 전문가가 더 나은 결과를 얻기 위해 거짓말을 할 수 있는 전략적 긴장을 유발하며, 의사결정자는 시간이 흐름에 따라 기만을 포착하는 법을 배워야 합니다.

연구진은 먼저 수백 명의 실제 인간 플레이어가 여러 라운드에 걸쳐 참여한 이 게임으로부터 데이터를 수집했습니다. 그런 다음 다양한 대규모 언어 모델로 인간 의사결정자를 대체하고, 기계들에게 동일한 규칙을 적용하며 동일한 호텔 리뷰를 마주하도록 지시했습니다. 시뮬레이션을 더 현실적으로 만들기 위해, 연구진은 각 기계에 낙관적인 여행자(항상 밝은 면을 보는 사람)나 가격에 민감한 쇼퍼(비용을 깊이 신경 쓰는 사람)와 같은 특정 성격을 부여했습니다. 이러한 시뮬레이션 게임을 수천 번 실행함으로써, 팀은 기계가 내린 결정의 방대한 데이터셋을 생성했으며, 이를 사용하여 컴퓨터 프로그램이 동일한 상황에서 인간이 어떻게 행동할지 예측하도록 훈련시켰습니다.

결과는 놀라웠습니다. 연구진이 인공지능 플레이어로부터 생성된 데이터만을 사용하여 예측 모델을 훈련했을 때, 해당 모델은 실제 인간 데이터로 훈련된 모델보다 더 뛰어난 인간 행동 예측력을 보였습니다. 단, 기계 데이터셋이 충분히 클 경우에 한했습니다. 사실, 기계 생성 데이터는 테스트된 거의 모든 시나리오에서 인간 데이터를 능가했습니다. 이는 인공지능 에이전트가 단순히 인간의 말을 흉내 내는 것을 넘어, 반복적인 상호작용 속에서 사람들이 학습하고 적응하는 더 깊은 전략적 패턴을 포착했음을 시사합니다. 기계는 단순히 화면 위의 즉각적인 단어에 반응하는 것이 아니라, 과거 리뷰의 이력과 시간이 흐르며 쌓인 신뢰를 저울질하는 법을 배웠습니다.

그러나 이 연구는 기계에만 전적으로 의존할 때 발생하는 중대한 결함도 드러냈습니다. 인공지 verdade 데이터로 훈련된 모델들은 매우 정확했지만, 보정(calibration) 상태가 좋지 않았습니다. 간단히 말해, 모델이 예측에 대해 확신을 가질 때, 실제 인간으로 훈련된 모델보다 더 자주 틀리는 경우가 많았다는 뜻입니다. 기계 데이터는 너무 풍부해서 모델이 대부분의 경우 정답을 맞히도록 가르쳤지만, 모델이 스스로의 확신 정도를 가늠하는 법은 가르치지 못했습니다. 이를 해결하기 위해 연구진은 소량의 실제 인간 데이터와 방대한 양의 기계 데이터를 혼합하는 것이 완벽한 균 balance를 만든다는 것을 발견했습니다. 이 하이브리드 접근 방식은 높은 정확도와 신뢰할 수 있는 확신 수준을 모두 갖춘 모델을 만들어냈습니다.

연구진은 기계가 왜 그렇게 성공적이었는지 이해하기 위해 더 깊이 파고들었습니다. 그들은 인간 행동을 예측하는 핵심이 리뷰의 감성이 아니라, 상호작용의 이력이라는 것을 발견했습니다. 인공지능 에이전트가 많은 과거 라운드를 기억할 수 있도록 허용했을 때, 그들은 인간의 의사결정 패턴과 밀접하게 일치하는 데이터를 생성했습니다. 하지만 기억이 마지막 한두 번의 턴으로 제한되었을 때, 인간 행동을 시뮬레이션하는 능력은 무너졌습니다. 이 발견은 이 게임에서의 인간 의사결정이 단순히 단일 메시지의 정서적 톤을 읽는 것이 아니라, 근본적으로 전략과 역사에 관한 것임을 강조합니다. 기계는 사람들이 그러하듯, '장기적인 게임'을 수행함으로써 성공했습니다.

연구진은 자신들의 결과가 호텔 리뷰에만 국한되지 않도록, 플레이어가 고정된 목록에서 선택하는 대신 원하는 메시지를 자유롭게 작성할 수 있는 더 추상적인 설득 게임에서도 이 접근 방식을 테스트했습니다. 규칙이 덜 엄격한 이 자유로운 환경에서도, 인공지능 플레이어가 생성한 데이터는 인간의 선택을 예측하는 모델을 훈련하는 데 효과적임이 입증되었습니다. 이는 기계가 유용한 훈련 데이터를 생성하는 능력이 단일 실험 유형을 넘어 확장되는 견고한 현상임을 시사합니다.

연구는 인공지능이 아직 인간 행동의 미묘함을 완벽하게 대체할 수는 없지만, 인간을 이해하는 데 필요한 데이터를 생성하는 강력한 엔진 역할을 할 수 있다고 결론짓습니다. 기계를 사용하여 인간 상호작용의 전략적 복잡성을 시뮬레이션함으로써, 연구자들은 전통적인 경제 실험의 병목 현상을 극려할 수 있습니다. 앞으로의 길은 신중한 파트너십을 포함합니다. 즉, 광범위한 행동 모델을 구축하기 위해 인공지능의 규모를 활용하되, 모델이 신뢰할 수 있고 실생활과 부합하도록 아주 적절한 양의 실제 인간 데이터로 그 모델들을 뒷받침하는 것입니다. 이 접근 방식은 우리의 경제 세계를 정의하는 신뢰, 기만, 그리고 의사결정의 복잡한 춤을 연구하는 새로운 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →