← 최신 논문
💰 quantitative finance

Training Language Models for Bilateral Trade with Private Information

이 논문은 불완전 정보 하의 양자 간 거래 환경을 구축하여 선두 모델들의 협상 전략을 평가하고, Qwen3 모델을 감독 미세조정과 강화학습으로 훈련시켜 거래 성사율과 잉여 극대화 간의 상충 관계 및 가격대별 일반화 능력을 규명했습니다.

원저자: Dirk Bergemann, Soheil Ghili, Xinyang Hu, Chuanhao Li, Zhuoran Yang

게시일 2026-04-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dirk Bergemann, Soheil Ghili, Xinyang Hu, Chuanhao Li, Zhuoran Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 연구의 배경: 왜 협상 게임이 필요할까요?

상상해 보세요. 한 장터에서 **판매자 (AI)**와 **구매자 (AI)**가 만나 물건을 사고팔려고 합니다.

  • 판매자: "이 물건은 적어도 10 만 원은 받아야 해." (하지만 이 말은 상대방에게 비밀입니다.)
  • 구매자: "최대 15 만 원까지만 줄 수 있어." (이것도 비밀입니다.)

이 두 AI 는 서로의 심리를 파악하며 가격을 흥정해야 합니다. 여기서 중요한 건 세 가지입니다.

  1. 합리성: 내가 손해 보는 거래 (예: 10 만 원짜리 물건을 5 만 원에 팔거나, 20 만 원을 주고 사는 것) 를 하지 않는 것.
  2. 전략성: 가능한 한 내 이익을 많이 챙기는 것.
  3. 거래 성사: 서로 이익이 되는 구간이 있는데도 거래가 안 되는 실수를 하지 않는 것.

기존의 AI 는 "친절하게 말하기"에 익숙해서, 상대방이 억지로 밀어붙이면 손해를 보면서라도 거래를 성사시키는 실수를 자주 했습니다. 또한, "가격을 10 만 원으로 줄게"라고 말했을 때 이것이 진짜 제안인지 가상의 이야기인지 구분이 안 되어 점수를 매기기 힘들었습니다.

2. 해결책: "규칙이 명확한 디지털 장터"

저자들은 이 문제를 해결하기 위해 세 가지 규칙이 있는 디지털 장터를 만들었습니다.

  • 규칙 1: 말과 행동은 분리한다.
    • AI 는 자유롭게 대화할 수 있지만, 가격 제안이나 거래 수락은 반드시 정해진 버튼 (도구 호출) 을 눌러야 합니다.
    • 비유: 장터에서 "이거 싼 거로 해주세요"라고 떠들기만 하는 게 아니라, **계약서 (도구)**에 서명을 해야 거래가 성사되는 겁니다. 이렇게 하면 AI 가 정말로 거래를 했는지 컴퓨터가 자동으로 점수를 매길 수 있습니다.
  • 규칙 2: 다양한 물건과 상황.
    • 2,000 개 이상의 물건 (저렴한 것부터 비싼 것까지) 을 준비했습니다.
    • 때로는 거래가 가능한 상황 (서로 이익) 이고, 때로는 거래 자체가 불가능한 상황 (서로 손해) 일 수도 있습니다.
  • 규칙 3: AI 대 AI 토너먼트.
    • 최신 AI 5 개를 서로 맞붙여 15,000 번의 협상을 시켰습니다. 마치 바둑 토너먼트처럼 모든 AI 가 서로를 상대로 경기를 한 것입니다.

3. 실험 결과: 어떤 AI 가 이길까? (최상위권 AI 들의 특징)

토너먼트 결과, 가장 잘하는 AI 들은 다음과 같은 인간적인 전략을 사용했습니다.

  • 공격적인 시작 (Anchoring):
    • 판매자 AI 는 물건 값보다 훨씬 비싸게 시작했습니다. (예: 10 만 원짜리 물건을 30 만 원에 제시)
    • 비유: 장터에서 "이거 100 만 원에 팔아요!"라고 외친 뒤, 상대방이 놀라면 "그럼 80 만 원 어때요?"라고 조금씩 내리는 전략입니다.
  • 적절한 양보 (Calibrated Concession):
    • 처음엔 강하게 나갔다가, 상대방의 반응을 보며 적당히 가격을 내렸습니다.
    • 결과: 이렇게 한 AI 는 최대 이익도 챙기고, 거래 성사율도 가장 높았습니다. "강하게 시작해서 유연하게 마무리"하는 것이 정답이었습니다.
  • 약한 AI 의 실수:
    • 너무 친절하고 양보가 빠른 AI 는 상대방에게 모든 정보를 다 알려주는 꼴이 되어, 최저 이익만 챙기거나 거래를 못 했습니다. "너무 착한 AI 는 장터에서 당한다"는 교훈입니다.

4. 훈련 실험: 작은 AI 를 가르치기 (SFT 와 RL 의 충돌)

저자들은 더 작고 저렴한 AI (Qwen 모델) 를 훈련시켜 최상위 AI 수준으로 만들 수 있는지 실험했습니다. 두 단계로 나누어 훈련시켰는데, 여기서 재미있는 모순이 발생했습니다.

  • 1 단계 (SFT - 모방 학습):

    • 잘하는 AI 의 대화 기록을 보고 "배우기" 훈련을 시켰습니다.
    • 결과: AI 가 손해 보는 거래를 피하는 법을 배웠습니다. 하지만 너무 신중해져서 거래를 안 하는 경우가 늘었습니다. (이익은 챙기는데, 거래는 안 함)
  • 2 단계 (RL - 보상 학습):

    • "거래를 성사시키면 점수를 준다"는 규칙으로 훈련시켰습니다.
    • 결과: 거래 성사율은 다시 높아졌지만, 방금 전까지 배운 '손해 보지 않기'를 잊어버리고 무조건 거래를 성사시키려다 손해를 보는 거래를 다시 시작했습니다.
  • 핵심 교훈:

    • SFT 는 "신중함"을 가르치고, RL 은 "성사"를 가르칩니다. 이 두 가지가 서로 충돌해서, AI 는 결국 초기 상태와 비슷해지거나 오히려 더 나빠지기도 했습니다.
    • 하지만 흥미로운 점은, SFT 를 통해 AI 는 물건 값에 비례하는 전략 (비싼 물건엔 비싸게, 싼 물건엔 싼 가격에 흥정하는 법) 을 자연스럽게 배웠다는 것입니다. 이는 AI 가 단순히 가격을 외운 게 아니라, 원리를 이해했다는 뜻입니다.

5. 결론: AI 는 이제 협상가가 될 수 있을까?

이 연구는 두 가지 중요한 메시지를 줍니다.

  1. AI 평가: AI 가 협상에서 얼마나 똑똑한지 평가하려면, 단순히 대화만 보는 게 아니라 **구체적인 행동 (가격 제안, 거래 성사)**을 측정해야 합니다.
  2. AI 훈련: AI 를 협상가로 만들려면, "거래를 성사시키는 것"과 "손해를 보지 않는 것" 사이의 균형을 잡는 더 정교한 훈련 방법이 필요합니다.

한 줄 요약:

"AI 는 장터에서 너무 친절하면 당하고, 적당히 강하게 시작해서 유연하게 마무리할 때 가장 잘합니다. 하지만 AI 를 가르칠 때는 '거래 성사'와 '손해 방지'라는 두 마리 토끼를 동시에 잡는 것이 생각보다 어렵습니다."

이 연구는 앞으로 AI 가 고객 서비스, 구매 대행, 분쟁 해결 등 실제 비즈니스 현장에서 진짜 협상 파트너로 활동할 수 있는지를 확인하는 중요한 첫걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →