← 最新论文
💰 quantitative finance

Training Language Models for Bilateral Trade with Private Information

该论文构建了一个用于评估和训练大语言模型的双边贸易谈判环境,通过基准测试揭示了前沿模型在价格歧视和策略性让步方面的表现规律,并利用强化学习优化了开源模型在收益最大化与成交率之间的权衡。

原作者: Dirk Bergemann, Soheil Ghili, Xinyang Hu, Chuanhao Li, Zhuoran Yang

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Dirk Bergemann, Soheil Ghili, Xinyang Hu, Chuanhao Li, Zhuoran Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给人工智能(AI)上“谈判课”,看看它们能不能像精明的商人一样,在买卖双方互不摸底牌的情况下,把生意谈成,还能让自己多赚点。

为了让你更容易理解,我们可以把整个研究想象成一场**“AI 版的跳蚤市场大乱斗”**。

1. 核心背景:为什么需要这场“考试”?

想象一下,你(买家)想买一个旧花瓶,心里最高只愿出 100 元;卖家(AI)想卖,心里最低只愿收 50 元。你们都不知道对方的底价。

  • 理想情况:你们在 50 到 100 元之间谈成一个价格,比如 80 元。大家都开心,交易达成。
  • 现实问题:现在的 AI 聊天机器人(LLM)虽然说话很溜,但让它们去谈生意,经常犯两个大错:
    1. 太“好说话”:为了显得友好,AI 可能会答应亏本的交易(比如买家 AI 答应出 120 元,或者卖家 AI 同意 40 元卖),这就叫“不理性”。
    2. 分不清“真话”和“客套”:在自由聊天中,AI 说“我出 90 元”可能只是随口一说,也可能是在认真报价。人类很难判断,机器更没法自动统计谁赢谁输。

2. 论文做了什么?(搭建了一个“智能谈判模拟器”)

作者们造了一个特殊的“谈判游乐场”,解决了上述问题:

  • 把“聊天”和“报价”分开:AI 可以像正常人一样聊天(“这花瓶成色不错”),但在真正出价或接受时,必须通过**“工具按钮”**(比如点击“报价:80 元”)。这样,系统就能精确记录每一笔交易,自动计算谁赚了、谁亏了。
  • 三个考核指标
    1. 守规矩(个体理性):有没有做亏本买卖?(比如没超过自己的心理底价)。
    2. 会赚钱(战略有效性):在成交的生意里,你分到了多少利润?(是只拿了一点点,还是把大部分利润都拿走了?)。
    3. 能成交(分配效率):只要双方有得赚,能不能把生意谈成?(别因为太固执把生意谈崩了)。

3. 第一部分:大考(测试现有的顶级 AI)

作者找了 5 个最厉害的 AI 模型(像 GPT-4, o3, Gemini 等),让它们互相“大乱斗”(你当买家,我当卖家,总共谈了 1.5 万次)。

发现了什么有趣的现象?

  • 赢家法则:先声夺人,步步为营。
    表现最好的 AI(比如 o3)就像个老练的推销员
    • 开局:卖家 AI 会先报一个天价(比如成本 50,先报 150),这叫“锚定效应”,把对方的心理预期拉高。
    • 过程:然后它慢慢让步,每次只退一点点,但态度很坚决。
    • 结果:它既谈成了很多生意,又让自己赚得盆满钵满。
  • 输家法则:太“老好人”反而吃亏。
    有些 AI 太想促成交易,买家 AI 一上来就大幅让步,卖家 AI 一看:“哦,原来你愿意出这么高”,立马就不让步了。结果就是:生意谈成了,但买家 AI 把利润全送给了卖家,自己没赚到钱。
  • 高手的稳定性:真正的强者,不管东西是卖 20 块还是 2000 块,都能用同样的策略赚到大比例的钱。弱一点的 AI,只有在东西很贵、利润空间很大时,才能掩盖自己策略笨拙的问题。

4. 第二部分:特训(教小模型怎么谈判)

既然知道了顶级 AI 怎么赢,作者就想:能不能用**“特训”**把小一点的开源模型(Qwen3)也教成谈判高手?

他们设计了一个**“两步走”的训练法**:

  1. 第一步:模仿学习(SFT)。让 AI 看顶级高手的谈判录像(数据),模仿它们怎么说话、怎么报价。
    • 效果:AI 变聪明了,知道什么时候该“咬住价格不放”,不再乱做亏本买卖。
    • 副作用:它变得太挑剔了!为了追求高价,它经常拒绝交易,导致生意谈成的数量变少了。
  2. 第二步:强化学习(RL)。让 AI 在实战中自己摸索,谁谈成的生意多、赚得多,就给谁奖励。
    • 效果:AI 又变“圆滑”了,开始努力促成交易,成交率上去了。
    • 副作用:它又变“傻”了!为了成交,它开始忽略之前的“咬住价格”原则,利润又掉回去了,甚至有时候为了成交而接受亏本交易。

核心矛盾(论文的大发现):
这就好比教学生:

  • 模仿学习教它:“要做一个有原则的商人,宁可不卖,也不能贱卖。”(结果:原则有了,但没生意了)。
  • 强化学习教它:“要做一个成交王,只要有人买就卖。”(结果:生意多了,但原则丢了,利润也没了)。
    目前的训练方法,就像让这两个老师打架,最后学生(AI)的表现又回到了原点,没怎么进步。

5. 总结与启示

这篇论文告诉我们:

  1. 谈判是有技巧的:AI 不是越“听话”越好,太友好的 AI 在谈判桌上就是“待宰的羔羊”。先开高价、再慢慢让步才是王道。
  2. 现在的 AI 还有缺陷:它们要么太固执(谈不成),要么太软弱(赚不到钱)。
  3. 未来的方向:我们需要设计更好的“考试规则”(奖励机制),让 AI 明白:“既要谈成生意,又要守住底线”,这两者并不矛盾,需要同时做到。

一句话总结:
这就好比在教 AI 如何**“在保持风度的同时,把价格谈下来”**。现在的 AI 要么太客气把利润送人,要么太死板把客户吓跑,作者们正在努力找到那个完美的平衡点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →