Are LLMs Effective Negotiators? Systematic Evaluation of the Multifaceted Capabilities of LLMs in Negotiation Dialogues
本文对大语言模型在不同对话场景下的多方面谈判能力进行了系统性评估,揭示了 GPT-4 的卓越性能,同时也指出了在主观评估和策略性响应生成方面存在的特定挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图通过与邻居交换物品来为你的露营旅行争取到最好的交易。你们双方都有一份清单,列出了你们需要的东西(食物、水、木柴),而且每件物品对你来说都有不同的“分值”。想要获胜,你需要理解规则,猜出邻居想要什么,并且说出正确的话,在不让对方生气的情况下获得最高的分值。
这篇论文就像是一份人工智能(AI)尝试玩这场交易游戏的成绩单。研究人员提出了一个问题:现代人工智能聊天机器人(称为大语言模型或 LLM)真的能成为优秀的谈判者吗?
以下是他们研究结果的详细分解,使用了简单的类比:
1. “考试”设置
研究人员不仅仅是观察 AI 聊天,还给它进行了一系列特定的测试,就像老师根据不同科目给学生评分一样。他们将复杂的谈判行为分解为四个主要技能:
- 阅读理解: AI 是否理解了规则和最终的交易?(例如:“我得到了多少分?”)
- 标签识别: AI 能否识别出对方正在做什么?(例如:“这句话是一个‘提议’还是一个‘抱怨’?”)
- 读心术(心智理论): AI 能否猜出对方想要什么,或者对方有多开心,即使对方没有明说?
- 表达能力: AI 能否写出一个既礼貌又足够聪明以获取好交易的回复?
他们在四种不同的“交易场景”中进行了测试,范围从交换露营装备到谈判薪资待遇。
2. 优等生:GPT-4
结果显示,GPT-4 目前是这个班级的“优秀毕业生”。
- 好消息: 它在理解规则、进行数学计算以及猜测对方意图方面,明显优于所有其他 AI 模型。在许多测试中,它甚至击败了一个经过专门训练的专用 AI(就像一个只为这一场考试而学习的学生),而不仅仅是一个仅仅“知识渊博”的通用 AI。
- “人性化”的一面: 在编写回复时,GPT-4 听起来几乎像人类专家一样连贯且逻辑清晰。
3. 困境:AI 会感到困惑的地方
即使是最聪明的 AI 也有难点,表现得像是一个擅长数学但拙于社交察言观色的学生。
- “读心术”故障: 当被问及如何猜测对方对交易的满意程度时,AI 经常出错。这就像一个学生认为老师因为自己得了“A”而感到高兴,但实际上老师正因为学生作弊而怒火中烧。AI 难以理解文字背后的“情绪”。
- “策略”失误: 有时 AI 为了表现得友好而接受一个糟糕的交易。这就像一个柠檬水摊位的孩子,仅仅因为顾客客气地请求,就为了一个便士把所有的柠檬都送了出去,却忘了自己本该追求利润。它经常未能利用所给信息来保护自己的利益。
- “回声效应”: 在某些情况下,AI 会重复对方已经拒绝过的提议,仿佛它忘记了对话的历史。这就像是在和一个不断提出你已经说过“不”的事情的人进行对话。
4. “作弊码”(提示词)
研究人员发现,你向 AI 提问的方式会改变它的表现。
- 思维链 (CoT): 如果你告诉 AI,“在回答之前请一步步思考”,它在处理数学问题时会表现得好得多。这就像告诉学生,“展示你的解题过程”,这有助于他们得到正确答案。
- 少样本学习 (Few-Shot Learning): 如果你在要求 AI 解决问题之前,先给它几个回答示例,它的表现会更好。这就像在要求学生写作文之前,先给他们看一篇范文。
5. 结论
论文得出结论,虽然 AI(特别是 GPT-4)正在成为一个非常有能力的谈判研究工具,但它还称不上是一个完美的谈判者。
- 它擅长于: 遵循规则、进行数学计算以及理解对话结构。
- 它仍在学习: 理解人类情感、具备策略性的自利精神(以好的方式)以及不被冗长的对话所迷惑。
研究人员建议,目前 AI 最适合作为分析数据或培训人类的助手,而不是作为一种可以取代人类在高端交易中的完全自主的谈判者。它是一个强大的助手,但在处理其“社交”工作时,仍然需要人类参与其中进行把关。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。