想象两位邻居因如何共用他们的后院而争执。一位想要一个安静的花园用于阅读,另一位则想为他们的孩子建一个喧闹的游乐场。“妥协”不仅仅是取中间值(一个安静的游乐场?);而是找到一种解决方案,让两位邻居都感到被倾听,并觉得自己获得了一些好东西,而不仅仅是失去了一些东西。
本文探讨了人工智能(AI)能否充当熟练的调解人,以寻找这些“双赢”解决方案,特别是针对关于公园或街道等公共场所的分歧。
以下是他们研究的故事,分解为简单的步骤:
1. 问题:AI 很聪明,但缺乏“街头智慧”
研究人员发现,虽然 AI(特别是大型语言模型)在数学和写文章方面是天才,但它往往在社会智能方面存在困难。这就像一位从未需要协商家庭晚餐安排的博学教授。当被要求调解争端时,AI 倾向于选边站队、忽视一方的感受,或者给出一个让无人满意的通用答案。
2. 实验:教导 AI“感受”双方
团队希望教导 AI 生成共情中立的妥协方案。这意味着 AI 不应偏向感到安全的人而忽视感到不安全的人,也不应偏向感到受欢迎的人而忽视感到被排斥的人。
他们测试了四种不同的“提示”(询问)AI 来实现这一目标的方法:
- “直接去做”方法:简单地要求 AI 做出妥协。(结果:AI 通常忽略了一方。)
- “逐步思考”方法:要求 AI 先列出双方的建议并寻找共同点。(结果:有所改善,但仍有些偏颇。)
- “自我检查”方法:要求 AI 对自己的工作进行评分。(结果:AI 认为自己做得很好,但人类并不认同。)
- “镜像与反馈”方法(获胜者):这是秘诀所在。
- AI 生成一个妥协方案。
- 一个特殊的“共情计”(一个独立的 AI 工具)测量该妥协方案在多大程度上体现了对A 方的理解,以及在多大程度上体现了对B 方的理解。
- 如果计器显示 AI 过于偏向一方,它就会被送回绘图板,并附注:“你对 A 方的理解过多;尝试更多地理解 B 方。”
- AI 利用此反馈循环再次尝试,直到“共情得分”完全平衡。
类比:想象一位厨师试图做出一道菜,让爱吃辣的人和讨厌吃辣的人都觉得同样美味。
- 自我检查的厨师尝了尝食物,说:“完美!”(但他们有偏见。)
- 镜像与反馈的厨师将这道菜送给两位品尝者。一位说:“太辣了!”另一位说:“太淡了!”厨师调整食谱,送回去,并重复此过程,直到两位品尝者都说:“这就刚刚好。”
3. 人类测试:它真的有效吗?
为了证明这行之有效,他们聘请了 50 位真实的人扮演邻居的角色。他们向这些人展示了争论以及 AI 建议的妥协方案。
- 结果:人们压倒性地更喜欢由**“镜像与反馈”**方法生成的妥协方案。他们觉得这些解决方案比其他方法生成的方案更公平、更易于接受。
4. 重大飞跃:教导更小的 AI 模型
“镜像与反馈”方法效果很好,但它既慢又昂贵,因为它需要每次都由一个巨大、强大的 AI(如 Claude 3 Opus)来进行评分。研究人员想知道:我们能否教导一个更小、更便宜、开源的 AI 独自完成这项工作,而无需每次都由大 AI 来评分?
他们使用了一种称为**对齐(Alignment)**的技术。
- 类比:与其向学生(小 AI)展示一本教科书并说“背诵这个”,不如向学生展示一个“好答案”和一个“坏答案”,然后问:“哪一个更好?”
- 通过训练小 AI 区分好的、平衡的妥协方案与坏的、不平衡的妥协方案,小 AI 学会了什么是公平妥协的感觉。
- 结果:小 AI(如 Llama 或 Mistral)学会了生成高质量的、中立的妥协方案,其效果几乎与昂贵的大 AI 一样好,但无需每次都在后台运行昂贵的“共情计”。
研究发现总结
- AI 需要帮助才能保持中立:仅仅要求 AI 妥协是不够的;它需要一个系统来检查它是否对双方都公平。
- 反馈循环有效:使用外部工具来测量“共情平衡”并将该结果反馈给 AI,比仅仅要求它更努力地思考能产生更好的结果。
- 小模型可以学习:一旦小 AI 在这些“好与坏”的示例上接受了训练,它就能独自生成公平的妥协方案,从而使这项技术更快、更易获得。
本文并未声称:
- 它并未声称这种 AI 应该取代真实法庭或治疗会话中的人类调解员。
- 它并未声称这适用于所有类型的争论(如政治或伦理辩论);该研究严格局限于关于场所(公共场所的安全性和欢迎程度)的分歧。
- 它并未声称 AI 是“有意识的”或真正感受到共情;它只是在数学上模拟共情的平衡。
以下是 Bhattacharyya 等人论文《生成基于地点的两种观点之间的妥协》的详细技术总结。
1. 问题陈述
大型语言模型(LLMs)在学术推理方面表现出色,但在社会智能方面存在不足,特别是在生成对立观点之间具有共情中立性的妥协方面。虽然 LLMs 能够生成共识声明或共情回应,但它们往往无法充当中立调解人,提出双方均可接受的解决方案而不偏袒任何一方。
- 差距:现有方法通常侧重于广泛的共识或简单的共情,但生成妥协需要提出一种双方都比没有妥协时更好的解决方案,这要求对冲突立场保持共情平衡。
- 挑战:LLMs 倾向于锚定在某一种观点上,或者无法平衡对立论点的情感权重,从而导致有偏见或不可接受的后果。
2. 方法论
作者提出了一个两阶段框架:(1) 提示工程,利用大型专有模型生成高质量合成数据;(2) 模型对齐,将这些能力蒸馏到较小的开源模型中,且在推理过程中无需外部反馈。
A. 数据集:ContrastingViews
本研究利用了 EmpathyFromPerspectives 数据集(Chen 等人,2025)的一个子集,包含 2,400 对关于公共空间(如公园、小径)的对比观点。
- 观点 A:积极视角(感到安全/受欢迎)。
- 观点 B:消极视角(感到不安全/被排斥)。
- 每个观点包含地点描述、推理以及建议的改进措施。
B. 第一阶段:提示工程与数据生成
作者使用 Claude 3 Opus 评估了四种提示策略以生成妥协方案:
- 单一提示:生成妥协的基本指令。
- 思维链(CoT):明确要求模型在生成前先识别相似之处。
- CoT + LLM 自我评估:模型生成妥协方案,然后自我评估其共情相似度。
- CoT + 反馈(迭代):最有效的方法。它使用基于 e5-large 嵌入模型的共情相似度模型作为外部工具,对生成的妥协方案相对于观点 A 和观点 B 进行评分。
- 机制:系统计算相似度分数之间的绝对差值(∣scoreA−scoreB∣)。如果差值较大,则提示模型优化回应以缩小这一差距,迭代进行直到妥协方案达到共情中立。
C. 第二阶段:人类评估
一项涉及 50 名参与者的研究评估了不同策略生成的妥协方案的可接受性。
- 方法:参与者被分配特定的观点(积极或消极),并要求从该视角出发对妥协方案的可接受性进行评分。
- 指标:可接受性评分(1-100)和偏好排名(首选/次选)。
D. 第三阶段:小型模型的对齐
为了使系统高效并消除推理过程中对专有模型和外部相似度评分的需求,作者训练了较小的开源模型(Llama-3.1 8B 和 Mistral-7B)。
- 方法:他们使用了基于**噪声对比估计(NCE)**的对齐方法,而非标准的微调(模仿)。
- 原理:受人类通过区分顺从和违规行为来学习社会规范的启发,该模型被训练以区分“好”的(经人类验证的)妥协方案和“坏”的(基模型)输出。
- 损失函数:NCE 损失最大化目标(好)妥协方案的可能性,同时最小化基模型输出的可能性。这既保留了模型广泛的常识知识(避免灾难性遗忘),又内化了中立偏好。
- 替代方案:他们还探索了基于任务损失的对齐,结合 ROUGE 分数以确保与目标妥协方案的语义保真度。
3. 主要贡献
- 共情中立框架:引入了一种新颖的方法,通过最小化对立观点之间的共情差距,生成不仅在逻辑上而且在情感上平衡的妥协方案。
- 迭代提示工程:证明了CoT + 外部反馈(使用共情相似度模型)在生成中立妥协方面显著优于标准的 CoT 和自我评估方法。
- 基于 NCE 的对齐:提出了一种方法,使较小的 LLMs 能够生成共情中立的妥协方案,而无需在推理时使用外部奖励模型或相似度估计器。该方法优于标准微调,并避免了在此情境下与直接偏好优化(DPO)相关的灾难性遗忘问题。
- 合成数据集创建:生成了包含 2,400 多个基于地点的妥协方案的高质量数据集,并经人类偏好验证,用于训练和评估 LLMs 的社会智能。
4. 结果
人类评估(提示工程)
- 偏好:CoT+Feedback 方法无疑是赢家。
- 首选:CoT+Feedback 1(37%)和 CoT+Feedback 2(40%)。
- 对比:显著优于 CoT(18%)和单一提示(5%)。
- 统计显著性:CoT+Feedback 相对于单一提示的偏好具有统计显著性(p≤0.002)。
- 可接受性:带有共情中立反馈生成的妥协方案被积极和消极观点持有者均评为高度可接受。
模型对齐(小型模型)
- 生成质量:对齐后的模型(Llama+NCE 和 Mistral+NCE)取得了最高的 ROUGE 分数(例如,Llama NCE:0.315 ROUGE-1,对比基模型:0.164),表明与人类验证的妥协方案有更好的语义对齐。
- 共情中立性:对齐后的模型产生的妥协方案具有显著更小的“中立差距”(∣scoreA−scoreB∣),接近迭代提示工程输出的性能。
- 知识保留:与在初始实验中导致灾难性遗忘的 DPO 不同,NCE 和任务损失方法保留了模型的预训练知识(通过 WikiText 对数似然测试验证)。
5. 意义与未来工作
- 实际应用:这项工作为部署社会智能 AI 提供了一条可扩展的管道,适用于冲突解决、协作决策和调解场景,其中公正性至关重要。
- 效率:通过 NCE 对齐将大型专有模型的能力蒸馏到较小的开源模型中,该系统变得可部署,且无需迭代外部反馈循环的计算成本。
- 局限性与未来方向:
- 当前数据集仅限于基于地点的冲突(安全/欢迎程度)。未来的工作旨在扩展到抽象领域,如政策辩论和伦理困境。
- 研究承认训练数据中可能存在偏见,并需要在未来的迭代中解决权力不对称问题。
- 作者计划探索多轮对话,以模拟持续的谈判,而非单次妥协。
总之,该论文确立了外部共情反馈对于训练 LLMs 生成中立妥协方案至关重要,而基于 NCE 的对齐是一种有效且高效的方法,可将这些社会智能能力转移到较小的开源模型中。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。