← 最新论文
💻 computer science

Generating Place-Based Compromises Between Two Points of View

本文提出一种方法,通过利用外部共情相似性作为迭代反馈来超越标准推理,从而在共享场所的相互对立观点之间生成共情中立的妥协方案,随后利用由此产生的数据集,通过人类偏好对齐来训练高效的小型模型。

原作者: Sumanta Bhattacharyya, Francine Chen, Scott Carter, Yan-Ying Chen, Tatiana Lau, Nayeli Suseth Bravo, Monica P. Van, Kate Sieck, Charlene C. Wu

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Sumanta Bhattacharyya, Francine Chen, Scott Carter, Yan-Ying Chen, Tatiana Lau, Nayeli Suseth Bravo, Monica P. Van, Kate Sieck, Charlene C. Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象两位邻居因如何共用他们的后院而争执。一位想要一个安静的花园用于阅读,另一位则想为他们的孩子建一个喧闹的游乐场。“妥协”不仅仅是取中间值(一个安静的游乐场?);而是找到一种解决方案,让两位邻居都感到被倾听,并觉得自己获得了一些好东西,而不仅仅是失去了一些东西。

本文探讨了人工智能(AI)能否充当熟练的调解人,以寻找这些“双赢”解决方案,特别是针对关于公园或街道等公共场所的分歧。

以下是他们研究的故事,分解为简单的步骤:

1. 问题:AI 很聪明,但缺乏“街头智慧”

研究人员发现,虽然 AI(特别是大型语言模型)在数学和写文章方面是天才,但它往往在社会智能方面存在困难。这就像一位从未需要协商家庭晚餐安排的博学教授。当被要求调解争端时,AI 倾向于选边站队、忽视一方的感受,或者给出一个让无人满意的通用答案。

2. 实验:教导 AI“感受”双方

团队希望教导 AI 生成共情中立的妥协方案。这意味着 AI 不应偏向感到安全的人而忽视感到不安全的人,也不应偏向感到受欢迎的人而忽视感到被排斥的人。

他们测试了四种不同的“提示”(询问)AI 来实现这一目标的方法:

  • “直接去做”方法:简单地要求 AI 做出妥协。(结果:AI 通常忽略了一方。)
  • “逐步思考”方法:要求 AI 先列出双方的建议并寻找共同点。(结果:有所改善,但仍有些偏颇。)
  • “自我检查”方法:要求 AI 对自己的工作进行评分。(结果:AI 认为自己做得很好,但人类并不认同。)
  • “镜像与反馈”方法(获胜者):这是秘诀所在。
    • AI 生成一个妥协方案。
    • 一个特殊的“共情计”(一个独立的 AI 工具)测量该妥协方案在多大程度上体现了对A 方的理解,以及在多大程度上体现了对B 方的理解。
    • 如果计器显示 AI 过于偏向一方,它就会被送回绘图板,并附注:“你对 A 方的理解过多;尝试更多地理解 B 方。”
    • AI 利用此反馈循环再次尝试,直到“共情得分”完全平衡。

类比:想象一位厨师试图做出一道菜,让爱吃辣的人和讨厌吃辣的人都觉得同样美味。

  • 自我检查的厨师尝了尝食物,说:“完美!”(但他们有偏见。)
  • 镜像与反馈的厨师将这道菜送给两位品尝者。一位说:“太辣了!”另一位说:“太淡了!”厨师调整食谱,送回去,并重复此过程,直到两位品尝者都说:“这就刚刚好。”

3. 人类测试:它真的有效吗?

为了证明这行之有效,他们聘请了 50 位真实的人扮演邻居的角色。他们向这些人展示了争论以及 AI 建议的妥协方案。

  • 结果:人们压倒性地更喜欢由**“镜像与反馈”**方法生成的妥协方案。他们觉得这些解决方案比其他方法生成的方案更公平、更易于接受。

4. 重大飞跃:教导更小的 AI 模型

“镜像与反馈”方法效果很好,但它既慢又昂贵,因为它需要每次都由一个巨大、强大的 AI(如 Claude 3 Opus)来进行评分。研究人员想知道:我们能否教导一个更小、更便宜、开源的 AI 独自完成这项工作,而无需每次都由大 AI 来评分?

他们使用了一种称为**对齐(Alignment)**的技术。

  • 类比:与其向学生(小 AI)展示一本教科书并说“背诵这个”,不如向学生展示一个“好答案”和一个“坏答案”,然后问:“哪一个更好?”
  • 通过训练小 AI 区分好的、平衡的妥协方案与坏的、不平衡的妥协方案,小 AI 学会了什么是公平妥协的感觉
  • 结果:小 AI(如 Llama 或 Mistral)学会了生成高质量的、中立的妥协方案,其效果几乎与昂贵的大 AI 一样好,但无需每次都在后台运行昂贵的“共情计”。

研究发现总结

  1. AI 需要帮助才能保持中立:仅仅要求 AI 妥协是不够的;它需要一个系统来检查它是否对双方都公平。
  2. 反馈循环有效:使用外部工具来测量“共情平衡”并将该结果反馈给 AI,比仅仅要求它更努力地思考能产生更好的结果。
  3. 小模型可以学习:一旦小 AI 在这些“好与坏”的示例上接受了训练,它就能独自生成公平的妥协方案,从而使这项技术更快、更易获得。

本文并未声称:

  • 它并未声称这种 AI 应该取代真实法庭或治疗会话中的人类调解员。
  • 它并未声称这适用于所有类型的争论(如政治或伦理辩论);该研究严格局限于关于场所(公共场所的安全性和欢迎程度)的分歧。
  • 它并未声称 AI 是“有意识的”或真正感受到共情;它只是在数学上模拟共情的平衡

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →