← 最新论文
📊 statistics

What is the Causal Effect of a Conversation? Estimands and Inference in AI Mediated Conversations

本文为人工智能介导的对话开发了一个用于因果推断的潜在结果框架,通过区分诸如分配条件、特定消息以及实现的对话特征等各种因果对象,以阐明当对话是内生生成而非仅仅是被动接收时所需的不同估计量和识别假设。

原作者: Adriane Fresh, Aiden Shin

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Adriane Fresh, Aiden Shin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位试图弄清楚是什么让人们改变主意的科学家。在过去,你可能会给他们发一张传单或一段固定的脚本让他们阅读。这很容易研究:每个人得到的都是完全相同的纸张,所以如果他们的想法改变了,你就知道是因为那张纸。

但今天,研究人员越来越多地使用对话作为他们的“处理手段”(treatment)。他们不再是给一张传单,而是让一个人(或一个人工智能)与受试者交谈。问题在于,对话不是一张传单。它是一场舞蹈

这篇论文认为,当你研究对话时,你必须非常小心地去衡量你到底在测量什么。如果你不小心,你可能以为你测量的是“表现得有礼貌”的效果,而实际上你只是在测量“被分配给一个有礼貌的机器人”的效果。

以下是该论文核心思想的拆解,使用了日常生活的类比。

1. “舞池”问题

想象你想研究音乐如何影响人们跳舞。

  • 旧方法(静态处理): 你把所有人放在一个房间里,循环播放“歌曲 A”。每个人都听到完全相同的歌曲。如果他们的舞蹈动作不同,那是由于歌曲的原因。这很简单。
  • 新方法(对话式处理): 你把人们放在一个舞池里,并给他们配上舞伴。你告诉舞伴 A 要“友善”,而舞伴 B 要“刻薄”。

问题的关键在于:舞蹈不仅仅是舞伴所做的,也是双方共同完成的。

  • 如果你把一个“刻薄”的舞伴配给一个害羞、有礼貌的舞者,这位害羞的舞者可能会让他冷静下来。最终的舞蹈会变得非常温柔。
  • 如果你把同一个“刻薄”的舞伴配给一个大声、具有攻击性的舞者,这场舞蹈可能会变成一场争吵。

尽管这两组人都被分配到了相同的“刻薄舞伴”条件下,但实际的体验(即舞蹈)是完全不同的。论文称之为内生性(endogeneity):对话是由这两个人共同创造的。你不能仅仅说“刻薄的舞伴导致了争吵”,因为争吵也取决于对方是谁。

2. 你可能正在测量的五种不同事物

论文指出,研究人员经常混淆五种不同的事物。把它们想象成洋葱的不同层级:

  1. 分配(入场券): 这是你交给参与者的票券。“你获得了一个友好的机器人。”这很容易测量。它告诉你当你将某人分配到某种条件时会发生什么。但这并不能告诉你对话实际的感觉是如何样的。
  2. 开场白(第一步): 这是机器人说的第一句话。“你好,让我们聊聊政治。”这是具体的,但它没有考虑到在迈出第一步之后,对话是如何展开的。
  3. 政策(规则手册): 这是机器人遵循的一套指令。“始终保持礼貌,但如果对方生气了,要保持冷静。”这是一个“机制”(regime)。它是一个衡量特定系统运作方式的好指标,但它仍然是一个由许多不同对话组成的集合。
  4. 信息(具体的步伐): 这是在舞蹈过程中说出的单个句子。“我理解你的观点。”论文认为这是最难研究的东西。为什么?因为如果对方刚刚说了一句好话,这句话的意思,与对方刚刚对你大喊大叫时这句话的意思,是完全不同的。语境改变了含义。
  5. 实现的对话(整场舞蹈): 这是实际发生的、混乱且独特的互动。这是对参与者而言唯一真正重要的东西,但由于没有两场舞蹈是完全一样的,它也是最难进行科学研究的东西。

3. “捆绑礼物”问题

论文使用了一个很好的类比,来说明为什么研究特定特征(如“文明度”或“语气”)很难。

想象你寄给某人一个礼盒。

  • 目标: 你想知道盒子上的红丝带是否让他们感到快乐。
  • 现实: 盒子里还装有一块巧克力、一张便条和一个玩具。
  • 问题: 如果你给某人一个带有红丝带的盒子,他们同时也得到了巧克力。如果你给他们一个带有蓝丝带的盒子,他们得到的是另一种巧克力。

你无法分辨是丝带让他们快乐,还是巧克力让他们快乐。在对话中,“文明度”是丝带,但它总是与“说话长度”、“情绪强度”或“谁在说话”等其他事物捆绑在一起。你无法轻易将它们分离。

4. 那么,我们该如何解决这个问题?

论文并没有说“停止研究对话”。它说的是:“不要假装对话是简单的传单。”

为了获得清晰的答案,研究人员需要改变他们的实验:

  • 使问题与设计相匹配: 如果你想研究一个政策的效果,就随机化该政策。如果你想研究一个特定信息的效果,你必须在对话中间随机化那个特定的信息(就像暂停舞蹈,然后告诉舞伴:“现在说这句话”)。
  • 接受“局部”真相: 有时,你只能测量那些“顺从”了处理条件的受试者的效果。例如,如果你分配了一个“粗鲁”的机器人,但一个有礼貌的人让它冷静了下来,你就无法测量粗鲁对这个人的影响。你只能在那些真正发生了争吵的人身上进行测量。
  • 使用“表征”(Representations): 与其试图比较对话中的每一个单词(这是不可能的,因为它们都是独特的),研究人员应该根据它们的“氛围”(例如“高度敌对”、“中度友好”)对对话进行分组,并在这些组别内比较信息。

核心结论

对话之所以强大,是因为它们是鲜活的。它们会对你做出反应。但正因为它们会对你做出反应,它们在研究中显得非常混乱。

如果你把对话当作一个静态的对象(像传单一样)来对待,你会得到错误的答案。你可能以为你在研究“无礼”的效果,而实际上你是在研究“无礼”混合了“你正在交谈之人的特定性格”的效果。

这篇论文提供了一张地图,帮助研究人员停止混淆入场券(分配)、旅程(实际的对话)以及风景(如语气或长度等特定特征)。它告诉我们,要理解对话如何改变思想,我们必须更精确地界定我们究竟在测量对话的哪一部分

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →