← 最新论文
💬 NLP

It Matters How You Say It: Exploring Rhetorical Patterns for AI-Assisted Information Evaluation

本文研究了人工智能辅助的事实核查中,八种不同的修辞模式如何影响用户的表现与反思,发现虽然“支架式解释”带来的准确率提升最高,但尽管其他沉思型风格伴随着时间成本,用户通常更倾向于“替代性框架”。

原作者: Sadra Sabouri, Zeinabsadat Saghi, Jordan Lee Boyd-Graber, Jonathan May, Jonathan K. Kummerfeld, Souti Chattopadhyay

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Sadra Sabouri, Zeinabsadat Saghi, Jordan Lee Boyd-Graber, Jonathan May, Jonathan K. Kummerfeld, Souti Chattopadhyay

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:表达方式至关重要:探索用于 AI 辅助信息评估的修辞模式

问题陈述
虚假信息的激增要求普通用户具备强大的实时信息评估能力。虽然大语言模型(LLMs)越来越多地被用于支持说法验证,但目前的 AI 咨询系统主要依赖于“指令式修辞”(directive rhetoric),即提供自信的结论,而用户往往被动接受这些结论。当事实真相需要模型训练数据之外的细微且及时的技术分析时,这种方法往往会失效,导致模型给出自信但部分错误或具有误导性的确认。先前的研究主要关注 AI 系统沟通了“什么”(例如:解释类型、警告标签),但很大程度上忽略了它们“如何”进行沟通。具体而言,构建 AI 响应的修辞模式及其诱发用户反思、不确定性或独立推理的能力,仍未得到充分研究。

研究方法
作者进行了一项针对 n=98n=98 名参与者的受试者内研究,旨在调查八种不同的修辞模式对事实验证表现的影响。

  • 任务: 参与者在一小时内评估了 40 个关于真实性的说法。对于每个说法,参与者首先提供初始评分和置信度,然后可以选择请求一种修辞模式的建议,之后再提交最终评估。
  • 模式: 研究将七种源自语言学和心理学的修辞模式与“先知”(Oracle)基准(直接、自信地传递金标准证据)进行了对比:
    1. 先知 (Oracle): 直接、自信地传递关键信息。
    2. 脚手架式解释 (Scaffold Explanation): 将证据与结论连接起来的逐步逻辑演绎。
    3. 苏格拉底式提问 (Socratic Questioning): 针对缺失证据或假设进行追问。
    4. 替代性框架 (Alternative Framing): 通过看似合理但偏离主题的语境(红鲱鱼)转移注意力。
    5. 解释性替代 (Interpretive Alternative): 通过提供竞争性推论来挑战假设。
    6. 信息扭曲 (Information Distortion): 遗漏关键信息以暴露推理漏洞。
    7. 触发怀疑 (Triggering Distrust): 引入刻意的荒谬内容以促使批判性审视。
    8. 蓄意误导 (Intentional Misleading): 利用看似合理的错误框架使用户产生困惑。
  • 分析: 研究测量了准确性、置信度校准、任务耗时、答案修改率以及用户偏好。数据使用广义估计方程(GEE)进行分析,以处理受试者内的相关性。

核心贡献

  1. 修辞分类法: 本文定义并操作化了八种用于 AI 咨询响应的修辞模式,这些模式植根于语言学和心理学理论,并专门针对事实验证场景进行了定制。
  2. 经验证据: 研究提供了初步的经验证据,将特定的修辞风格与用户准确性、置信度校准和反思深度联系起来。
  3. 准确性与偏好的背离: 研究发现用户表现与用户满意度之间存在系统性的背离,挑战了“用户偏好是衡量系统有效性的可靠指标”这一假设。
  4. 设计启示: 作者得出了对对话式 AI 的设计启示,主张在高风险信息环境中采用自适应修辞设计,而非一成不变的指令式方法。

结果

  • 准确性: 与“对抗性模式表现较差”的假设相反,脚手架式解释先知 基准产生了最高的准确性增益。令人惊讶的是,对抗性条件(蓄意误导、触发怀疑、信息扭曲)也略微提高了准确性,这表明检测不可靠建议可能会触发“动机性审视”,这种审视会延伸到对说法本身的判断。苏格拉底式提问解释性替代并未带来显著的准确性提升。
  • 反思与时间: 脚手架式解释是唯一与促进深度反思相关的模式。虽然苏格拉式提问解释性替代增加了任务耗时(作为认知努力的代理指标),但这种额外的时间并未转化为相应的准确性提升,表明存在时间投入与决策质量之间的脱节。
  • 用户偏好: 参与者最喜欢替代性框架,理由是其简洁易用。相反,解释性替代蓄意误导由于感知到的时间成本和困惑感,最不受欢迎。值得注意的是,先知(准确性最高)在偏好排名中仅处于中等水平,而最受欢迎的模式(替代性框架)并未显示出显著的准确性增益。
  • 置信度: 在收到建议后,无论准确性是否提高,所有模式下的置信度都增加了,这凸显了在没有判断力提升的情况下发生置信度膨胀的风险。

意义与主张
本文认为,AI 沟通的修辞风格与信息内容同样重要。研究结果挑战了主流的设计假设,即直接、自信的响应在普遍情况下是最优的。相反,作者建议,“刻意摩擦”(例如通过脚手架或对抗性线索)可以作为诱发批判性思维并提高事实验证准确性的生产性资源。

然而,作者对其主张保持了谨慎的态度:

  • 他们将该研究定性为“探索性设计探测”,因为每个模式构建的说法数量较少。
  • 他们承认,在对抗性条件下观察到的准确性提升可能是由响应偏差(对虚假说法的怀疑态度)驱动的,而非由修辞机制本身驱动,因为研究并未进行操纵检查。
  • 他们警告称,在未经用户明确同意的情况下,不要在生产系统中部署对抗性模式(误导/扭曲),并引用了关于操纵和信任的伦理担忧。
  • 本文结论指出,不存在单一的最优修辞风格;相反,系统可能需要根据用户行为和任务背景动态调整其风格,以平衡用户满意度(易用性)与系统有效性(准确性/反思)之间的权衡。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →