← 最新论文
💬 NLP

Measuring and mitigating overreliance to build human-compatible AI

本文主张,衡量和减轻对大型语言模型的过度依赖对于防止高风险错误和认知技能退化至关重要,并提出一个框架以整合风险、解决测量差距并实施确保人工智能增强而非削弱人类能力的策略。

原作者: Lujain Ibrahim, Katherine M. Collins, Sunnie S. Y. Kim, Anka Reuel, Max Lamparth, Kevin Feng, Lama Ahmad, Prajna Soni, Alia El Kattan, Merlin Stein, Siddharth Swaroop, Vishakh Padmakumar, Ilia Sucholu
发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Lujain Ibrahim, Katherine M. Collins, Sunnie S. Y. Kim, Anka Reuel, Max Lamparth, Kevin Feng, Lama Ahmad, Prajna Soni, Alia El Kattan, Merlin Stein, Siddharth Swaroop, Vishakh Padmakumar, Ilia Sucholutsky, Andrew Strait, Diyi Yang, Q. Vera Liao, Umang Bhatt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位全新、才华横溢的助手,它能像人类一样交谈、写作和推理。这位助手如此流畅且自信,以至于你开始将一切托付给它:你的健康建议、法律文件、创意写作,甚至情感支持。

本文探讨的是一种特定的危险,称为“过度依赖”。这不仅仅是过于信任你的助手,而是信任他们超出了其实际能力。这就像聘请了一位才华横溢的厨师,他擅长煮意大利面,却极不擅长烘焙,然后你竟让他负责烘焙你的婚礼蛋糕,却连食谱都不检查。

以下是本文的故事,分解为几个简单的部分:

1. 问题:“好得令人难以置信”的陷阱

大型语言模型(LLMs)与旧式计算机程序不同。它们不仅仅给你“是”或“否”的回答;它们更像是思维伙伴。它们与你聊天,提出后续问题,并显得极具同理心。

  • 陷阱:因为它们听起来如此人性化且自信,我们常常忘记它们也会犯错。它们可能会“幻觉”(编造内容),但说得如此笃定,以至于你信以为真。
  • 结果:我们停止核查它们的工作。我们让它们做出本应由我们自己做出的决定。本文将这种现象称为过度依赖:接受错误的答案,或交出自己本不应放弃的决策权。

2. 为何这很危险(风险)

本文警告说,这不仅仅是数学测验中答错一道题的问题。它发生在两个层面:

  • 对你(个人)而言
    • 直接危险:你可能会得到糟糕的医疗建议,或者律师因为过早信任 AI 而提交了包含虚假案例引用的法庭辩护状。
    • 长期危险(“肌肉萎缩”效应):如果你让 AI 替你思考一切,你自己的大脑肌肉就会变弱。你可能会失去解决问题的能力、创造性写作的能力,甚至调节自身情绪的能力。这就像总是用计算器做简单的数学题;久而久之,你会忘记如何自己计算。
  • 对社会而言(“回音室”效应)
    • 如果每个人都使用同一个 AI 来撰写新闻、制定法律或提供建议,我们所有人的思维方式就会趋于一致。本文称之为算法单一文化。这就像一座只生长一种花朵的花园;它变得脆弱且乏味,而我们失去了人类思想的多样性。

3. 为何旧规则行不通

科学家们长期以来一直在研究人们如何信任机器人。但大型语言模型很棘手。

  • 旧方式:你问机器人一个问题,它给出一个答案,然后你说“是”或“否”。这很容易衡量。
  • 新方式:你们进行长时间的对话。AI 提出一个想法,你加以修改,它再提出另一个,你基于此写出一段文字。
  • 问题:很难确切地说出 AI 在何处影响了你。你写出那句话是因为你自己想到的,还是因为 AI 暗示了它?旧的测量尺无法适应这种新的、混乱的、对话式的形态。

4. 如何改进测量(新标尺)

本文指出,我们需要新的方法来衡量我们是否依赖过度。

  • 不要只看最终答案:要审视整个对话。用户在 AI 发言后是否改变了主意?最终文本中有多少内容来自 AI?
  • 关注结果,而不仅仅是文本:用户是否真正实现了目标?如果他们寻求建议却感觉更糟,或者获得了错误信息,这就是过度依赖的迹象,即使 AI 听起来很友善。
  • 检查“验证”行为:用户是否在双重核查 AI 的内容,还是仅仅全盘接受?

5. 如何阻止它(安全网)

本文提出了三层防御机制来保护我们:

  • 修复 AI(模型层面):让 AI 听起来不那么像无所不知的人。它应该说“我不完全确定”或“这只是一个猜测”。如果它只是一个工具,它就不应假装是人类朋友。
  • 修复界面(系统层面):增加“摩擦”。想象一下路上的减速带。当你准备基于 AI 做出重大决定时,屏幕可以暂停并询问:“你确定已经核查过了吗?”或显示警告。这足以让你慢下来思考。
  • 教育用户(用户层面):教导人们这些工具如何运作。如果你知道 AI 是“创意写手”而不是“事实核查员”,你就不会让它负责你的医疗诊断。我们需要了解它的局限性。

核心要点

本文得出结论,我们不能等到灾难发生才采取行动。由于大型语言模型如此新颖且强大,我们需要立即建立测量工具安全系统

目标不是停止使用这些令人惊叹的工具。而是要确保它们帮助我们更好地思考,而不是取代我们独立思考的能力。我们希望 AI 成为一辆助我们更快的自行车,而不是一辆在我们睡着时驾驶、而我们却坐在方向盘后昏睡的汽车。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →