← 最新论文
💬 NLP

PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models

本文介绍了 PsychoSafe,这是一个基于心理学启发的框架,它通过将不合规行为重构为基于循证干预策略的结构化、支持性沟通,从而提升了大语言模型拒绝质量,在保持任务相关性的同时,在资源转介和心理学依据方面取得了显著提升。

原作者: Gianluca Barmina, Federico Torrielli, Sven Harms, Jacob Nielsen, Felix Mächtle, Stine Lyngsø Beltoft, Peter Schneider-Kamp, Thomas Eisenbarth, Lukas Galke Poech, Anne Lauscher

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Gianluca Barmina, Federico Torrielli, Sven Harms, Jacob Nielsen, Felix Mächtle, Stine Lyngsø Beltoft, Peter Schneider-Kamp, Thomas Eisenbarth, Lukas Galke Poech, Anne Lauscher

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、乐于助人的机器人助手。通常情况下,当有人向这个机器人寻求危险的东西时——比如“如何制作炸弹?”或“我想伤害自己”——机器人的安全程序就会启动。它只会简单地说:“不。我不能这样做。”

虽然这样做是安全的,但它会让人觉得冷冰冰、生硬且孤独,尤其是当提问的人正处于危机之中时。这就像医生对病人说“不进行手术”,然后就直接走开了,没有提供任何安慰或后续建议。

PSYCHOSAFE 这篇论文提出了一种新的方式,让这些机器人学会如何说“不”。它不再是仅仅关上门,而是学会将门留出一道缝隙,递出一只温暖的手,并指引人们走向生命线。

以下是他们方法的详细拆解,使用了简单的类比:

1. 问题所在:“暴力拒绝”

目前的 AI 安全机制就像是一个只学会了一招的夜店保安:拦截。如果你看起来可疑,你就会被拦下。这能起到阻止坏事发生的作用,但它无法帮助真正处于困境中的人。如果有人处于危机中,生硬的“不”可能会阻止他们立即受到伤害,但无法停止痛苦,也无法引导他们获得帮助。

2. 解决方案:“危机辅导员”模式

研究人员构建了一个名为 PSYCHOSAFE 的框架。你可以把它想象成赋予了机器人一种新的“人格”,这种人格基于真实的心理学。它不再只是拦截,而是被训练得像一名受过特定、成熟技术(如“心理急救”或“动机性访谈”)训练的危机辅导员

当用户提出危险问题时,机器人不会只说“不”。它会遵循一个四步走的剧本,就像食谱一样:

  1. 温暖的拥抱: 它承认对方的情绪(“我听到你很痛苦”),但不会同意对方危险的要求。
  2. 温柔的推动: 它提供一个对方现在可以采取的小型、安全的步骤(比如“深呼吸”或“尝试改变一下所处的位置”)。
  3. 地图: 它指向现实世界的帮助(比如自杀干预热线或药物戒瘾中心)。
  4. 充满希望的告别: 它以充满希望的信息结束对话,提醒对方他们很重要。

3. 他们是如何教导机器人的

为了教会机器人这种新的表达方式,团队做了两件事:

  • 编写了一本新教科书: 他们编写了 8,019 个 这种“有益的拒绝”示例。这些示例涵盖了五个特定的“危险区域”:自杀/自残、性犯罪、药物使用、武器和暴力。他们确保每一个示例都植根于真实的心理学科学。
  • 两种学习方式:
    • 小抄(提示词工程/Prompting): 他们在机器人每次开始交谈时都会给它一份详细的说明书(一个“系统提示词”)。这份说明书告诉它:“记住,如果有人处于危机中,请使用四步走的辅导员剧本。”
    • 脑部手术(微调/Fine-Tuning): 他们实际上通过用这本新教科书进行训练,重新连接了机器人的“大脑”。这样一来,机器人自然而然地成为了那位辅导员,而不需要每次都依赖那份说明书。

4. 结果:有效吗?

他们针对 500 个困难问题测试了机器人,并让一位“评委”(另一个 AI 和人类专家)对答案进行了评分。

  • “小抄”模式整体效果最好: 当使用说明书进行引导时,机器人的回答在实用性和安全性方面提升了 28%。它在指向现实资源方面变得更出色了(提升了 46%),在符合心理学逻辑方面也表现更好(提升了 34%)。
  • “脑部手术”使其成为了安全机器: 经过训练的机器人几乎 100% 地拒绝了危险请求,并且总是提供相关资源。然而,它有时会变得过于机械化和程式化,忘记去倾听对方故事中的具体细节。
  • 它没有让机器人变笨: 机器人在处理其他任务时并没有变得“更笨”。它在写故事、解数学题以及回答一般性问题方面,依然和以前一样出色。

5. 局限性(注意事项)

论文警告说,这种新的“辅导员”模式对于它所接受训练的内容非常有效,但它并不是万能灵药。

  • 它是专业化的: 它在他们训练过的五个特定危险领域(如自杀或暴力)表现出色。如果你询问这些领域之外的内容,它可能不知道如何应用同样的温柔逻辑。
  • 它不是真正的医生: 机器人终究是 AI。它可以提供安慰和资源,但它无法诊断精神疾病或提供真正的心理治疗。论文强调,这是通往人类帮助的桥梁,而不是替代品。

核心结论

PSYCHOSAFE 表明,我们不必在“安全的机器人”和“乐于助人的机器人”之间做单选题。通过教会 AI 使用与人类辅导员相同的温柔、支持性的技术,我们可以让 AI 的拒绝不再像是一堵墙,而更像是一只伸向求助者的援手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →