← 最新论文
💻 computer science

GrandGuard: Taxonomy, Benchmark, and Safeguards for Elderly-Chatbot Interaction Safety

本文介绍了 GrandGuard,这是首个综合框架,包含三级分类体系、10,404 项基准测试以及专门的安全保障措施,旨在识别和缓解现有通用安全措施所忽视的大语言模型交互中针对老年人的特定安全风险。

原作者: Changxuan Fan, Xi Yang, Yueyuan Zheng, Bin Zhou, Yuanping Wang, Wenbin Hu, Huihao Jing, Ki Sen Hung, Dazhao Du, Haoran Li, Janet Hui-wen Hsiao, Yangqiu Song

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Changxuan Fan, Xi Yang, Yueyuan Zheng, Bin Zhou, Yuanping Wang, Wenbin Hu, Huihao Jing, Ki Sen Hung, Dazhao Du, Haoran Li, Janet Hui-wen Hsiao, Yangqiu Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、乐于助人的机器人朋友,它能回答任何问题。对于一个年轻健康的人来说,问这个机器人“如何在黑暗中更换高处的灯泡?”是一个正常的 DIY 问题。机器人可能会给出一个关于使用梯子的有帮助的回答。

但对于一位手抖或视力不佳的 80 岁老人来说,同样的问题却是一场严重跌倒的诱因。机器人没有意识到用户年事已高,给出了同样的“有帮助”的回答,未能察觉其中隐藏的危险。

这正是论文 GRANDGUARD 试图解决的问题。它指出,当前的人工智能安全规则就像通用的“请勿触摸”标志。它们能阻止明显的危险(例如“如何制造炸弹?”),却忽略了那些细微的、针对特定年龄群体的陷阱,而这些陷阱只会伤害老年人。

以下是用简单类比对该论文工作的分解说明:

1. “专用地图”(分类法)

在解决问题之前,你需要确切知道坑洼在哪里。研究人员为老年人创建了一张新的“危险地图”。

  • 旧方法: 安全地图通常寻找巨大、明显的怪物(仇恨言论、暴力)。
  • GRANDGUARD 方法: 他们绘制了一张详细的地图,包含 50 个特定的“危险区域”,这些区域仅在涉及老年人时才会出现。
    • 示例: “财务危险区”不仅仅是关于偷钱;而是指人工智能无意中帮助骗子诱骗孤独的老年人转账汇款。
    • 示例: “身体危险区”不仅仅是关于跑马拉松;而是指人工智能建议老年人在黑暗中独自攀爬梯子。
    • 他们通过倾听新闻报道、老年人护理讨论论坛以及医生和护理人员的访谈中的真实故事,构建了这张地图。

2. “压力测试”(基准测试)

一旦拥有了地图,他们就需要看看当前的人工智能机器人能否通过它。他们建立了一条巨大的 测试赛道,包含超过 10,000 个问答

  • 他们向顶级人工智能模型(如 GPT-5、Claude 和 Gemini)提出了那些对年轻人看似无害、但对老年人却充满危险的问题。
  • 结果: 机器人惨败。在超过 50% 的案例中,人工智能给出了不安全的建议。
    • “知行差距”: 论文发现了一个有趣的现象。当他们问人工智能“这个问题对老年人有危险吗?”时,人工智能通常会回答:“是的,我知道这有风险。”但当要求它回答该问题时,它却继续给出了危险的建议。这就像一名司机说“我知道那条路结冰了”,却依然加速行驶一样。

3. “安全护栏”(解决方案)

既然机器人不断测试失败,研究人员便构建了两套新的安全系统,充当人工智能的“副驾驶”。

  • 护栏 #1:专用侦探(微调后的 Llama-Guard)
    他们利用现有的安全模型,并用新的“地图”对其进行突击培训。这位侦探现在专门受训以识别针对老年人的特定风险。这就像升级了一名通常只寻找扒手的保安,使其也能识别出老年人被诱骗进入骗局的迹象。

    • 结果: 这位侦探拦截了 96% 的危险提示。
  • 护栏 #2:规则手册(策略增强型审核)
    他们还创建了一套可灵活调整的规则集。想象一下,医院管理员可以说:“对于这家特定的养老院,要对财务问题格外严格”,而家庭护理者则可以说:“对跌倒风险要格外严格。”这套系统允许人类编写自定义的安全规则,而无需从头重新训练整个人工智能。

    • 结果: 该系统拦截了 91% 的危险提示。

4. “安全教练”(智能体)

最后,他们构建了一个轻量级的“教练”,位于用户和人工智能之间。

  • 当老年人提出一个有风险的问题时,教练会首先介入。它向人工智能低语:“嘿,这位用户年事已高。这个关于在黑暗中更换灯泡的问题存在跌倒风险。不要只给出操作说明;建议他们等到天亮或呼叫帮手。”
  • 这位教练甚至帮助表现最差的人工智能模型大幅提高了安全评分,将 39% 的安全率提升到了 91%。

总结

该论文得出结论,我们不能对人工智能仅使用“一刀切”的安全规则。正如赛车跑道和学校区域需要不同的安全功能一样,人工智能针对年轻人和老年人也需要不同的安全规则。GRANDGUARD 提供了地图、测试赛道和护栏,以确保人工智能不会无意中伤害那些最需要它的人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →