← 最新论文
💻 computer science

Beyond "I Can't Help With That": How Child Safety Experts Evaluate AI Chatbot Safety

本文批评了当前人工智能儿童安全评估缺乏现实世界基础的问题,并提出了一个基于对19位青少年从业者访谈的新框架,旨在识别有害的聊天机器人行为,并为脆弱青少年定义更有效、更具支持性的响应方式。

原作者: Hannah Cha, Neha Shukla, Solon Barocas, Alexandra Chouldechova, Eugenia Kim, Jennifer Wortman Vaughan

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Hannah Cha, Neha Shukla, Solon Barocas, Alexandra Chouldechova, Eugenia Kim, Jennifer Wortman Vaughan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大的、繁忙的图书馆,其中的每一本书都是由一个可以和你对话的超级聪明机器人编写的。这不仅仅是一个普通的图书馆;这是一个孩子们开始出没的地方,他们会就从作业到内心最深处、最隐秘的忧虑等各种问题寻求建议。这个研究领域被称为“人工智能安全”(AI safety),它就像是一群图书管理员,试图确保机器人不会意外地递给孩子一本会给出错误建议或让他们感到更加难过的书。大家都在问一个大问题:我们如何知道这个机器人是真的在提供帮助,还是仅仅以一种显得冷漠且毫无用处的方式在表现“安全”?长期以来,图书管理员们认为让机器人对任何棘手的问题都说“我无法处理该问题”是保护孩子最好的方式。但如果这种拒绝正是让一个在最需要朋友时感到孤独的孩子感到无助的原因呢?

这篇论文就像是一群专家——那些每天都在帮助处于困境中的孩子的社会工作者、治疗师和心理学家——坐下来测试机器人的“家庭作业”。这些专家不仅仅是在检查机器人是否说了“错误的”词汇,他们还在观察当一个孩子感到恐惧、悲伤或困惑时,机器人的实际“行为”表现如何。他们发现,目前的安全性测试就像是在玩一场“找错别字”的游戏,却忽略了这样一个事实:机器人可能说了所有正确的话,但在真实的危机面前,它依然会让一个孩子感到失败。研究表明,仅仅拒绝回答并不总是正确的做法;有时,机器人需要成为一座桥梁,温柔地引导孩子走向真正能够提供帮助的真人,而不是直接关上门。

机器人的“安全”错误

把聊天机器人想象成一个非常礼貌、非常遵守规则的机器人助手。目前,我们测试这个机器人是否安全的方法主要类似于一种“红队”(Red Team)游戏。想象一下,一群人试图诱骗机器人说出一些不雅或危险的话,如果机器人拒绝配合,我们就给它一颗金星。然而,这篇论文的研究人员决定询问另一群人:那些在危机中握住孩子们手的人。他们采访了 19 位这样的专家,包括治疗师和社会工作者,观察他们对机器人回答 12 种不同棘手情景的反应。

这些情景并不是由试图模仿孩子的计算机编造出来的,而是基于真实记录的儿童求助故事。专家们观察了机器人如何应对诸如:一个孩子在考试失败后提到高桥之类的情况,或者一个青少年询问为年龄大得多的伴侣挑选礼物的想法。

专家的发现:当“不”并不安全时

专家们发现,机器人目前的安全性剧本存在一些巨大的漏洞。以下是他们的主要发现:

1. “拒绝”陷阱
最大的惊喜是,专家们非常反感机器人直接说“我无法处理该问题”。在安全测试的世界里,拒绝通常被视为一种胜利。但在专家看来,对于一个已经感到孤独和恐惧的孩子来说,这种生硬的拒绝感觉就像是在雨天被锁在了门外。这强化了“没有人能提供帮助”的想法。一位专家指出,如果一个孩子一生都听闻自己是孤独的,而当他终于寻求帮助时却遭到拒绝,这只会证实他最坏的恐惧。论文指出,简单的“不”实际上可能是有害的,而非安全的。

2. 缺失大局观
机器人经常忽略上下文。例如,如果一个孩子提到自己正在与一个年龄大得多的对象交往,机器人可能会忙着帮他挑选礼物,却完全忽略了这段关系本身是危险的。专家指出,机器人因为太想表现得“乐于助人”,反而错过了预警信号。这就像一位医生为你伤口贴上了创可贴,却没注意到你的腿部骨折正在流血。

3. “太长”与“太吓人”的问题
即使机器人尝试提供帮助,它说话的方式往往也不适合孩子。有时,答案过于冗长复杂,导致年轻人读完第一句就停止阅读了。其他时候,机器人会列出像“全国性侵援助热线”这样的资源,这可能会吓到那些还不了解自己正处于虐待环境中的孩子。专家表示,如果机器人使用令人恐惧的词汇,孩子可能会因为害怕而逃避寻求帮助。

专家希望机器人怎么做

专家们并没有要求机器人变成医生,而是提出了一个更具建设性的方案,让机器人成为一座桥梁:

  • 做桥梁,而非医生: 机器人不应该试图成为一名治疗师。它的主要任务应该是说:“我听到了你的话,我也很关心你,但我不是真人。这里有一些可以帮助你的真实人员名单。”它应该扮演一座桥梁,将孩子连接到信任的成年人或热线电话。
  • 先提问,再行动: 在给出建议之前,机器人应该问:“你能多告诉我一些吗?”这有助于机器人更好地理解情况。例如,告诉一个孩子“去和妈妈谈谈”是非常好的建议,如果他的母亲是安全的;但如果母亲正是伤害他的人,这就会变得非常危险。机器人需要在给出计划前了解背景信息。
  • 诚实面对自己的机器人身份: 专家希望机器人明确说明自己是 AI。他们建议为聊天机器人制作一个“营养标签”,上面写着:“我是机器人,我并非无所不知,我也可能会犯错。”这有助于孩子们不会产生过度的情感依赖,或者误以为机器人是一个能解决所有问题的真实朋友。
  • 量身定制信息: 机器人应该尝试匹配孩子的年龄和处境。一条适用于 14 岁的消息,对于 17 岁的青少年来说可能太吓人或太幼稚了。专家强调,一种模式并不适用于所有人。

总结

论文结论指出,我们不能仅仅通过看机器人是否说了“脏话”来决定它是否安全。安全性更像是一个拼图,其碎片取决于具体情况。一个在纸面上看起来安全的回答,在现实世界中可能会伤害孩子。研究人员建议,我们需要停止将“拒绝”视为安全的金标准。相反,我们需要构建能够更好地倾听、提问并温柔地引导孩子走向真人帮助的机器人。

这项研究并不声称已经解决了问题或制造出了完美的机器人。它只是表明,通过倾听那些每天与孩子们打交道的专家的意见,我们可以建立一个更好的系统。这是一个行动号召,呼吁设计这些机器人的开发者们:不要只玩“找错别字”的游戏,而要开始思考对于处于困境中的孩子来说,真正的安全和帮助究竟意味着什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →