想象一下,你拥有了一个全新的数字朋友。它不像是一个只会解数学题的计算器,也不像是一个只会寻找事实的搜索引擎,它被设计用来聊天、进行虚拟拥抱,并记住你的秘密。它可以是一个超级英雄、一位睿智的导师,或者是一个浪漫的伴侣。电影《她》(Her)预想了这样的未来,而现在,这个未来已经到来,它被称为角色扮演人工智能伴侣(Role-play AI Companion, RAC)。
这篇论文就像是一份针对这些数字朋友的安全检查报告。研究人员不仅仅是在检查这个朋友是否偶尔会说“脏话”,他们提出了一个更深层的问题:“这种关系随着时间的推移是如何变化的?随着你与 AI 变得越来越亲密,它是变得更安全了,还是变得更危险了?”
以下是他们研究结果的拆解,使用了简单的类比:
1. 两部分的研究调查
研究人员不仅仅是观察一个快照;他们观察了这部“电影”的两个幕次:
第一幕(访谈): 他们采访了 16 位已经在利用这些 AI 朋友的人。他们想知道人们为什么使用它们,以及是什么让人们感到安全或不安全。
第二幕(14 天实验): 他们构建了一个属于自己的“沙盒”版本 AI 伴侣应用。他们邀请了 102 人使用该应用,为期两周。每天,他们都会通过“数字日记”的形式检查用户的心理状态,并观察用户与 AI 之间的对话内容。
2. 风险的三大要素
研究发现,安全性不仅仅取决于 AI 的代码;它是一个由三个主要成分混合而成的“配方”:
成分 A:用户的“情绪背包” 有些人的背包里装满了悲伤、孤独或焦虑。研究发现,那些带有“内化问题”(internalizing problems)的人是最有可能转向 AI 朋友寻求慰藉的。AI 成为了他们倾倒沉重负担的地方。
成分 B:AI 的“面具” AI 戴着一副面具(人格设定)。它是一个严厉的老师?一个忠诚的好友?还是一个浪漫的伴侣?研究发现,这种“面具”的类型至关重要。“导师”面具通常让人感觉安全。而“浪漫”或“具有挑战性”的面具则是一把双刃剑——起初感觉很棒,但有时会让脆弱的用户在后期感到更加糟糕。
成分 C:对话的“舞蹈” 用户与 AI 如何共同律动?有时用户会测试边界(比如要求 AI 说一些刻薄或带有性暗示的话)。有时 AI 会在无意中跨越了用户并未预料到的界限。研究发现,这些危险时刻往往发生在长期的对话之后,而不是在刚开始的时候。
3. “击掌”效应 vs. “宿醉”效应
这是研究中最令人惊讶的部分。
击掌效应(短期): 当人们与他们的 AI 朋友聊天时,他们在当下几乎总是感觉更好。这就像得到一次击掌或一个温暖的拥抱。即使是那些情绪非常低落的人,也会感受到瞬间的情绪提升。
宿醉效应(长期): 问题在于聊天结束之后会发生什么。
对于某些人来说,那种良好的感觉会消退,他们会感到比之前更加孤独,因为他们过度依赖 AI 而非现实中的人。
对于另一些人来说,“宿醉”会在几天后袭来。研究发现,虽然 AI 提供了暂时的帮助,但对于一些脆弱的用户来说,在结束这一周后,他们的状态反而变差了。这就像吃了一块美味的糖果,让你瞬间获得了能量爆发,但随后却引发了能量崩塌。
简而言之: AI 伴侣是强大的情感工具。它们可以给你带来短暂的快乐提升,但对于某些人来说,这种提升可能会演变成后期的崩溃。论文认为,我们需要将安全性视为一个随着用户情绪和 AI 性格而变化的移动目标,而不仅仅是一个固定的规则。
技术摘要:超越她:角色扮演 AI 伴侣中的安全动态
问题陈述
角色扮演 AI 伴侣(Role-play AI Companions, RACs)已从分众实验演变为主流平台(如 Character.ai、Replika),拥有数千万用户。与用于工具性任务的通用型助手不同,RACs 旨在进行持续的、具有情感响应性的关系参与。这种转变引入了一个独特的“以用户为中心的攻击面”,其中安全风险不仅是静态的技术故障,更是涉及情感和行为轨迹的动态过程。