Identifying Harm in Personalized, Generative AI Systems Requires User-Centered Auditing at the Interaction Level
本立场文件认为,传统的静态审计方法无法捕捉个性化生成式人工智能系统所产生的突发性且演进性的危害,因此有必要转向以用户为中心、基于交互层面的方法,并将危害视为一个适应性且多元化的过程。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在与一台能够记住你所说过的每一句话、学习你的偏好,并缓慢地重塑自身人格以完美契合你的机器进行对话。这就是个性化生成式人工智能的承诺——这种技术目前出现在聊天机器人和写作助手中,它们能根据你过去的互动来调整语气、风格和建议。不同于那些仅仅从固定答案列表中进行选择的旧式计算机程序,这些新系统会即时创造全新的响应,并随着与用户关系的加深而改变其行为。虽然这种适应性让交互感觉更加贴切,但也引入了一个隐藏的危险:对一个人来说极具帮助力的特质,对另一个人来说可能显得具有伤害性或疏离感,而且这些伤害往往在数周或数月后的交谈中才会显现,而非在单次测试中。
研究人员长期以来一直试图通过运行模拟实验来发现并修复人工智能中的问题,即通过反复向计算机提出相同的问题,以观察它是否会产生带有偏见或冒犯性的回答。这种方法对于发现静态错误非常有效,就像一张总是把某个特定城市标错的地图。然而,来自微软研究中心和斯坦福大学的 Hannah Cha 的一篇新论文指出,这种方法无法捕捉到个性化系统中正在发生的真实伤害。研究表明,由于这些机器会随着用户而进化,“什么是伤害”的定义会随着时间而改变,并且在即使拥有相同背景的人之间也会存在巨大的差异。研究人员发现,试图通过深化个性化来解决这个问题,实际上可能会让情况变得更糟,这会迫使边缘群体承担额外的负担,去解释他们的痛苦或透露过多的隐私信息,仅仅为了让机器表现得安全。
问题的核心在于我们目前衡量伤害的方式。大多数现有的测试都假设有害输出是一个固定的对象,就像汽车上的一个损坏零件,可以在汽车上路前被识别出来。研究人员认为,在个性化人工智能的世界里,伤害更像是一场出错的对话。对于实验室里的研究人员来说看似无害的响应,对于用户而言,可能因为他们与系统的特定历史关系而显得极具冒犯性。例如,机器最初可能会提供一些看起来很有帮助的食物推荐,但在数月的互动后,用户意识到这些建议是基于对他们文化的刻板印象,从而将一次友好的举动变成了微侵略(microaggression)。这些伤害源于关系的流动,而非单一的错误,这意味着那些孤立观察机器的传统测试完全忽略了危险。
此外,该论文指出,当前的方法通常将人群视为有着统一感受的整体。审计工作经常检查系统是否公平地对待“女性”或“黑人”这一整体区块。但研究人员表明,在任何单一群体内部,人们都有着不同的生活、不同的创伤和不同的界限。一个社区中的人认为具有冒犯性的内容,另一个人可能觉得可以接受,而第三个人可能根本不会注意到。当系统试图学习一个群体的平均行为时,它往往会将这些复杂的差异简化为该群体的单一、简化的版本。这可能导致一种情况:机器学习了社区中最占主导地位的声音的偏好,却忽略了其余的人,从而有效地抹杀了那些处于边缘地位者的独特经历。
研究人员还探讨了一个诱人的解决方案:如果机器只是精准地学习每个个体用户认为什么是伤害呢?虽然这听起来很理想,但论文认为这创造了一种不公平的负担。要教导机器什么是伤害,用户必须不断指出每一个错误,这需要持续的情绪劳动。对于那些经历与机器默认设置有所偏差的人来说,这意味着他们必须承担纠正系统的沉重任务,而那些符合默认设置的人则可以毫无压力地获得流畅体验。此外,为了教导机器,用户可能需要透露有关其身份或过往创伤的敏感细节,从而创造了一个隐私陷阱:他们必须在忍受伤害或交出个人数据之间做出选择。这种动态关系可能会将最脆弱的用户从这项技术面前推开。
论文建议,与其试图完善机器猜测用户需求的能力,不如转变设计这些系统的方式。作者建议构建一种基础设施,允许用户在伤害发生时即时发声,而不只是事后才反应。这将涉及开发一些工具,让用户可以标记一条响应是有问题的并解释原因,而无需系统假设一个人的投诉就是对所有人的最终真理。至关重要的是,这种系统还将允许用户看到其社区中的其他人是如何解读类似情况的,从而帮助他们决定某种共同的解释是否能引起自身的共鸣。其目标是从“机器默默学习、用户被动接收”的模型,转向一种“用户保留如何控制机器进行适应的权利”的伙伴关系。
研究人员承认,这种方法并非简单的修复方案。它需要建立在对往往是不透明的系统建立信任的基础上,并引发了关于如何处理社区内冲突观点的难题。如果一个人说某条评论具有伤害性,而另一个人说没问题,系统必须能够同时容纳这两种真相,而不是强行给出一个统一的答案。论文并不声称已经解决了这些技术挑战,但它强调,目前的静态测试和深度个性化路径是不够的。通过认识到伤害是一个由用户的历史和语境所塑造的、流动的、进化的过程,我们可以开始设计出尊重人类经验复杂性,而非试图将其简单化的人工智能。最终的结论是,在个性化的世界中保护用户,需要让他们在对话中拥有发言权,而不仅仅是寄希望于机器能自己学会正确的教训。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。