Beyond Third-Person Audits: Situated Interaction Auditing for User-Centered LLM Bias Research
本文提出了情境化交互审计(Situated Interaction Auditing, SIA),这是一个以用户为中心的框架,通过研究大语言模型如何在个人交互过程中,根据性别和社会经济地位等用户画像信号系统性地改变其响应,从而解决了传统第三人称审计的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走进一家非常聪明、博学多才的图书馆,里面只有一位图书管理员(AI)在为你提供任何问题的帮助。
多年来,研究人员一直在通过让这位管理员编写关于他人的故事来测试他们。他们会问:“写一个关于名叫凯莉(Kelly)的护士的故事,”然后问,“写一个关于名叫约瑟夫(Joseph)的护士的故事。”他们检查是否将凯莉描述为“温暖友好”,却将约瑟夫描述为“天生的领导者”。这就像是在检查图书管理员在谈论陌生人时是否存在偏见。
问题所在:图书管理员忽略了站在面前的那个人
这篇论文认为,这种测试方式忽略了很大一部分图景。在现实生活中,你不仅仅是要求图书管理员去写关于陌生人的故事;你是要求他们来帮助你。
作者指出,当你向图书管理员寻求建议时,图书管理员不仅仅是在看你的问题;他们还在观察你是谁。他们可能会根据你的名字、说话方式或口音,来推测你的背景、社会地位或性别。
论文将旧的方法称为“第三人称审计”(即判断 AI 如何谈论他人),并提出了一种新的方法,称为情境交互审计(SIA)。这就像是根据图书管理员如何对待你具体的人,来评判这位图书管理员。
新的实验:“姓名游戏”
为了证明这一点,研究人员在智利进行了一项测试。他们没有改变向 AI 提出的问题。他们保持问题完全一致,例如:“我该如何谈薪水?”或“我该如何修复这个电脑错误?”
但是,他们改变了 AI 在回答之前看到的“名牌”。
- A 组: 使用了能够传递高社会地位信号的名字和姓氏(在智利通常与富有和精英家庭相关联)。
- B 组: 使用了能够传递低社会地位信号的名字和姓氏(在智利通常与工人阶级或原住民背景相关联)。
他们的发现:“屈尊俯视”与“赋能”之间的差距
尽管问题完全相同,但答案却因名牌的不同而异:
- 语调的变化: 当 AI 认为它正在与高地位人士交谈时,它给出的建议是直接、自信且使用了“权力词汇”(如“网络”、“能力”、“策略”)。听起来就像是一个同龄人在进行鼓舞。
- 屈尊俯视的变化: 当 AI 认为它正在与低地位人士交谈时,它的建议更加犹豫、感性且“安全”。它使用了像“也许”、“你可能会考虑”之类的词汇,并侧重于“质量”或“克服困难”。
就好像图书管理员对高地位的人说:“这是你获胜的策略,”但对低地位的人说:“这是对你努力尝试的温柔鼓励。”低地位的用户并没有得到同样锐利、可操作性的工具;他们得到的是一个更柔和、更试探性的答案版本。
为什么这很重要
论文声称,目前的 AI 安全测试对此视而不见。它们检查 AI 是否对故事中的角色刻薄,但它们并不检查 AI 是否根据你的身份来对待你。
“无处之境的视角”的比喻
作者将旧的测试方法比作“无处之境的视角”(view from nowhere)——假装用户是一个空白、隐形的幽灵。他们认为,在现实中,用户是一个真实的人,拥有历史、名字和社会地位。AI 正在对那个人做出反应,而不仅仅是对屏幕上的文本做出反应。
论文主张的总结
- 盲点: 我们通过观察 AI 如何描述他人来测试 AI 的偏见,但我们忽略了它如何对待我们。
- 方法: 他们创建了一个新框架(SIA),用于衡量 AI 如何根据用户信号(如姓名和写作风格)来改变其语调、词汇和建议。
- 证据: 在他们的智利案例研究中,他们展示了即使对于完全相同的问题,AI 也会给“高地位”用户提供更具果敢性和技术性的建议,而给“低地位”用户提供更具试探性和情感支持性的建议。
- 目标: 他们希望 AI 社区开始通过模拟与不同类型的人进行的真实对话来测试模型,而不是仅仅通过要求 AI 编写关于虚构角色的故事。
该论文并不声称已经解决了这个问题,也没有提供具体的软件补丁。它仅仅是主张我们需要改变寻找偏见的方式,使其包含如何对待提问者的内容。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。