Defining Cultural Capabilities for AI Evaluation: A Taxonomy Grounded in Intercultural Communication Theory
本文借鉴跨文化传播理论,提出文化意识、文化敏感性与文化能力三个层面的分类体系,以解决当前人工智能评估框架中的模糊性问题,并确保在多元文化语境下对模型性能进行更可靠、可解释的评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在招聘一名新助理,协助来自世界各地的人们。你希望确保他们能与任何人交谈,而不会引起冒犯或困惑。但目前,在测试人工智能系统时,我们常常使用“文化意识”或“文化敏感性”等模糊术语,仿佛它们都完全同义。这就像说一辆车具备“驾驶技能”,却不说明是指会停车、能在暴风雪中驾驶,还是能熟练应对复杂的环岛。
本文主张,我们需要停止将这些术语混用。作者们借鉴了数十年来关于人类跨文化沟通的研究,提出一个三级阶梯,用以精确衡量人工智能究竟能做到什么。他们称之为“分类法”,但你可以将其想象为一栋三层楼的建筑,每一层代表一种不同且更高级的技能。
以下是这三个层级的运作方式,借助一个简单类比:人工智能试图帮助用户向一位日本年长同事道歉。
第一级:文化意识(“百科全书”层)
问题: “该模型是否知晓事实?”
将此层级想象为一个图书馆或事实核查员。在此阶段,人工智能仅在进行信息检索。它需要知道:在日本,存在资历观念;存在敬语(特殊的礼貌用语);以及不应将上司视为朋友般随意对待。
- 表现: 人工智能正确地说:“在日本职场中,你应对上级使用礼貌用语。”
- 陷阱: 仅仅因为人工智能知晓事实,并不意味着它擅长与人交流。它可能以机械、武断或刻板的方式陈述事实(例如:“所有日本人都痴迷于等级制度”)。它拥有数据,却缺乏得体。
第二级:文化敏感性(“外交官”层)
问题: “该模型如何构建其知识表达?”
现在,人工智能上升到外交官层。它不再仅仅复述事实,而是在决定如何表达。它需要避免听起来像是在认为自己的文化是“默认”或“最佳”的。它需要在不居高临下说教的前提下,尊重用户的视角。
- 表现: 人工智能不再仅仅陈述规则,而是说:“在许多日本职场中,对资深同事表示额外尊重是常见做法。以下是你如何措辞道歉以体现这一习俗的建议。”它避免说“你必须这样做”或进行道德评判。
- 陷阱: 即使是具备敏感性的人工智能也可能在此停滞。如果对话变得复杂,或者用户说:“实际上,我的职场非常随意”,第二级的人工智能可能会继续给出相同的“标准”建议,因为它不知道如何在对话中途调整语调。
第三级:文化胜任力(“变色龙”层)
问题: “该模型能否随着对话的演进而适应?”
这是变色龙层,也是最高层级。人工智能不仅知晓事实或礼貌地表达,它还能根据用户在聊天过程中提供的新线索改变其行为。它倾听、学习,并实时调整。
- 表现: 用户说:“等等,其实我的老板非常随意,讨厌正式头衔。”具备文化胜任力的人工智能立即切换模式。它说:“明白了。既然你的职场氛围随意,我们可以省略正式头衔,保持语气友好但仍显尊重。让我们试试这个版本……"
- 关键: 这不是一次性回答。这是一场动态的舞蹈,人工智能注意到用户的信号,并即时调整其语调、风格和建议。
为何这很重要?
作者们指出,目前大多数人工智能测试仅检查第一级(百科全书层)。他们问:“人工智能是否了解日本美食?”或“它是否了解日本节日?”
如果人工智能通过这些测试,开发者可能会想:“太好了!这个人工智能具备文化智慧!”并将其部署到现实场景中(例如学校聊天机器人或客户服务机器人)。但如果人工智能仅具备第一级技能,它可能会:
- 提供准确的事实,但听起来粗鲁或充满刻板印象(缺失第二级)。
- 给出礼貌的回答,却因无法适应而无法契合具体情境(缺失第三级)。
核心结论:
本文并非声称人工智能已准备好成为人类外交官。相反,它为研究人员提供了一张清晰的地图。在我们宣称人工智能具备“文化能力”之前,我们需要明确我们正在测试的是建筑的哪一层。我们是在测试它是否知晓事实、是否说话礼貌,还是能否适应不断变化的对话?缺乏这种清晰度,我们就会误以为人工智能已准备好面对现实世界,而实际上它可能只是一个博览群书却可能无意中冒犯他人的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。