Evaluating Human and LLM-Generated Thematic Analysis in HRI for Vulnerable Populations: A Comparative and Ethical Analysis
本文针对涉及脆弱群体的人机交互研究中,人类与大语言模型生成的专题分析进行了比较与伦理分析,评估了两者的符合度,并探讨了大语言模型是否存在误导或边缘化参与者体验的风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人机交互领域,研究人员经常求助于社交机器人,以协助那些在日常生活中面临重大挑战的人群,例如残障人士或患有慢性疾病的儿童。为了理解这些人如何真实地体验这项技术,科学家们依赖一种被称为“主题分析”的方法。这是一个细致的人类过程,研究人员需要阅读数小时的访谈转录文本,寻找人们言语中的模式。这不仅仅是统计词频;它需要深层的共情能力、文化意识,以及理解说话者微妙生活现实的能力。几十年来,这项工作一直被视为一种本质上属于人类的技艺,它要求研究者对数据进行反思性的参与,以确保弱势参与者的声音能够得到准确且尊重地呈现。
最近,一种新工具进入了实验室:大语言模型。这些是经过海量文本训练的强大计算机程序,能够阅读、总结甚至识别人类语言中的模式。随着这些模型变得越来越强大,研究人员开始询问,它们是否可以协助完成主题分析中的繁重工作。计算机能否阅读访谈并找到人类所能发现的相同主题?虽然早期的通用环境测试显示出了一定的前景,但一个关键问题仍悬而未决:当数据来自弱势群体时,这种方法是否依然有效?如果计算机误解了残障人士的经历,这种错误不仅仅是一个统计上的失误;它面临着让那些研究旨在帮助的人群失声的风险。
剑桥大学的一个研究小组通过将人类智能与人工智能并置,试图回答这个问题。他们采用了之前一项研究的访谈数据,该研究涉及31名具有残障(包括自闭症、特定学习差异和心理健康状况)的大学生。这些学生曾使用过旨在帮助他们应对大学生活的社交机器人和语音代理。研究人员请出了一位专门从事残障与教育领域的专家,要求其使用标准的严谨方法对转录文本进行分析。与此同时,他们将完全相同的文本输入到一个先进的语言模型中,并指示其遵循相同的步骤并寻找相同的主题。
结果显示,计算机并未完全迷失方向。当研究人员观察人类与模型如何对学生的评论进行分组时,计算机的表现显著优于随机概率。它成功识别出某些话题(如与机器人互动的困难或机器人理解残障的需求)是相关的。事实上,对于一些直观的话题,计算机生成的标签在含义上与人类的标签非常接近。然而,这种一致性远非完美,且差异并非随机产生的。随着分析从简单的总结转向更深层、更抽象的概念,计算机开始出现偏差。
最显著的发现出现在研究人员检查分歧性质的时候。他们发现,计算机往往将访谈视为一种表层练习,只提取最明显的词汇,而非理解深层含义。例如,当一名学生谈到关于“能力歧视”(ableism,即针对残障人士的偏见)的具体恐惧时,计算机经常用更宽泛、更不具体的词汇“歧视”(discrimination)来替换这个精确的术语。虽然这看似只是微小的替换,但它实际上抹去了学生经历中的特定现实,将一种独特的挣扎扁平化为一个通用的类别。在其他案例中,计算机完全忽略了评论的情感分量,而是将注意力集中在机器人的实际效用上,从而忽略了学生焦虑或孤独的情绪。
该研究表明,虽然这些人工智能工具在研究的早期机械阶段(例如处理大量文本以寻找初步模式)可能非常有用,但它们尚未准备好在敏感语境中取代人类判断。计算机难以理解权力、身份和生活经验中的细微差别。它倾向于将个体故事概括为群体层面的趋势,这种习惯可能会使那些研究本应支持的参与者边缘化。研究人员得出结论:对于涉及弱势群体的研究,人类元素仍然是不可或缺的。计算机可以提供辅助,但不能被信任独立去诠释人类经验的核心,否则这样做存在误解那些最需要被清晰听见的群体声音的风险。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。