在现代职场中,一种新型的助手已经到来,它能够以近乎人类的速度撰写电子邮件、总结报告并起草代码。这个助手是生成式人工智能工具,一种通过海量互联网文本训练而成的计算机程序。这些程序通常被称为大语言模型,其工作原理是通过预测句子中下一个应该出现的词,从而能够对几乎任何问题生成连贯且有用的回答。虽然这些工具承诺让工作变得更轻松、更快速,但它们也伴随着隐藏的代价:你输入其中的信息可能无法保持私密。由于这些系统是在包含个人细节的数据上进行训练的,因此存在着患者、客户或同事的敏感信息被意外泄露或以损害安全的方式被存储的真实风险。这为那些想要利用这些工具提高效率,却又担心分享过多信息所带来后果的员工们造成了困境。
为了理解人们是如何应对这种紧张关系的,德国雷根斯堡大学的研究人员对来自 IT、医疗和教育等不同行业的 224 名专业人士进行了一项研究。他们想了解三件事如何影响人们是否使用这些工具以及如何使用它们:雇主制定的规则、个人的隐私担忧,以及他们对工具如何处理数据的实际理解程度。研究人员发现,当组织对使用这些工具有明确的指导方针时,员工就会更了解这项技术是如何运作的。具体而言,在拥有政策的公司里,员工在回答有关工具如何存储和处理信息的问题时表现得更好。然而,即便有了这些规则,所有参与者的整体理解水平仍然相当低,大多数人只能答对大约三分之一的事实。
研究揭示了一个清晰的行为模式。那些对隐私深感忧虑的人使用这些工具的频率较低,且从事的任务范围较窄。这种犹豫在那些公司完全没有规则的员工中最为显著;在缺乏官方指导的情况下,这些人完全依赖于自己的恐惧和知识来决定什么是安全的。相比之下,对于在已有既定政策的组织中工作的员工,他们的个人焦虑程度似乎并不影响他们使用工具的频率或用途。规则本身似乎提供了一种结构感,使他们无论个人焦虑程度如何,都能更广泛地使用这项技术。有趣的是,研究人员发现,规则的具体类型——无论是限制谁可以使用该工具,还是限制如何使用该工具——对行为的影响并没有显著差异。仅仅是政策的存在,似乎就是塑造员工参与技术方式的最重要因素。
其中最令人震惊的发现之一是对这些工具如何保护数据存在普遍的误解。研究中的几乎所有参与者都认为,他们输入聊天框的信息会自动被隐藏或匿名化,以保护其身份。而实际上,该工具的标准设置并不保证这一点,数据可能会被用于训练未来的系统版本。这种人们所认为的情况与实际情况之间的差距表明,许多工人在使用这些强大工具时,是在错误的假设下运行的。研究人员得出结论,虽然组织政策有助于人们更好地理解技术,但它们并不能自动解决潜在的知识匮乏问题。如果没有清晰、准确的信息,即使是初衷良好的员工也可能会继续暴露敏感数据,这并非因为他们粗心,而是因为他们根本不知道风险是真实存在的。
技术摘要:先聊天,后忧虑:理解工作场景下个体对 ChatGPT 的隐私感知
问题陈述
生成式人工智能(GenAI)工具,特别是像 ChatGPT 这样的语言大模型(LLMs),正在迅速改变教育、医疗和 IT 等多个领域的日常工作流程。尽管这些工具带来了效率提升,但其集成过程也引发了显著的隐私担忧。GenAI 的底层模型依赖于海量的文本语料库,其中通常包含用户生成的内容,并且具备无意中记忆并复现敏感训练数据的能力。此外,用户的输入可能会被存储并用于进一步的模型训练,或者通过技术漏洞和针对性攻击而暴露。
尽管存在这些风险,但在专业设置中,如何理解个体对这些隐私风险的感知以及这些感知如何影响实际的使用行为,目前仍存在研究空白。先前的研究主要集中在初始技术采用(例如使用技术接受模型)或一般的隐私关注,往往未能区分一般隐私态度与关于 ChatGPT 如何处理和存储数据的特定技术熟练度。此外,组织政策在塑造这些行为和能力方面的作用也尚未得到充分探索。
研究方法
作者进行了一项定量用户研究,涉及来自欧洲不同就业部门的 N=224 名参与者,这些参与者将 ChatGPT 集成到其工作流程中。该研究利用通过 Google Forms 托管的在线调查,通过 Prolific Academic 和定向电子邮件外推进行分发。
- 构念与测量:
- 组织政策: 通过识别是否存在以及存在何种类型的 GenAI 指南(分为关于谁可以使用该工具的“用户约束”和关于如何使用该工具的“使用约束”)的多项选择格式进行评估。
- 综合隐私关注: 一个通过改编既有量表(如 Smith 等人,1996;Dinev 和 Hart,2006a)开发的新型构念,旨在捕捉与向第三方披露个人信息的风险相关的客观感知。采用 5 点李克特量表进行测量。
- ChatGPT 熟练度: 一个专门设计的全新构念,用于评估用户对 ChatGPT 数据存储和处理机制的显性知识。该部分通过直接源自 OpenAI 官方隐私政策和技术文档的 11 个“是非题”知识点进行测量。
- 使用行为: 通过两个指标进行测量:使用频率(4 点李克特量表)和 使用场景(从八个应用类型列表中选择的不同应用类型的计数)。
- 数据分析: 研究采用了描述性统计、针对背景变量的 t 检验、相关性分析以及使用 Mplus 8 进行路径建模来检查直接效应和间接效应。分析控制了相关的统计学变量(性别、年龄、受教育程度)。
核心贡献
- 新型构念开发: 本文引入了“ChatGPT 熟练度”作为一个独立的指标,超越了通用的技术能力,专门衡量用户对数据隐私政策和工具技术功能的理解。
- 隐私构念整合: 作者提出了“综合隐私关注”,这是一个结合了感知隐私风险和关注点的统一框架,以更好地捕捉 GenAI 背景下对数据披露的主观态度。
- 语境聚焦: 不同于以往关注初始采用或一般使用的研究,本研究专门针对已建立使用习惯的工作场景下的用户,探讨了组织治理、个人知识与实际使用模式之间的相互作用。
- 定量洞察: 研究提供了关于组织政策、隐私感知与使用行为之间关系的定量证据,填补了以往研究过度依赖定性访谈或轶事反馈的空白。
结果
- 组织政策与熟练度: 组织政策与 ChatGPT 熟练度呈显著正相关。在拥有既定政策的组织中工作的员工,与没有此类政策的员工相比,能够更好地理解 ChatGPT 如何存储和处理数据。
- 整体熟练度较低: 尽管存在正相关关系,但整体 ChatGPT 熟练度仍然较低,仅有 36% 的知识性陈述被正确验证。一个显著的误解是:90% 的参与者错误地认为其个人信息会被自动匿名化。
- 隐私关注的影响: 更高水平的综合隐私关注对 ChatGPT 的使用频率和应用多样性均产生了负面影响。这种负面影响在没有 GenAI 政策的组织中尤为显著,这表明这些个体仅依靠个人的担忧和知识来引导行为。
- 政策的调节作用: 在设有既定政策的组织中,个人隐私关注和熟练度对使用行为的影响并不显著。这表明组织指南可能会覆盖或标准化个人的决策过程。
- 政策类型: 研究发现,“用户约束”与“使用约束”对个人使用行为的影响没有显著差异。
- 使用多样性: 与没有政策的组织相比,在有政策的组织中的参与者将 ChatGPT 用于更广泛的应用场景。
意义与主张
本文声称是首个提供关于 ChatGPT 用户在特定工作背景下由隐私驱动的行为的定量洞察的研究。研究强调,虽然组织政策成功提升了用户对工具数据处理的技术理解(熟练度),但并不一定会消除隐私担忧。相反,政策似乎通过提供结构化指导来促进更具多样性的使用,而缺乏政策则使用户容易依赖于可能不准确的个人假设(例如对自动匿名化的信念)或限制工具效用的限制性隐私关注。
作者谦虚地总结道,结构化的组织指导是提高用户能力并实现 GenAI 工具多样化、高效使用的关键因素,同时也承认即使在受监管的环境中,用户知识方面仍存在显著差距。本研究并非提出新的技术解决方案或未来应用,而是提供经验证据,以指导组织政策制定和用户教育策略。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。