想象一下,未来的教室不仅仅是一个摆放着课桌的房间,而是一个繁忙的数字游乐场,一个新型的超级智能机器人助手刚刚抵达。这个被称为“生成式人工智能”(或 GenAI)的机器人,可以写论文、解数学题,甚至比任何人都更快地编写视频游戏代码。它就像一本会说话、能根据你的要求创造任何事物的神奇百科全书。但问题在于:这个机器人是由几家大型私有公司建造和拥有的,而不是由学校本身拥有。我们并不完全清楚它会对你向它倾诉的秘密做些什么。它是把这些秘密记在笔记本上以进行学习吗?还是会把它们分享给朋友?这就是“隐私与安全”领域中人们担心的核心问题。隐私是指保护你的个人日记不被窥视;而安全则是确保你数字大门的锁足够坚固,能够将黑客挡在门外。随着学校竞相让学生使用这个神奇的机器人,他们正试图弄清楚如何在让乐趣发生的同时,又不让机器人偷走学生的秘密,或者让坏人闯入学校的数字保险库。
一个研究小组决定揭开幕布后的真相,看看大学是如何处理这一棘手情况的。他们并非凭空猜测,而是阅读了来自 12 个不同国家的 43 所顶尖大学的官方规则手册和安全指南。把这些指南想象成学校为自己编写的“用户手册”,用以说明:“好的,这就是我们允许你如何使用这个机器人的方式,以及我们如何尝试保护你的数据安全。”
研究人员发现,虽然学校确实对这个机器人感到担忧,但他们的安全计划有点像一件补丁被子——有些部分非常坚固,而有些部分则有漏洞。首先,学校主要担心学生不小心泄露自己的秘密。他们知道,如果学生把作业或私密的科研想法输入到机器人中,拥有该机器人的公司可能会保留这些信息来训练它的“大脑”。然而,研究人员注意到,学校对于机器人本身被黑客攻击或被坏人欺骗的担忧相对较少。这就像学校非常小心不要把零花钱掉在人行道上,但还没完全想好如何阻止扒手偷走钱包。
在解决这些问题时,学校使用的是高科技锁具和简单规则的结合。一些大学购买了机器人的特殊“企业版”,这种版本承诺不会保存学生数据,有点像租用私人房间而不是使用公共公园。但许多学校只是告诉学生:“嘿,你要小心点!别把你的秘密打进去。”研究人员发现,这把巨大的负担转嫁到了学生和老师身上,让他们自己充当安全员。学校还试图利用原本用于普通计算机的安全规则来保护这个全新的、神奇的机器人,这有点像试图用一根自行车链条去锁住一艘宇宙飞船。它可能在一段时间内有效,但它并不是为这项工作而设计的。
这项研究表明,虽然大学正在尽力而为,但他们仍在摸索如何平衡这个机器人所能带来的神奇功能与保护每个人安全的需求。他们是在边做边写这些规则,经常借鉴其他学校的想法或遵循政府的法律。研究人员得出结论,我们需要更好、更具体的安全计划,这些计划要能理解这个新机器人究竟是如何运作的,而不是仅仅希望旧的规则能够奏效。这是一个正在进行中的过程,每个人都需要保持沟通,以确保这个神奇的机器人能在帮助我们学习的同时,不会偷走我们的秘密。
技术摘要:理解大学指南如何应对学术环境中的生成式人工智能隐私与安全问题
问题陈述
生成式人工智能(GenAI)正在通过增强学习范式来变革高等教育,然而驱动这一变革的系统主要由私营实体控制,这些实体具有不透明的数据保留实践和有限的用户控制权。在学术环境中,GenAI 的集成引发了关于将专有、个人身份识别信息及敏感教育信息暴露给外部平台的关键担忧。尽管大学正在制定使用指南以平衡创新与学术诚信,但在如何具体构思、评估并缓解 GenAI 固有的隐私与安全风险方面,仍存在显著的理解鸿沟。现有文献通常将隐私和安全视为次于教学问题的议题,或者在分析大学在保障 GenAI 采用过程中面临的技术与运营挑战时缺乏细粒度。
研究方法
作者对来自 12 个国家的 43 所大学发布的 GenAI 使用指南进行了深入的定性内容分析。样本选自“2024 年 QS 世界大学排名”,以确保聚焦于全球知名机构,同时研究也力求实现区域多样性。
- 数据收集: 研究人员通过手动检索大学网站,识别出在 2024 年 6 月至 12 月期间发布的大学级指南(排除部门特定文档)。他们还收集了其中 19 所大学的 IT 侧重型安全与隐私指南,以便将这些文档与侧重教学与学习的文档进行交叉对比。
- 分析过程: 本研究采用了结构化的定性编码过程。三名研究人员独立对初始选定的大学文档进行编码,以开发代码本,并通过迭代讨论对代码本进行优化。随后,该代码本被应用于剩余文档,实现了 0.65 的 Cohen's kappa (κ) 值,表明具有实质性的评分者间一致性。分析持续进行直至达到数据饱和。
- 范围: 分析重点关注有关隐私与安全风险、威胁模型、缓解策略以及将这些概念与更广泛学术价值观相结合的文本内容。
核心贡献与结果
本研究探讨了三个研究问题(RQs),即大学如何构思风险、评估缓解措施以及在政策设计中定位隐私/安全。研究结果总结如下:
1. 风险的构思方式 (RQ1)
大学广泛认可与 GenAI 相关的隐私与安全风险,特别是涉及敏感学生、研究及机构数据的风险。然而,研究发现这些风险在框架构建上呈现出三个关键特征:
- 数据定义的差异性: 指南在如何定义“敏感数据”方面存在显著差异。部分大学提供了具体示例(例如,加州理工学院列出了知识产权和出口管制数据),而另一些则依赖模糊术语(如“机密信息”)且未作详细说明,通常将责任推交给 GDPR 或国家数据保护法等外部政策。
- 威胁模型的失衡: 所呈现的威胁模型是不完整的。指南过度强调通过第三方服务提供商导致的隐私泄露,以及利用 GenAI 进行学术诚信违规(如剽窃、伪造)的行为。相比之下,具体的对抗性行为,如越狱(jailbreaking)、提示词注入(prompt injection)以及技术漏洞(如模型投毒),描述不足,仅有少数指南讨论了这些安全攻击手段。
- 与更广泛危害的联系不明: 虽然指南将隐私泄露与伦理风险(如歧视)和负面学习结果(如过度依赖)相联系,但技术安全失效与更广泛教育危害之间的联系往往模糊或隐含。
2. 缓解措施与挑战 (RQ2)
大学试图通过结合技术保障、操作程序和个人责任来缓解风险,但在清晰度和一致性方面面临重大挑战:
- 技术保障: 业界对 AI 检测工具的可靠性持怀疑态度。因此,大学通常依赖现有的技术基础设施(如企业账号验证、访问控制)和获得授权版本的 GenAI 工具(如带有数据保护附加条款的 Microsoft Copilot),而非开发新的、针对 GenAI 的检测机制。
- 向个人责任的转变: 一个显著趋势是将问责制下放给个人(学生和教职员工)。指南经常将责任归于用户,要求其避免上传敏感数据、审查输出结果并选择合适的工具,且往往没有提供详细的、针对特定服务的隐私评估。
- 操作复杂性: 为 GenAI 采购实施安全审查非常复杂,通常涉及多个部门。虽然一些机构已建立了专门的监督和救济机制,但这些流程通常被描述为持续性的努力,而非成熟、标准化的协议。
- IT 指南与教学指南: 侧重 IT 的指南倾向于将隐私担忧转化为具体的风险评估和监控实践;而侧重教学的指南则通过学术价值观和课堂实践来界定这些问题。这两类指南之间的交叉引用在不同地区之间差异显著。
3. 政策设计原则 (RQ3)
隐私与安全治理受多种因素的复杂相互作用影响:
- 监管框架: 指南高度锚定在现有的国家和区域法规(如美国的 FERPA、欧盟的 GDPR、新加坡的 PDPA)之上。然而,这些框架往往缺乏针对 GenAI 的具体条款,导致不同司法管辖区在如何监管与第三方进行数据共享方面存在不一致性。
- 学术价值观: 隐私与安全经常被纳入更广泛的学术价值观之下,如诚信、公平和负责任的学习。虽然这提供了规范性权重,但论文指出,这种基于价值的框架化可能会使执行过程存在解释空间,有时会以高层级的原则替代具体的指导。
- 利益相关者参与: 研究承认需要学生和教职员工积极参与政策制定,尽管这种参与在解决技术性隐私风险方面的有效性各不相同。
意义与主张
本文声称提供了关于大学如何系统化管理 GenAI 隐私与安全风险的首个深入定性分析,超越了仅将这些问题视为次要关注点的现状。作者认为,研究结果揭示了当前制度景观中的关键差距:
- 现有框架的局限性: 现有的法律和技术框架往往不足以应对 GenAI 特有的威胁,例如模型从极少量数据中推断敏感信息的能力,或“越狱”风险。
- 需要定制化方法: 研究强调,大学需要超越通用的数据保护政策,开发专门针对 GenAI 独特能力和风险的评估框架与技术保障措施。
- 基础设施差异: 研究强调了机构间的资源差异,指出即便是在顶尖机构观察到的复杂保障措施,资源较少的大学也可能难以实现,除非通过战略合作伙伴关系和知识共享。
作者总结道,尽管大学正在积极制定指南,但该领域需要更强大的、具备隐私意识的框架,将技术、操作和教学视角整合在一起,以有效地保障高等教育中 GenAI 的应用。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。