想象一下,你刚刚搬进了一座高科技的新公寓大楼。这座建筑非常棒,但这里的居住规则被写在了一本混乱且不断变化的说明书中,而且根本没人去读。有些公寓对噪音有严格规定,而有些则含糊其辞。有些说你不能烹饪某些食物,而有些只说“别把房子烧了”。
这篇由巴斯大学(University of Bath)和巴斯斯帕大学(Bath Spa University)研究人员撰写的论文,就像是一份针对五大 AI “公寓大楼”——Anthropic、DeepSeek、Google、OpenAI 和 xAI——细则部分的侦探指南。
以下是他们发现的内容,使用了简单的类比:
1. “隐藏规则”问题
作者注意到,尽管每个人都在使用这些 AI 工具(LLM)进行工作、学习和娱乐,但其**服务条款(即规则手册)**却一团糟。
- 类比: 想象一下,如果一个邻居的规则手册说:“晚上 10 点后禁止大声播放音乐”,而另一个说:“禁止播放听起来像猫叫的声音”,第三个则说:“音乐可以,但如果你心情不好时就别放。”
- 现实情况: 不同公司之间的规则差异巨大。有些非常具体,有些则很模糊。这造成了“监管灰色地带”——在这些区域,你不知道自己是否违反了规则,直到被抓到为止。
2. “研究者的困境”
论文重点讨论了这些规则是如何伤害科学家和研究人员的。
- 类比: 想象一位科学家试图研究城市中人们的行为。但城市的规则手册却规定:“你不能研究人们的感觉,”或者“你不能预测某人是否可能犯罪。”
- 现实情况:
- OpenAI 就像是一个非常严厉的房东。他们规定你不能使用他们的 AI 来研究“国家安全”或根据性格预测某人是否可能犯罪。这阻碍了研究人员对在线激进化或暴力风险的研究。
- Anthropic 则规定你不能构建猜测人类情绪的系统。这阻碍了心理学家和社会科学家研究人类如何感受或对世界做出反应。
- 结果: 研究人员被迫进行猜测。他们必须不断查阅规则手册,看自己的实验是否被允许,否则他们可能不得不完全停止工作。这就像是在盖房子时,建筑师却一直在改动蓝图。
3. “漏洞百出”的安全网
论文强调,虽然这些公司声称拥有安全规则,但它们并不总能阻止不良行为。
- 类比: 想象一个游乐场,上面挂着一块牌子说:“禁止推搡。”但一群孩子正在把别人从秋千上推下去,而游乐场管理员(公司)并没有阻止他们。
- 现实情况: 作者提出了一个关于 xAI 的 Grok 的特定且令人不安的例子。用户一直在利用它生成未经同意的女性和儿童性图像。尽管公司表示这违反了规则,但这些图像却不断出现。规则手册确实存在,但执行力很弱。这就像是在一个充满烟雾的房间里挂着“禁止吸烟”的告示。
4. “医疗建议”的矛盾
论文指出了一处关于健康的混乱矛盾。
- 类比: 想象一家诊所挂着一个告示说:“我们不是医生,请不要向我们咨询医疗建议。”但随后,同一家诊所又开设了一个名为“健康聊天”的新部门,并宣传每周都有数百万人向它咨询健康问题。
- 现实情况:
- OpenAI 和 Anthropic 都有规则规定,其 AI 不应被用于医疗诊断或治疗。
- 然而,他们也推出了各种产品(如“ChatGPT Health”和“Claude for Healthcare”),这些产品实际上在鼓励人们询问健康问题。
- 论文指出,这造成了一个混乱的情况:规则说“不要这样做”,但业务端却在说“你可以这样做,但要小心”。
5. “细则”陷阱
作者认为,公司正在将责任转嫁给用户。
- 类比: 这就像一场游戏,公司用隐形的墨水写下规则。如果你输了,他们会说:“哎呀,你应该读过规则的。”
- 现实情况: 论文声称,这些公司利用复杂的服务条款来规避其 AI 造成的伤害责任。如果用户做了坏事,公司会说“你违反了规则”,而不是通过修复工具来从源头上防止不良行为的发生。
总结
研究人员得出结论:普通用户和科学家正被迫成为法律专家,仅仅为了使用这些工具。他们呼吁设立一个“研究附加条款”——一套专门的、清晰的规则,明确允许科学家在安全的情况下开展工作,而不必去猜测自己是否违反了某条模糊的规则。
简而言之: AI 世界正在快速发展,但其规则手册既混乱、不一致,有时又无法阻止真正的伤害。在规则变得更清晰且执行得更好之前,无论是科学家还是普通人,都仿佛行走在摇晃的地基之上。
技术摘要:大语言模型服务条款中的监管灰色地带
问题陈述
大语言模型(LLM)正日益融入学术研究流程和日常生活中,然而管理其使用的服务条款(ToS)仍未得到充分研究。尽管这些工具提供了巨大的效用,但高调的误用案例——例如生成非自愿性图像以及在专业设置中产生幻觉内容——凸显了公司政策与用户行为之间的脱节。
识别出的核心问题是存在“监管灰色地带”,即服务条款为合法用户(尤其是研究人员)造成了不确定性。作者观察到一种“后 API”时期的转变:针对研究人员的特定访问权限正在减少、转向“付费参与”模式或被完全移除。此外,通用用户与研究人员之间在用途限制的明确性方面存在显著失衡。条款通常是动态的,会随机更新,且语言复杂、模糊或具有矛盾性。这迫使研究人员去猜测许可使用的边界,可能从而抑制关于这些技术社会影响的新知识生成。此外,条款的执行似乎并不一致,正如 xAI 的 Grok 尽管有明确禁止,却仍持续生成非法内容(如儿童性虐待内容)所证明的那样。
研究方法
本研究采用文档分析法,对截至 2025 年 11 月五家主要 LLM 提供商的服务条款进行了审查:Anthropic、DeepSeek、Google、OpenAI 和 xAI。选择这些提供商是基于它们在 2025 年的知名度和庞大的用户群。
分析过程遵循了溯因迭代法:
- 数据收集: 从各公司网站收集了最新的服务条款。作者指出存在显著的导航困难,特别是 Google,其政策分布零散(例如,通用的“生成式 AI 禁止使用政策”与特定的 Gemini API 条款并存)。
- 交叉引用: 分析从最全面的文档(Anthropic)开始,以建立一个基准“条款表”。随后,将其他四家公司的服务条款与该基准进行交叉引用。
- 分类: 将条款分为预定义主题和新兴主题(例如,非法活动、儿童安全、隐私、关键基础设施)。作者量化了哪些公司包含了特定的类别,并记录了这些类别内的具体程度。
- 影响分析: 对分类后的数据进行分析,以确定对学术界和工业界通用用户及研究人员的具体影响,重点关注安全研究、计算社会科学和心理学研究等领域。
核心贡献
- 比较资源: 作者创建并公开了(通过 OSF)一个跨平台对比五家平台服务条款的交叉引用资源表。该资源详细列出了具体的条款、类别和例外情况(例如,最低年龄要求)。
- 识别监管灰色地带: 本文绘制了服务条款造成不确定性的特定领域,特别是在“高风险”用例、人类推断和禁止内容的定义方面。
- 研究专项分析: 研究明确指出了当前服务条款如何限制合法的研究方向,包括安全研究(如“红队测试”)、计算社会科学(如画像分析和情感分析)以及涉及欺骗或人类-LLM 对比的心理学研究。
研究结果
分析显示,使用限制的严厉程度和具体程度存在实质性差异:
- 通用限制: 所有五家提供商都禁止非法活动、违反儿童安全和平台滥用。然而,这些禁令的深度差异显著。
- Anthropic 和 OpenAI 拥有最广泛且最具体的条款,涵盖了诸如情感识别、武器开发和特定类型虚假信息等详细场景。
- xAI、DeepSeek 和 Google 通常采用更宽泛、更模糊的语言。例如,Google 的政策被描述为“轻触式”(light touch),在其禁止使用政策中很少有具体条款;而 DeepSeek 的条款被指出是一个“相对无序的高层级列表”。
- 儿童安全: 虽然所有公司都涉及儿童安全,但定义各异。Anthropic 在全球范围内将儿童定义为 18 岁以下,而 DeepSeek 则引用“您所在国家要求的最低年龄”。
- 高风险用例: 大多数提供商(Anthropic、OpenAI、xAI)要求在高风险应用(如医疗、法律、就业)中实施“人工在环”(human-in-the-loop)监督。然而,作者注意到一个矛盾点:Anthropic 和 OpenAI 在将其服务条款归类为需要严格监督的高风险应用的同时,也在商业化医疗应用(如“Claude for Healthcare”、“ChatGPT Health”)。
- 研究限制:
- 安全与情报: OpenAI 明确禁止在未经审查的情况下将模型用于“国家安全或情报目的”,这阻碍了安全研究人员。
- 人类推断与画像: Anthropic 和 OpenAI 限制构建推断情感或基于个人特征进行画像的系统。这直接影响了将在线行为与线下属性联系起来的计算社会科学研究。
- 欺骗: 禁止欺骗性技术(如冒充人类)的条款造成了不确定性,这对于依赖欺骗手段或将 LLM 响应与人类行为进行对比的心理学研究构成了挑战。
- 执行差距: 本文强调,尽管平台禁止生成非自愿性性图像(特别是针对儿童和女性),但像 xAI 的 Grok 这样的平台仍出现了大规模的内容生成(自 2025 年 12 月 25 日以来超过 20,000 张图像),这表明内部机制和执行存在失效。
重要性与主张
本文声称,现状迫使用户和研究人员必须有效地成为“法律专家”,才能应对使用 LLM 的风险。作者认为:
- 责任转移: 出现了一个令人担忧的趋势,即公司通过复杂的服务条款将损害责任转嫁给用户,而不是在模型内部实现稳健的防护措施。
- 对独立研究的威胁: 服务条款的限制性和模糊性威胁着独立研究,而这种研究对于评估 AI 的社会影响至关重要。作者指出,“红队测试”和漏洞研究往往是被禁止的,这阻碍了对安全性的独立验证。
- 政策干预的需求: 作者建议政策制定者和研究机构倡导建立一种标准化的“研究用途”附加条款。该框架应在伦理监督下明确允许正当的研究活动(包括敏感话题),其模式可参照现有的学术许可协议。
- 监管滞后: 研究强调,监管(如欧盟《人工智能法案》和英国《在线安全法案》)正难以跟上 LLM 的快速演进及其产生的特定危害,导致出现了一个真空地带,即服务条款成为了主要的、但往往也是无效的防线。
文章总结道,如果不对这些监管灰色地带进行澄清并保护独立研究,那么旨在治理 AI 的服务条款本身反而会阻碍更安全、更可靠的 AI 系统的发展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。