Who judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring
本文介绍了"govllm",这是一个开源框架,通过采用一组专门的小型语言模型作为监管裁判来生成实时合规信号并标记需人工仲裁的不确定性,从而实施“基于指标的治理”,以在欧盟《人工智能法案》下实现对大型语言模型的持续合规监控。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《基于指标的治理:用于持续大语言模型合规监控的运行时框架》(govllm)的通俗化解读,辅以类比说明。
核心问题:“合规虚构”
想象你买了一辆车。在把车开出停车场之前,机械师检查了一遍,说:“这辆车很安全。”你签了字,然后开车离开。
这篇论文指出,当前的人工智能系统正被像那辆车一样对待。开发者运行一次测试,宣布该人工智能符合法律(如《欧盟人工智能法案》),然后将其投放到现实世界中。作者将这种现象称为“合规虚构”。
现实情况是: 人工智能不像一辆静止的汽车,它更像一只宠物。它会学习、变化,并根据你对待它的方式做出反应。仅仅因为它在周二“安全”,并不意味着周五当用户欺骗它或提出奇怪问题时,它不会说出违法或危险的内容。论文认为,我们需要停止将合规视为一次性盖章,转而将其视为一种持续的心跳监测。
解决方案:govllm(“治理仪表盘”)
作者开发了一个名为 govllm 的开源工具。你可以把它想象成安装在人工智能系统内部的一个仪表盘,实时监视人工智能所说的每一句话。
govllm 不再等待年度审计,而是对人工智能给出的每一个答案进行即时检查,看其是否违反规则。
工作原理:“法官小组”
在法庭上,你不会依赖一位法官来裁决复杂的案件,而是有一个陪审团。govllm 也是如此。
专业法官: 系统不使用一个 AI 来检查所有内容,而是使用一组更小、更专业的 AI 模型。
- 一个 AI 是隐私专家(检查是否泄露个人数据)。
- 一个是安全卫士(检查是否有人试图攻击系统)。
- 一个是无障碍专员(检查语言是否清晰公平)。
- 一个是透明度审计员(检查人工智能是否谎称自己是人类)。
“画像即陪审团”概念: 对于每一项具体任务(例如撰写医疗摘要与总结银行报告),系统会挑选该工作所需的特定“陪审团”。它不会为所有事情使用通用的法官。
“不确定性信号”: 这是一项关键创新。通常,如果两位法官意见不一致,我们会假设其中一位错了,并采纳多数意见。
- govllm 的转折: 如果专业法官意见不一致,系统将这种分歧视为红旗。它会说:“嘿,这里的规则很模糊。我们需要人类介入并做出决定。”它将困惑转化为需要人类监督的信号,而不是试图掩盖困惑。
实验:测试法官们
作者使用四个小型开源人工智能模型(参数量从 17 亿到 70 亿不等)在普通笔记本电脑上完全本地运行,测试了该系统。他们没有使用庞大的云服务器,而是想证明这可以在本地和私密环境中运行。
他们创建了一个包含 49 个棘手问答的“测试库”(类似于人工智能的驾驶考试),涵盖五个主要法律领域。
主要发现:
- 规模无关紧要: 最大的人工智能(70 亿参数)实际上是最差的法官。更小、更专业的模型往往表现更好。在一般意义上“聪明”并不意味着它们擅长遵循具体的法律规则。
- “顺序”陷阱: 法官们对问题的提问方式非常敏感。如果你打乱问题的顺序,某些法官的得分会下降 25%。这表明小型人工智能模型很容易因提示词的结构不同而陷入困惑。
- 没有完美的法官: 没有任何单一的人工智能模型能在所有方面都做到完美。有些在发现隐私泄露方面表现出色,但在发现操纵行为方面却很糟糕。这证明了“法官小组”方法的必要性,因为没有任何一个 AI 能包办一切。
- “辞藻华丽但错误”的问题: 一位法官(Mistral)非常一致,并能清晰地给出答案理由,但它始终错误。它流利地为错误的结论辩护。这突显了你不能仅仅因为人工智能听起来自信就信任它。
“合规闸门”
该系统包含一个名为合规闸门的安全开关。
- 想象一下俱乐部的保镖。如果人工智能模型的得分低于某条线(例如,它开始过于频繁地泄露隐私数据),闸门会自动关闭。
- 系统会停止向该模型发送用户请求,并将其置于“隔离”状态,直到人类修复问题。这是自动发生的,无需等待人类发现问题。
为什么“本地部署”至关重要
作者坚持认为,整个系统必须在本地(在公司的自有计算机上)运行,而不能在云端运行。
- 类比: 如果你是一家银行,正在检查自己的安全性,你就不希望为了获得“安全检查”而将秘密客户数据发送给第三方云服务。这本身就是一个安全风险。
- govllm 确保数据永不离开大楼,从而满足严格的隐私法律(如 GDPR)和主权要求。
核心结论
这篇论文认为,我们不能仅仅对人工智能进行一次“审计”然后将其抛诸脑后。我们需要一个系统:
- 全天候监视人工智能的工作状态。
- 使用一组专业的小型人工智能法官,而不是一个巨大的通用法官。
- 将法官之间的分歧视为呼叫人类的信号,而不是忽略的故障。
- 自动关闭那些开始违反规则的模型。
这是一种从“这个人工智能合法吗?”(一次性的是/否问题)向“这个人工智能此刻的行为是否合法?”(持续信号)的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。