← 最新论文
💻 computer science

Classifier or Prompt: A Case Study on Legal Requirements Traceability

本文通过实证研究对比了基于句子变换器的分类器(Kashif)与基于 RICE 框架提示工程的 LLM(RICE_LRT)在法律需求追溯任务中的表现,发现针对法律语境专门设计的提示工程方法在复杂场景下优于传统分类器及现有基线模型。

原作者: Romina Etezadi, Sallam Abualhaija, Chetan Arora, Lionel Briand

发布于 2026-03-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Romina Etezadi, Sallam Abualhaija, Chetan Arora, Lionel Briand

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**“如何帮软件工程师快速读懂法律条文”**的故事。

想象一下,你是一家软件公司的经理,你们开发了一个叫"WeMobilize"的打车软件。现在,你们想把这个软件卖到欧洲去。但是,欧洲有一部非常严格、像天书一样的法律叫GDPR(通用数据保护条例),它规定了你们怎么处理用户的个人信息。

如果你们搞错了,比如忘了告诉用户“你可以随时取消订阅”,或者忘了“你可以要求删除你的数据”,公司可能会面临巨额罚款,甚至倒闭。

问题在于:
法律条文写得像“文言文”,充满了法律术语;而软件工程师写的“需求文档”(比如“我要让用户能登录”)写得像“大白话”。让工程师去把几百条大白话需求和几千条法律条文一一对应起来(这叫需求追踪),就像让一个只懂中文的人去把一本英文字典里的单词和中文成语一一对应,既耗时又容易出错,而且人工做根本做不完。

这篇论文就是为了解决这个难题,测试了两种**“人工智能助手”**能不能帮上忙。

两种 AI 助手的“超能力”

作者设计了两种不同的 AI 方案来尝试自动完成这个“翻译和匹配”的工作:

1. 方案一:Kashif(像是一个“超级图书馆管理员”)

  • 它的原理: 这个助手读过很多法律和需求文档。它不靠死记硬背,而是靠**“语感”**。它把每一句话都变成一个“数学坐标点”。如果“法律条文”和“软件需求”在数学空间里的位置靠得很近,它就认为这两者是相关的。
  • 它的表现:
    • 在简单的法律数据集(HIPAA,美国的医疗数据法)上,它表现很棒,比以前的老方法强了21%。它就像个勤奋的图书管理员,能迅速把相似的书找出来。
    • 但是,当面对更复杂、更模糊的欧洲 GDPR 法律时,它就有点“晕”了。因为它只懂“长得像”,不懂“深层含义”。比如,法律说“要保护隐私”,需求说“我要加密数据库”,Kashif 可能因为这两个词不一样就匹配不上,或者匹配错了。它的准确率只有**15%**左右。

2. 方案二:Rice LRT(像是一个“聪明的法律顾问”)

  • 它的原理: 这个助手用的是目前最强大的大语言模型(GPT-4o)。作者没有让它死记硬背,而是给它写了一套**“超级指令”(Prompt)**。
    • 这就好比给 AI 戴上了一顶“法律顾问”的帽子,并给了它一本“操作手册”:“嘿,你是一个专家。你要把软件需求和法律条文对应起来。不要只看字面意思,要动脑筋想:如果用户能登录,是不是就涉及了‘身份认证’?如果涉及身份认证,是不是就触犯了‘数据保护’法律?还要给出你的理由。”
  • 它的表现:
    • 这个“法律顾问”简直太聪明了!它不仅能看懂字面意思,还能**“举一反三”**。
    • 在复杂的 GDPR 测试中,它成功找出了84% 的正确关联(召回率),而且准确率(F2 分数)达到了61%
    • 最重要的是,它还能解释原因。比如它会说:“虽然需求里没写‘删除’,但‘停止接收邮件’隐含了‘撤回同意’的权利,所以这条法律必须对应。”这让工程师可以只检查它列出的少量选项,而不是面对几百条法律条文发呆。

核心发现与比喻

为了让你更直观地理解,我们可以用**“找对象”**来打比方:

  • 以前的老方法(Baseline): 就像是用**“关键词匹配”**。如果需求里写了“密码”,法律里也写了“密码”,就匹配成功。如果法律写的是“身份验证”,需求写的是“密码”,老方法就傻眼了,觉得没关系。
  • Kashif(分类器): 就像是一个**“看脸识人”**的助手。它觉得“密码”和“身份验证”长得有点像(都是关于安全的),所以能匹配上一些。但在面对复杂的“性格匹配”(法律逻辑)时,它就容易看走眼。
  • Rice LRT(提示词工程): 就像是一个**“情商极高、懂法律的媒婆”**。你给它看需求,它会思考:“这个功能虽然没明说,但逻辑上肯定需要遵守那条法律。”它能理解言外之意,甚至能给出“为什么这么配”的理由。

结论:我们该选谁?

  • 如果你只是处理简单、规则明确的法律(比如美国的医疗数据法),Kashif 这种基于统计的助手就够用了,它快且稳。
  • 如果你面对的是复杂、充满潜台词的法律(比如欧洲的 GDPR),Rice LRT 这种“会思考”的 AI 才是救星。它能把工程师从枯燥的“大海捞针”中解放出来,让他们只专注于审核 AI 筛选出的那 10% 的关键选项。

一句话总结:
这篇论文告诉我们,在让 AI 处理法律合规这种高难度任务时,“教它怎么思考”(设计好的提示词)比“让它死记硬背”(传统训练)要管用得多。 这就像教学生做题,直接给公式(Kashif)不如教他解题思路(Rice LRT)来得有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →