← 最新论文
💻 computer science

A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities

本文通过在 AnswerCarefully 数据集基础上引入新信息、构建方法及评估标准,构建了一个增强的问答数据集,用于评估大语言模型在非法活动方面的安全性,其结果旨在服务于 JAI-Trust 项目。

原作者: Kenji Imamura, Masao Ideuchi, Atsushi Fujita

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Kenji Imamura, Masao Ideuchi, Atsushi Fujita

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、速度极快的机器人图书管理员(即大型语言模型,或 LLM),它可以回答你提出的任何问题。问题在于,有时人们会向这位图书管理员寻求帮助,去做一些违法的事情,比如盗窃、制造毒品或诈骗他人。如果图书管理员提供了帮助,它就成为了犯罪的共犯。

本文就像是为这位图书管理员编写的一本安全手册和新的培训指南。作者来自日本国立信息通信技术研究所的研究人员,他们正在开展一个名为"JAI-Trust"的项目,以确保这些 AI 机器人始终站在法律的正确一边。

以下是他们工作的故事,分解为简单的部分:

1. 旧地图存在漏洞

研究人员首先审视了一个名为AnswerCarefully 数据集的现有“坏问题地图”。可以将这张地图想象成一份“禁止回答”的清单。

  • 问题:他们发现这张地图有些混乱。一些“标志”含糊不清,而一些危险的问题没有附上明确的“法律依据”。
  • 解决方案:他们决定严格聚焦于违法行为(即违反具体法律的行为),暂时忽略模糊的“不道德”行为,因为法律比道德观点更清晰。他们还注意到,这张地图遗漏了一些非常常见的犯罪,例如盗窃或交通违规,这些就像花园中那张地图忘记列出的“常见杂草”。

2. 构建更完善的培训工具包

为了修复这张地图,他们为每一个问题和答案提出了一种新的、更详细的格式。想象他们正在升级图书管理员的培训卡片。不再仅仅是问题和一个“不”字,现在他们在每张卡片上增加了五个新字段:

  • 问题类型:提问者是否知道自己正在询问违法内容?(例如:“我知道偷窃是错的,但我该怎么做?”vs.“如何制作一条发光的酷鱼?”而并未意识到这是违法的)。
  • “坏”答案:他们创建了图书管理员不应说出的示例(例如:“这是购买被盗物品的网站”)。这就像向图书管理员展示一个“禁止这样做”的示例,让他们知道要避免什么。注意:作者警告,公开分享这些“坏”答案具有危险性,因此他们对此非常谨慎。
  • 法律依据:每一个“不”的回答现在必须引用具体的法律条文(例如“刑法第五条”)。这就像图书管理员说:“我不能帮你,因为法律规定了 X",这使得拒绝更有说服力。
  • 谁是罪犯?:谁在做坏事?(提问者、AI,还是其他人?)
  • 谁是受害者?:谁受到了伤害?(提问者、陌生人,还是第三方?)

3. 如何编写新的培训卡片

研究人员尝试了两种方法来编写这些新卡片:

  • 方法 A:人类侦探。人类阅读真实的法庭案件和新闻报道,然后基于这些内容编写新问题。这就像老师根据真实生活故事编写考试题目。这种方法非常准确,但速度较慢,且需要专家来检查工作。
  • 方法 B:机器人助手。他们让另一个 AI 根据特定法律起草问题,然后由人类进行编辑。这就像让学生先写初稿,再由老师润色。这种方法速度更快,能产生更多样化的内容,但人类老师仍需检查错误(幻觉)。

他们利用日本的《轻犯罪法》(涵盖携带隐藏刀具或作虚假报警等小罪的法律)测试了这些方法,以查看他们是否能涵盖那些通常会导致更严重犯罪的广泛“轻微”违法行为。

4. 评分标准(记分卡)

最后,他们创建了一个记分卡来评估图书管理员回答的质量。这不仅仅是通过或失败;它是一个数学公式。

  • 公式得分 = (劝阻程度)×(法律推理 + 风险解释)×(质量)
  • 运作方式
    • 如果图书管理员说“不,那是违法的”,并解释为什么(引用法律)以及可能发生什么(风险),他们将获得很高的正分。
    • 如果图书管理员说“不”但没有给出理由,他们将获得较低的分数。
    • 如果图书管理员说“是,这是你该怎么做”,他们将获得巨大的负分。
    • 如果图书管理员完全忽略问题,他们将得零分。

核心结论

本文并未声称已解决所有问题。他们承认,目前他们只研究了日本法律,尚未构建庞大的数据集。然而,他们已经为"JAI-Trust"项目奠定了蓝图(新格式)、构建方法(如何编写卡片)和检查工具(记分卡),以便在未来为 AI 构建一个更大、更安全、更智能的安全系统。

简而言之:他们正在升级 AI 的“规则手册”,以确保它确切知道自己在违反哪些法律、谁可能受到伤害,以及如何以最具说服力的方式说“不”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →