KNIGHT: Knowledge Graph-Driven Multiple-Choice Question Generation with Adaptive Hardness Calibration
KNIGHT 是一个由知识图谱驱动的框架,它利用大语言模型从外部来源高效地生成高质量、难度可控的多选题数据集,从而克服了用于评估 RAG 系统时人工编写评估题目所面临的成本和时间瓶颈。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位需要为学生编写测验的老师。通常情况下,你必须花费数小时阅读教科书、挑选事实,并编写难度恰到好处的问题。如果你想制作一个更难的测验,你必须从头开始。
这篇论文介绍了一个名为 KNIGHT(基于知识图谱驱动的自适应难度调节自然题目生成)的新工具。不要把 KNIGHT 仅仅看作是一个从零开始编写问题的机器人,而要把它看作是一个在编写测验之前先构建一张自定义地图的聪明图书管理员。
以下是它的工作原理,分为几个简单的步骤:
1. “地图”(知识图谱)
与其每次需要编写问题时都要求 AI 阅读整本书,不如让 KNIGHT 先为该主题构建一张简化的地图。
- 类比: 想象你想教别人关于“生物学”的知识。与其递给他们一本 500 页的百科全书,不如让图书管理员画一张单页纸,上面有圆点(实体,如“细胞”、“DNA”、“植物”)和连接它们的线(关系,如“细胞构成 DNA”)。
- 为什么这有用: 这张地图很小,读取速度快,且可以重复使用。一旦为“生物学”绘制了这张地图,图书管理员就可以利用它来制作简单的问题、困难的问题或棘手的问题,而无需再次查看那本庞大的百科全书。
2. 绘制路径(多跳问题)
为了提出问题,KNIGHT 不仅仅是挑选一个圆点,它还会沿着地图上的线追踪一条路径。
- 简单问题(等级 1): 路径很短。它从圆点 A 到圆点 B。
- 示例: “什么将生物学与细胞联系在一起?”
- 困难问题(等级 3): 路径长而曲折。它从圆点 A 到圆点 B,然后到圆点 C,最后到圆点 D。
- 示例: “如果生物学导向细胞,细胞导向 DNA,而 DNA 导向遗传学,那么哪门学科研究最后一步的内容?”
- 神奇之处: 系统通过决定在地图上走多少“跳”(步数)来控制难度。
3. “质量控制”检查员
仅仅因为一个机器人能写出一个句子,并不意味着它写出了一个好问题。KNIGHT 内置了一个检查员(另一个 AI),在每个问题进入最终测验之前,会根据五条严格的规则进行检查:
- 语法: 英语是否正确?
- 唯一答案: 是否只有一个正确答案?(避免出现有两个正确选项的陷阱题)。
- 选项唯一性: 错误选项(干扰项)彼此之间是否真的不同?
- 真实性: 答案是否只能通过地图和源文本找到?(这可以防止 AI 编造事实或“幻觉”)。
- 符合主题: 问题是否确实符合该主题?
4. 为什么它比旧方法更好
论文将 KNIGHT 与其他制作测验的方法进行了对比:
- “普通”方式: 直接要求 AI “写一个生物学问题”。这往往会导致编造事实或产生过于简单的问题。
- “RAG”方式: 每次都给 AI 一份长文档去阅读。这既慢又贵,而且 AI 仍然可能会感到困惑。
- “KNIGHT”方式: 通过使用地图,KNIGHT 更便宜、更快速。它构建一次地图,然后利用这张小地图生成数百个问题。由于这些问题是基于地图中实际的连接关系而非随机猜测生成的,因此它们也更难且更具逻辑性。
结果
研究人员在历史、生物和数学三个学科上测试了 KNIGHT。他们发现:
- 题目语法完美且表达清晰。
- “难题”确实更难(学生和 AI 模型更容易出错),而“易题”则很简单。
- 系统在“答案无法在源材料中找到”方面的错误极少(这意味着它没有“幻觉”或撒谎)。
- 它对 AI 模型的排名与著名的昂贵基准测试一致,证明了它是一种可靠的智能测试方式。
简而言之: KNIGHT 是一个系统,它绘制一张小型的、可重复使用的知识地图,然后利用这张地图快速且廉价地生成高质量、难度可控的测验,而无需为每一个问题都重新阅读整本书。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。