← 最新论文
💻 computer science

A Comparative Study of Competency Question Elicitation Methods from Ontology Requirements

本文通过构建首个多标注者数据集,实证比较了人工编写、模式实例化与大语言模型生成三种本体能力问题(CQ) elicitation 方法,发现 LLM 虽可作为 CQ 初始生成的有效手段,但其输出质量受模型影响且通常仍需人工进一步细化。

原作者: Reham Alharbi, Valentina Tamma, Terry R. Payne, Jacopo de Berardinis

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Reham Alharbi, Valentina Tamma, Terry R. Payne, Jacopo de Berardinis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一场**“提问大师”的选拔赛**。

为了让你更容易理解,我们可以把**“本体(Ontology)”想象成一座巨大的图书馆**,而**“能力问题(Competency Questions, CQs)”就是读者想要借书时提出的具体问题**。

  • 如果图书馆管理员(本体工程师)不知道读者会问什么,他们就无法把书(知识)分门别类地放好。
  • 如果读者问的问题太模糊、太复杂或者问错了地方,图书馆就会乱套,或者根本找不到书。

这篇论文就是想知道:到底是谁最擅长提出这些“关键问题”? 他们比较了三种不同的“提问选手”:

🏆 参赛选手介绍

  1. 人类专家(Manual)

    • 形象:经验丰富的老图书管理员。他们读过很多书,懂行规,知道读者真正需要什么,甚至能猜到读者没明说但心里想要的东西。
    • 任务:直接根据故事背景,凭经验写出问题。
  2. 模板填空手(Pattern-based)

    • 形象:拿着“万能提问模板”的实习生。比如模板是:“哪个 [东西] [动作] 了 [另一个东西]?”他们只需要把故事里的词填进去。
    • 任务:套用固定的句式生成问题。
  3. AI 大模型(LLMs)

    • 形象:两个超级聪明的“机器人作家”(GPT-4.1 和 Gemini 2.5 Pro)。它们读过互联网上所有的书,能瞬间写出成千上万句话。
    • 任务:把故事丢给它们,让它们自动生成问题。

🔍 比赛过程:它们表现如何?

研究人员给这三位选手同一个故事背景(关于博物馆音乐档案管理的),让它们各自生成一堆问题,然后请专家来打分。

1. 谁的问题最“靠谱”?(适用性)

  • 人类专家:🥇 冠军。他们的问题最清晰、最切题,大家一致觉得“这就该这么问”。
  • AI 机器人:🥈 亚军。它们的问题大部分也能用,但有时候会“跑偏”或者让人摸不着头脑,需要人类再修改一下。
  • 模板填空手:🥉 季军。它们的问题太生硬,像机器人说话,很多甚至根本不通顺,大家觉得“这问题问得没意义”。

2. 谁的问题最好懂?(可读性)

  • 人类专家:说话像大白话,小学生都能听懂。
  • AI 机器人:说话像学术论文,句子特别长,词汇特别难,读起来很费劲。就像让一个刚学走路的孩子去读大学教材。
  • 模板填空手:介于两者之间,但有点死板。

3. 谁的问题最“烧脑”?(复杂度)

  • 人类专家:问题很精炼,直击要害。
  • AI 机器人:问题太啰嗦了!它们喜欢把简单的事情说得很复杂,恨不得把整个故事背景都塞进一个问题里。这就好比你想问“今天天气怎么样”,它却回答了一整篇关于气象学的论文。
  • 结果:AI 生成的问题,不仅长,而且逻辑结构极其复杂,让人看了头大。

4. 谁的问题最“有深度”?(隐含需求)

  • 人类专家:不仅能回答故事里明着说的事,还能出故事里没明说但很重要的事(比如:“这个乐器属于哪个家族?”故事里没提,但专家知道这很重要)。
  • AI 机器人:比较死板,只敢问故事里明着写的东西。如果故事没写,它们就不敢问,或者问得风马牛不相及。

💡 核心发现与比喻

这篇论文得出了一个非常有意思的结论,我们可以用**“做菜”**来比喻:

  • 人类专家像是顶级大厨。他们知道客人(用户)真正想吃什么,哪怕客人没说,他们也能根据经验加一点“秘制调料”(隐含需求),做出来的菜(问题)味道好、分量刚好、大家爱吃。
  • AI 机器人像是刚上岗的自动炒菜机。它能把菜炒熟,也能把故事里的食材都放进去,但它火候掌握不好(太复杂),调味太咸(词汇太难),而且不懂客人的特殊口味(缺乏隐含需求)。虽然它做得快,但直接端上桌,客人可能吃不惯。
  • 模板填空手像是只会按说明书操作的机器。它做出来的菜虽然符合格式,但毫无灵魂,甚至有时候根本没法吃。

🚀 最终结论:我们该怎么办?

  1. AI 不能直接取代人类:虽然 AI 很聪明,能生成很多想法,但直接拿它生成的问题去用,可能会因为太复杂、太模糊而把项目搞砸。
  2. 最好的策略是“人机协作”
    • AI 先当**“头脑风暴助手”**,快速生成一大堆想法,帮人类打开思路。
    • 然后让 人类专家 当**“精修师”**,把 AI 那些啰嗦、复杂的问题修剪得简单、清晰,并补充上那些 AI 想不到的“隐含需求”。

一句话总结
在构建知识图书馆时,AI 是个很好的“草稿员”,但只有人类专家才能当最终的“主编”。我们需要利用 AI 的速度,但必须保留人类的智慧和经验,才能问出真正好问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →