Knowledge-Graph Grounding Helps LLMs Only for Out-of-Training Knowledge: A Controlled Study on Clinical Question Answering
这项关于临床问答的对照研究表明,虽然知识图谱落地对于提升大语言模型训练数据中已有的事实性能并无帮助,但对于在训练集之外或新颖信息上实现接近完美的准确率而言,它是必不可少的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位超级聪明的学生(即 AI),他几乎读遍了世界上所有的书(直到某个特定日期)。你给他进行了一场测试。有时,你还会给他一本特定的教科书,让他边看书边回答问题。
这篇论文提出了一个简单的问题:给学生一本教科书真的能帮他们提高成绩吗?
根据这项研究,答案是:这完全取决于答案是否已经在学生的脑海里了。
以下是研究人员发现的详细内容,使用了简单的类比:
1. “已知知识”问题(公共数据)
研究人员使用一个公共医学数据库(就像一个每个人都知道的巨大开放图书馆)对 AI 进行医学标准问题的测试。
- 结果: 给 AI 提供该数据库并没有帮助。事实上,它有时甚至让情况变得稍微糟糕了一些,或者保持不变。
- 类比: 想象你问一名学生:“谁写了《哈姆雷特》?”你在递给她传记让她参考的同时向她提问。无论她是否读过那本书,这都不重要,因为她已经知道答案了,因为她在学校里学过莎士比亚。这本额外的书只是冗余的。
- 发现: 由于 AI 的训练数据中已经包含了这些医学知识,所以这个“教科书”(知识图谱)所包含的事实是 AI 已经掌握的。AI 不需要这些帮助,而查找资料的额外步骤并没有增加价值。
2. “全新知识”问题(训练集之外的数据)
接下来,研究人员创造了一个虚构的医学世界,其中包含了一些前所未见的、由人工合成的药物和疾病,没有任何人见过它们,包括 AI 在内。
- 结果: 突然之间,这本“教科书”变成了超能力。如果没有它,AI 的表现就像随机瞎猜(像抛硬币一样);有了数据库,AI 几乎能拿到 100% 的正确率。
- 类比: 现在,想象你问学生关于一个昨天才被发现的虚构星球的问题。她从未听说过它。如果你给她一张该星球的地图,她就能完美回答。如果没有,她就彻底迷失了。
- 发现: 只有当事实是 AI 完全陌生的时候,数据库才会发挥作用。如果这个事实不在 AI 的记忆中,数据库就是寻找它的唯一途径。
3. “混合测试”
研究人员还测试了一个混合情况:既有 AI 已知的题目,也有它不知道的题目。
- 结果: 对于“已知”的问题,AI 靠自己就能答对(数据库没有任何作用)。但对于“未知”的问题,数据库将不及格的分数变成了满分。
- 教训: 数据库的价值是受限于新颖性(novelty)的。只有当事实处于 AI 的训练范围之外时,它才会产生回报。
4. 关于“高分”的纠正
论文还对一项声称 AI 在医学领域表现惊人的近期研究进行了“侦探式”的调查。
- 问题: 那项研究报告了一个非常高的分数(大约 100 分中的 88 分)。
- 修正: 研究人员发现,这个分数是基于一个“小抄版”的测试(即较简单的题目),并且评分软件存在一个导致所有人得分都偏低的漏洞。当他们修复了漏洞并使用完整的、高难度的测试时,最高分降到了 47 分左右。
- 启示: 即便是“最聪明”的 AI 目前也并不完美,我们需要谨慎衡量它们的成功。
5. “聪明图书管理员”系统
研究人员构建了一个 AI 扮演图书管理员的系统。
- 运作方式: AI 不仅仅是阅读一段长文本,而是向数据库提出具体的、结构化的问题(类似于精确的搜索查询)。
- 效率: 如果 AI 发现了一个新事实,它会将其记录在数据库中,这样就不需要再次询问。这就像图书管理员在目录中编写一条新条目一样。一旦事实进入了目录,AI 就可以立即找到它,而不需要每次都进行繁重的“思考”。
核心结论
论文最后为任何在现实生活中使用 AI 的人总结了一条简单的规则:
不要费劲把你的 AI 连接到一个你在 Google 上就能搜到的公共事实数据库上;AI 已经知道它们了。
然而,如果你拥有私有的、全新的或机构性的数据(例如某家特定医院最近的记录,或昨天刚获批的新药),将它连接到一个结构化数据库中将是一个游戏规则的改变者。 这是唯一能让“教科书”真正帮助学生通过测试的时候。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。