← 最新论文
💬 NLP

VetScore: Risk-Weighted Fact Verification for Veterinary Long-Form QA with Citations

本文介绍了 VetScore,这是一个针对兽医长文本问答的风险加权评估框架,该框架在评估生成的陈述对原文片段的忠实度时,会根据其潜在危害性对陈述进行优先级排序,并实现了与专家判断的高度一致。

原作者: Ivan Kartáč, Jan Tovarys, Mateusz Lango, Ondřej Dušek

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Ivan Kartáč, Jan Tovarys, Mateusz Lango, Ondřej Dušek

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图破解谜题的侦探,但你的调查对象不是犯罪现场,而是一个由一个非常聪明、但有时过于自信的机器人所写下的长篇、详尽的故事。这个机器人是一个人工智能(AI),它读过数千本书,几乎可以回答你提出的任何问题。然而,在医学领域——无论是针对人类还是他们的毛茸茸、羽毛丰满或鳞片覆盖的朋友们——弄错一个事实不仅仅是拿个差分,而是会带来危险。如果机器人说一只狗需要特定剂量的药物,但它把数字弄错了,那只狗可能会生病。

为了阻止机器人编造事实,科学家们教会了它通过添加引用(就像小脚注一样指向它读过的原书)来“展示其推导过程”。这就像是机器人说:“我在这本书里读到了!”但棘手之处在于,仅仅因为机器人指向了一本书,并不意味着它真的读对了那一页,或者它是否正确理解了那个句子。有时候,机器人可能在谈论狗时却指向了一本关于猫的书,或者它可能凭空捏造了一个听起来像是书中内容但实际并不存在的句子。这正是真正的侦探工作开始的地方:我们需要一种方法,不仅去检查机器人是否引用了来源,还要检查它讲述的故事是否真的与来源相符,以及如果故事错了,后果会有多严重。

这正是论文《VETSCORE》所要解决的问题。研究人员与兽医专家合作,开发了一种新的工具来为这些 AI 生成的答案评分。他们意识到,并非所有的错误都是同等性质的。如果机器人弄错了一个日期(比如把研究发生在 2021 年说成 2022 年),这虽然很烦人,但狗通常不会因此受伤。但如果机器人弄错了心脏药物的剂量,那就是一场灾难。因此,他们创建了一个系统,该系统不仅仅是计算错误的数量,还会对错误进行加权。他们将 AI 的长篇回答分解成微小的、一口大小的事实。然后,针对每个事实,他们提出两个问题:“机器人确实从它引用的书中找到了这个信息吗?”以及“如果这个信息错了,会造成多大的伤害?”最后,他们将这些答案合并为一个综合得分,告诉我们 AI 给出的建议究竟有多安全和可靠。

团队通过让 AI 模型生成针对真实兽医问题的答案,然后让人类专家(兽医和学生)对相同的答案进行评分,以此测试了这个系统。他们发现,即使使用更小、更快的 AI 模型来进行评分,他们的新型“VETSCORE”工具也能很好地匹配人类专家的判断。结果表明,通过关注错误的“风险”而非仅仅是错误的“数量”,我们可以为高风险领域(如兽医学)建立一种更安全的 AI 检查方式。这就像是有一位安全检查员,他不仅统计墙上有多少块砖头松动,还会专门检查那些支撑着屋顶的砖头是否稳固。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →