Decide less, communicate more: On the construct validity of end-to-end fact-checking in medicine
本立场论文认为,由于在将现实世界的主张与科学证据相联系方面存在根本性挑战,端到端的事实核查系统并不适用于医学领域,因此主张将事实核查重新构想为一个交互式沟通过程。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和日常类比对论文《少做决定,多作沟通》的解释。
核心理念:为何“事实核查”医学比你想的更难
想象一下,你正在试图制造一个像超级图书管理员一样的机器人。它的工作很简单:你向它提出一个关于健康的问题(比如,“吃葡萄柚会阻止我的抗癫痫药起作用吗?”),它会立即查阅全世界的医学书籍,找到答案,并给你一个清晰的“是”、“否”或“可能”。
这篇论文认为,我们一直在用错误的方式制造这个机器人。 我们一直把医学事实核查当作多项选择题,让机器人只需选出一个答案。作者们指出,这种方法行不通,因为现实生活中的健康问题错综复杂、令人困惑,而且往往无法通过严格的科学规则来回答。
我们需要的不是一个仅仅决定答案的机器人,而是一个像医生那样与你交流的机器人。
实验:请专家来玩这个游戏
为了弄清楚为什么当前这种“机器人图书管理员”的方法行不通,作者们没有只是编写代码,而是聘请了五位真正的医学专家(医生和研究人员)来扮演机器人的角色。
他们向这些专家提供了:
- 真实的问题:普通人在 Reddit 上发布的问题(例如,“菠萝汁能帮我治疗鼻窦炎吗?”)。
- 一份包含 10 项科学研究(随机对照试验)的清单,由计算机检索出与问题相关的内容。
- 任务:阅读这些研究,判断 Reddit 上的问题是真还是假,并解释原因。
结果如何? 专家们无法达成一致。即使面对相同的证据,他们也得出了不同的答案。这证明了我们要自动化事实核查的现有方法存在根本性缺陷。
三大难题(“为何失败”部分)
该论文指出了为什么简单的“是/否”机器人在医学领域行不通的三个主要原因:
1. “缺失拼图”问题(无法验证的声明)
类比:想象你问一位侦探:“是管家偷了花瓶吗?”但侦探没有任何证据,因为管家从未进过那个房间。侦探不能说“是”或“否”;他们必须说:“我无法核实这一点。”
现实:许多人在网上提出的健康问题都是无法验证的。
- 有些问题涉及不道德的测试(例如,“吸烟会导致癌症吗?”我们不能开展一项强迫人们吸烟的研究)。
- 有些问题过于具体(例如,“葡萄柚会与这位特定患者的这种特定药物发生相互作用吗?”)。不存在针对这种确切组合的研究。
- 发现:在这项研究中,专家们经常不得不表示:“没有相关证据。”一个试图强行贴上“真/假”标签的机器人会在此出错。
2. “模糊问题”问题(未充分说明的声明)
类比:想象你问一位机械师:“我的车发出噪音。”机械师无法修理,因为他们不知道是哪辆车、什么噪音,或者何时发生。如果机械师猜测,他们可能会修理刹车,而问题其实出在发动机上。
现实:社交媒体上的人们会提出模糊的问题。
- 例如:“草药有助于调节我的周期。”“调节”是什么意思?是指停止月经?让周期变短?还是缓解痛经?
- 研究中的专家们对此有不同的解读。一位认为这意味着“停止月经”,另一位则认为意味着“让周期变得规律”。
- 发现:由于问题如此模糊,“答案”会根据当事人实际想表达的意思而改变。一个不寻求澄清的机器人会给出错误的答案。
3. “主观真理”问题(严重性分级)
类比:想象一位老师给学生的作文打分。一位老师认为一个小语法错误是"C"。另一位老师认为那是"B"。两位都是对的,但他们的标准不同。
现实:即使专家们在事实上一致,他们在错误的严重程度上也会存在分歧。
- 例如,有人说:“菠萝汁能快速治愈鼻窦炎。”
- 专家 A 说:“这大体上是真的,只是可能没那么快。”(标签:部分支持)。
- 专家 B 说:“这是危险的错误信息,因为它暗示了快速治愈。”(标签:反驳)。
- 发现:不存在唯一的“正确”标签。这取决于专家的哲学观点以及他们认为患者面临多大的风险。
解决方案:“医患”对话
既然一个仅仅决定答案的机器人正在失败,作者们提出了一个新模型:交互式对话。
系统不应像机器人那样说“你的声明是错误的”,而应像医生与患者交谈那样运作。
它是如何运作的:
- 寻求澄清:如果患者说“草药有助于调节我的周期”,系统会问:“你所说的‘调节’是什么意思?是指停止它还是让它变得规律?”
- 引导搜索:如果患者询问无法直接测试的内容(例如不道德的实验),系统会说:“我们无法直接测试这一点,但以下是我们在类似情况下的所知。”
- 展示不同观点:系统不强行贴上唯一的“真/假”标签,而是解释:“一些专家认为这是一个小问题,而另一些人则认为它有风险。以下是他们存在分歧的原因。”
结论
该论文得出结论:医学事实核查不是一个数学问题;它是一场对话。
试图将复杂、混乱的人类健康问题强行塞进一个简单的“真/假”框中,就像试图把方形的钉子塞进圆形的孔里。这行不通,而且会导致困惑。
要解决这个问题,我们需要停止尝试构建仅仅决定答案的系统,转而开始构建能够与用户沟通以理解他们真正需求的系统。正如标题所说:少做决定,多作沟通。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。