← 最新论文
💬 NLP

RegCheck: A tool for structured comparisons between study registrations and papers

本文介绍了 RegCheck,这是一种模块化的、由大语言模型辅助的工具,旨在通过结合人工智能的效率与人类的专业知识,以增强科学透明度与可重复性,从而促进研究注册与已发表论文之间的结构化对比。

原作者: Jamie Cummins, Beth Clarke, Ian Hussey, Malte Elson

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jamie Cummins, Beth Clarke, Ian Hussey, Malte Elson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探。嫌疑人(一项科学研究)留下了两个线索:一个是犯罪发生前写下的计划(研究注册文件),另一个是犯罪发生后写下的故事(发表的论文)。核心问题在于:嫌疑人是否遵守了计划,还是为了让故事看起来更完美而偷偷进行了隐秘的修改?

多年来,检查这两个线索就像是在戴着厚厚的冬手套试图在一堆干草中寻找一根特定的针。这既缓慢、枯燥,又需要超人类级别的专注力。因为这太难了,大多数侦探(审稿人和编辑)干脆跳过了这项检查,寄希望于嫌疑人是诚实的。但正如本文作者所指出的,这是一种冒险的赌博。

于是,RegCheck 出场了——这是一个旨在帮助侦探在不职业倦怠的情况下完成工作的数字助手。

为什么不直接问机器人?

你可能会想:“等等,我们不能直接把两份文件上传到一个高级聊天机器人里,然后问它进行对比吗?”作者说不行,原因如下:

  1. “魔杖”问题: 如果你要求一个标准的聊天机器人对比两段文本,答案会取决于你如何提问、机器人的心情,甚至它早餐吃了什么。今天它可能说“完全匹配”,明天它可能说“完全不同”。这对于追求一致性的科学领域来说是不可接受的。
  2. 隐私泄露: 将秘密的、尚未发表的研究论文上传到公共聊天机器人,就像是在拥挤的广场上大声喊出你的秘密配方。运行机器人的公司可能会保留你的数据,用于训练他们未来的机器人。
  3. 记忆陷阱: 聊天机器人会记得你在对话早期说过的话。如果机器人对“假设”部分产生了困惑,这种困惑可能会蔓延,导致它误认为“结果”部分也有问题,即便实际上并没有。错误会像多米诺骨牌一样堆积起来。
  4. “幻觉”风险: 聊天机器人喜欢编造事实。如果它们找不到答案,可能会直接发明一个并表现得非常自信。你必须亲自阅读整篇论文来核实机器人是否在撒谎,这反而抵消了使用机器人的初衷!

智能解决方案:RegCheck

作者并没有只是让机器人去“做这件事”,而是构建了 RegCheck,它的工作模式更像是一条带有高级技术且由人类监督的高科技流水线。它使用了一个名为 IDEA(摄取、定义、提取、裁定)的特殊框架,将任务分解为微小且易于管理的步骤:

  • 摄取 (Ingestion - 图书管理员): 它获取“计划”和“故事”,并对其进行清理,确保文本已准备好被阅读。
  • 定义 (Definition - 老板): 一位人类专家(也就是你!)告诉系统要寻找什么。也许你关心的是样本量,或者是特定的药物剂量。你是老板;机器人不会决定什么才是重要的。
  • 提取 (Extraction - 扫描仪): 系统不再阅读整本书,而是使用一种“智能荧光笔”(称为嵌入/embeddings)来寻找“计划”和“故事”中仅有的与你的指令相匹配的特定句子。它会提取出精确的引文,就像侦探将证据钉在软木板上一样。
  • 裁定 (Adjudication - 法官): 只有在最后这一步,机器人(大语言模型)才会介入。它查看系统找到的具体引文,并判断:“它们匹配吗?”它会给出一个判决:偏差(他们更改了内容)、无偏差(他们遵守了计划)或证据不足(由于信息缺失,我们无法判断)。

实战演练

作者使用了一项关于糖尿病药物的虚假临床试验对该系统进行了测试。以下是 RegCheck 的发现:

  • 好的方面: 它确认了药物剂量、随机化方法和开始日期都与计划完全一致。
  • 坏的方面(那些狡猾的行为):
    • 结局指标的切换: 计划中说他们将测量血糖水平的变化(一个数值),但论文报告的是血糖改善人数的百分比(一个是非题)。这是一种经典的套路,旨在让结果看起来更强有力,而 RegCheck 瞬间识破了这一点。
    • 规则的收紧: 计划中说,如果肾脏问题患者的数值低于 30,则将其排除在外。而论文中说,他们排除了任何数值低于 45 的人。虽然这只是一个微小的数字变化,但它可能意味着他们通过剔除更重的病人来让药物看起来更安全。人类可能会忽略这一点,但 RegCheck 标记了它。
    • 提前退出: 计划说他们想要 300 人,但他们在 212 人时就停止了。RegCheck 抓住了这种“招募不足”的偏差。

我们有多确定?

作者非常有信心 RegCheck 让整个过程变得更快、更容易,但他们也诚实地表示目前它还不完美。

  • 他们没有证明 RegCheck 达到了 100% 的准确率。
  • 他们没有声称它能取代人类专家。事实上,他们强调人类必须保持在流程之中,以做出最终决定。
  • 他们认为 RegCheck 在寻找“干草堆中的针”方面表现得非常好,但也承认它可能会犯错(例如,将一个并非问题的变化标记为问题,或者漏掉一个微妙的变化)。
  • 他们目前正在进行测试,以观察其与人类专家的吻合程度。他们的目标是让 RegCheck 与人类达成共识的程度,达到人类彼此之间达成共识的水平。

总结

RegCheck 并不是一个能一夜之间解决所有科学问题的魔杖。它是一个工具,旨在降低准入门槛。它将原本需要数小时枯燥阅读的任务,转变为几分钟内即可完成的快速、结构化的检查。

作者希望通过让这项检查变得简单,促使作者在提交论文前自行进行检查,并让审稿人在评审过程中真正执行这项检查。其核心在于确保当科学家说“我们完全按照计划行事”时,他们确实是这个意思。如果他们没做到?好吧,至少现在我们有了捕捉他们的手段。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →