← 最新论文
💻 computer science

SciClaimSeekers at CheckThat! 2026: Retrieving Scientific Sources for Social Media Claims with LLM Reranking

本文中提出的 SciClaimSeekers 系统通过采用结合了 BM25 与多语言 E5 并辅以倒数排名融合(Reciprocal Rank Fusion)的混合检索流水线,随后进行 Qwen2.5-14B-Instruct 重排序,解决了验证社交媒体科学主张的挑战,该系统在 CLEF-2026 CheckThat! Task 1 测试集上实现了 64.39% 的 MRR@5,并证明了此类精心构建的流水线可以媲美微调方法。

原作者: Mohotarema Rashid, Nansu Baniya, Anirban Saha Anik, Xiaoying Song, Lingzi Hong

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohotarema Rashid, Nansu Baniya, Anirban Saha Anik, Xiaoying Song, Lingzi Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一座巨大且混乱的图书馆,任何人都可以站在高塔顶端大声喊出一个所谓的“事实”。有时,这些喊叫是真实的,但更多时候,它们只是谣言或是对真实科学的误解。问题在于,当人们在社交媒体上分享这些科学观点时,很少会把那本原始书籍或专家的报告也一并带过来。这就像有人说:“我读到过吃西兰花能给你超能力,”却拒绝告诉你他是从哪本书里读到的。这使得很难核实这个说法是真的,还是仅仅是一个编造出来的神话。科学家和事实核查人员需要一种方法来寻找这些主张的“源代码”——即隐藏在海量学术写作中的那篇实际研究论文。这就是“来源检索”(source retrieval)的挑战:将一条杂乱、非正式的社交媒体帖子,与它试图讨论的那篇特定的、正式的科学论文联系起来。

你即将阅读的这篇题为**《SciClaimSeekers at CheckThat! 2026》**的论文,描述了一个旨在解决这一精确谜题的巧妙新系统。研究人员创建了一个名为 SciClaimSeekers 的数字侦探团队。你可以将这个系统看作是一个三步走的流程,旨在从 10,000 篇科学论文组成的图书馆中找到正确的那本书。首先,它同时使用两个不同的“搜索引擎”:一个寻找精确的词汇匹配(就像因为书名里有“西兰花”这个词而找到一本书);另一个则理解句子的“含义”(就像即使没有出现“西兰花”这个词,也能通过讨论“超能力”来找到一本书)。第二步,它将来自这两个搜索引擎的列表合并,从而创建一个更短的、包含最可能候选对象的单一列表。最后,也是最重要的一步,它使用一个强大的人工智能(AI)大脑来逐一阅读社交媒体帖子及其排名前列的候选对象,并询问:“这就是这条帖子所谈论的那篇论文吗?”并给出一个评分。

该团队发现,这个“AI 大脑”步骤才是真正的魔力所在。虽然前两步有助于缩小范围,但 AI 重排序(reranking)步骤显著提升了系统的成功率。在一组社交媒体帖子的测试集中,他们的系统在约 64.39% 的情况下,能在前五个猜测中正确识别出正确的科学论文。这是一个巨大的飞跃——比仅使用简单的词汇匹配搜索引擎的效果提高了约 13.6 个百分点。结果表明,在细致的逐步流水线中使用这些大型预训练 AI 模型,是验证科学主张的一种非常强有力的方法,甚至无需从头开始训练定制的 AI。该系统非常有效,在一次重大的国际竞赛中排名第 11 位(共 37 支队伍),这证明了这种结合了简单搜索与智能 AI 阅读的混合模式,在将社交媒体的噪音与科学真相联系起来方面表现出色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →