想象一下,互联网就像一座巨大且混乱的图书馆,任何人都可以站在高塔顶端大声喊出一个所谓的“事实”。有时,这些喊叫是真实的,但更多时候,它们只是谣言或是对真实科学的误解。问题在于,当人们在社交媒体上分享这些科学观点时,很少会把那本原始书籍或专家的报告也一并带过来。这就像有人说:“我读到过吃西兰花能给你超能力,”却拒绝告诉你他是从哪本书里读到的。这使得很难核实这个说法是真的,还是仅仅是一个编造出来的神话。科学家和事实核查人员需要一种方法来寻找这些主张的“源代码”——即隐藏在海量学术写作中的那篇实际研究论文。这就是“来源检索”(source retrieval)的挑战:将一条杂乱、非正式的社交媒体帖子,与它试图讨论的那篇特定的、正式的科学论文联系起来。
你即将阅读的这篇题为**《SciClaimSeekers at CheckThat! 2026》**的论文,描述了一个旨在解决这一精确谜题的巧妙新系统。研究人员创建了一个名为 SciClaimSeekers 的数字侦探团队。你可以将这个系统看作是一个三步走的流程,旨在从 10,000 篇科学论文组成的图书馆中找到正确的那本书。首先,它同时使用两个不同的“搜索引擎”:一个寻找精确的词汇匹配(就像因为书名里有“西兰花”这个词而找到一本书);另一个则理解句子的“含义”(就像即使没有出现“西兰花”这个词,也能通过讨论“超能力”来找到一本书)。第二步,它将来自这两个搜索引擎的列表合并,从而创建一个更短的、包含最可能候选对象的单一列表。最后,也是最重要的一步,它使用一个强大的人工智能(AI)大脑来逐一阅读社交媒体帖子及其排名前列的候选对象,并询问:“这就是这条帖子所谈论的那篇论文吗?”并给出一个评分。
该团队发现,这个“AI 大脑”步骤才是真正的魔力所在。虽然前两步有助于缩小范围,但 AI 重排序(reranking)步骤显著提升了系统的成功率。在一组社交媒体帖子的测试集中,他们的系统在约 64.39% 的情况下,能在前五个猜测中正确识别出正确的科学论文。这是一个巨大的飞跃——比仅使用简单的词汇匹配搜索引擎的效果提高了约 13.6 个百分点。结果表明,在细致的逐步流水线中使用这些大型预训练 AI 模型,是验证科学主张的一种非常强有力的方法,甚至无需从头开始训练定制的 AI。该系统非常有效,在一次重大的国际竞赛中排名第 11 位(共 37 支队伍),这证明了这种结合了简单搜索与智能 AI 阅读的混合模式,在将社交媒体的噪音与科学真相联系起来方面表现出色。
技术摘要:CheckThat! 2026 中的 SciClaimSeekers
问题陈述
科学性主张在社交媒体上的传播速度往往快于其验证速度,然而社交媒体帖子很少链接到其原始的学术来源。这为自动化事实核查系统带来了显著挑战。由于“确认偏误”(即用户倾向于支持符合其既有信念的信息)以及非正式、充满术语的社交媒体话语与正式科学文献之间的结构性失配,这一问题变得更加复杂。此外,用户生成的内容经常对研究结果进行改写或进行模糊引用,而非使用标准化的引用方式,这使得识别原始科学来源变得困难。CheckThat! 2026 Task 1 特别针对社交媒体主张的科学来源检索进行了设计,要求系统将社交媒体帖子映射到固定库中的 10,000 篇科学论文。
方法论
作者提出了 SciClaimSeekers,这是一个旨在弥合嘈杂的社交媒体帖子与正式科学摘要之间差距的三阶段“检索-再排序”(retrieve-then-rerank)流水线。该系统的运行流程如下:
第一阶段检索(混合式): 两个互补的检索器在由 10,000 篇论文(由标题和摘要拼接而成)组成的索引库上并行运行:
- 稀疏检索: 使用 BM25 (Okapi) 来捕捉词法信号,例如命名实体和数值。输入经过预处理以去除噪声(URL、提及、标点符号)并进行归一化。
- 稠密检索: 使用 multilingual-e5-large-instruct 模型(基于 XLM-RoBERTa)。该模型采用指令前缀来区分查询(query)与文档(document),将社交媒体帖子视为检索相应科学论文的查询。它利用最终隐藏状态的平均池化和 L2 归一化,通过 FAISS 索引进行余弦相似度匹配。
- 融合: 两个检索器各返回其前 100 个候选对象。这些列表使用平滑常数 k=60 的 倒数排名融合(Reciprocal Rank Fusion, RRF) 进行合并,生成统一的前 50 个候选集。
第二阶段再排序(LLM): 融合后的前 50 个候选对象使用 Qwen2.5-14B-Instruct(一种开源大语言模型)进行再排序。
- 方法: 该模型被用作 零样本逐点交叉编码器(zero-shot pointwise cross-encoder)。与列表式(listwise)方法不同,每个(社交媒体帖子,候选论文)对都是独立评分的。
- 提示词工程: 系统指示 LLM 扮演科学来源识别者的角色,输出一个 0 到 10 之间的整数相关性分数,表示该帖子引用特定论文的可能性。
- 输出: 候选对象按 LLM 分数进行排序(若分数相同,则通过第二阶段的 RRF 分数打破平局),最后返回前 5 个结果。
核心贡献
- 混合流水线性能: 作者提出了一种混合检索-再排序流水线,在 CheckThat! 2026 Task 1 英文测试集中取得了 第 11 名(共 37 支参赛队伍)的成绩。该系统在官方测试集上的 MRR@5 为 64.39%。
- LLM 在再排序中的主导地位: 研究隔离了每个阶段的贡献,确定了 LLM 交叉编码器是性能的主要驱动力。无论应用于 BM25 候选对象还是混合融合后的候选对象,Qwen2.5-14B 再排序器都提供了约 +10 MRR@5 点 的提升。这大约占到了相对于 BM25 基准线 +13.67 点 总提升额的三分之二。
- 泛化能力: 该系统展示了强大的泛化能力,开发集得分(64.36%)与测试集得分(64.39%)之间的差距仅为 0.03 个百分点,这表明调优决策能够很好地迁移到未见数据中。
结果与分析
基于平均倒数排名(MRR@5)、Hit@1 和 Hit@5 的评估结果如下:
- 基准线: 仅使用 BM25 的 MRR@5 约为 50%。稠密 E5 检索器将其提升了约 2 个点,而混合 RRF 融合又进一步增加了约 1.5 个点。
- 再排序比较: 传统的交叉编码器(bge-reranker-v2-m3)在开发集上表现出小幅增益,但在测试集上出现了过拟合,表现差于混合基准线。相比之下,生成式 LLM 再排序器(Qwen2.5-14B)带来了实质性且持续的增益。
- 效率与性能: 虽然 LLM 再排序器是计算瓶颈(在两块 A40 GPU 上处理测试集需约 11 小时),但作者指出该流水线是模块化的,可以在单个节点上端到端运行,这使其在离线或隐私敏感型部署中具有实用性。
意义与主张
论文声称,当集成到精细的流水线中时,大型预训练模型可以与微调方法相媲美,用于科学来源检索。具体而言,作者认为,使用强大的开源权重 LLM 进行逐点评分,可以作为训练特定任务再排序器的可靠替代方案。这项工作强调,虽然混合检索(结合稀疏和稠密信号)为召回率提供了必要的支撑,但排名质量的巨大飞跃是由 LLM 在再排序阶段的语义理解能力驱动的。该系统被呈现为一个开源、模块化的解决方案,有效地解决了将社交媒体主张链接到科学证据时固有的语言和结构失配问题。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。