← 最新论文
💬 NLP

Team DACTYL at PAN 2026: Bayesian Data Mixing and Empirical X-risk Minimization for AI-text Detection

DACTYL 团队通过采用贝叶斯数据混合进行数据集策展以及经验性风险最小化,解决了 AI 文本检测中的分布外性能差距问题,并凭借一个在 PAN 2026 测试集上获得 0.974 平均分、经过 MCGrad 校准的 ModernBERT-large 模型,取得了排行榜顶尖排名。

原作者: Shantanu Thorat

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Shantanu Thorat

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图识破伪造画作的侦探。你通过多年研究特定的伪造画廊,已经能够瞬间辨别出一件新作品是否属于该画廊。但当伪造者更换了工作室、使用了不同的画笔,或者采用了完全不同的绘画风格时,会发生什么?突然间,你敏锐的眼光可能会失效,这并不是因为你不够聪明,而是因为你学习了错误的线索——比如第一家画廊特有的某种特定画框或奇怪的污迹。这就是“AI文本检测”问题的核心。科学家们正在构建计算机程序来阅读文本,并判断它是人类写的还是由机器人(大语言模型)生成的。问题在于,这些程序往往过于擅长捕捉训练数据中特定的“机器人指纹”,以至于当机器人开始以新的方式写作时,程序就会感到困惑。如果我们无法分辨其中的区别,我们可能会在无意中信任假新闻,或者错过真正的真人创意。一个大问题是:我们如何训练我们的数字侦探,让它们真正变得聪明,而不仅仅是擅长记忆过去?

于是,出现了 DACTYL 团队,这是一群决定为 PAN 2026 竞赛解决这一问题的研究人员,这是一场针对 AI 检测器的高水平竞赛。他们并没有只是向问题中投入更多的数据,而是尝试了一种巧妙的多步策略,感觉有点像在派出重型火炮之前,先训练一支侦察兵小队。

首先,他们意识到仅仅将不同的数据集混合在一起并不总是有效;有时,这只会让模型产生“捷径学习”(shortcut learning),即 AI 找到了一个简单的技巧来通过测试作弊,而不是学习真正的教训,从而导致模型产生困惑。为了解决这个问题,他们构建了一个全新的大规模数据集 DACTYLv2。可以把它想象成一个巨大的故事图书馆,由人类和各种 AI 模型编写,涵盖了从电影剧本到经济论文的所有内容。但他们并没有只是把所有这些书都扔进训练堆里。他们知道有些书是“坏分子”——那些看起来像 AI 但实际上是人类写的文本,或者反之亦然,亦或是纯粹的异常值,会干扰训练。

为了过滤掉这些“坏分子”,他们使用被称为 Bayesian BERT-tiny 的微型、轻量化 AI 模型创建了一支特殊的“侦察兵”团队。这些侦察兵很特别,因为他们不仅给出“是”或“否”的答案,还会告诉你他们有多“确定”。想象一下,一名侦察兵说:“我觉得这是机器人的作品,但我不是 100% 确定,”对比另一名说:“我非常肯定这是机器人的作品。”该团队利用这些置信度水平来做出明智的决策。如果一段文本让侦察兵感到困惑(高不确定性),或者如果侦察兵虽然很确定但结果错了(低不确定性但错误答案),他们就会剔除该文本。他们只保留了侦察兵们达成共识的“黄金”文本,从而创造了一个超洁净、高质量的训练集。

一旦拥有了这个纯净的图书馆,他们便训练了两名强大的“重量级”侦探:ModernBERT-largeDeBERTa-V3-large。这些模型比侦察兵更大、更聪明。但转折在于:该团队并没有只是让这些大模型进行猜测。他们使用了一种名为**经验风险最小化(Empirical X-risk Minimization, EXM)**的技术。EXM 教导模型的目标不仅仅是尽可能获得正确答案,而是要非常擅长区分那些“困难”案例——即那些看起来与人类和机器人文本非常相似的棘手文本。这就像是在训练一名侦探,不仅要能识别明显的伪造品,还要能识别出那些几近完美的伪造品。

对于最后的绝招,他们添加了一位名为 MCGrad 的“校准教练”。即使是聪明的侦探也可能会过度自信。有时,一个模型可能会说:“我有 99% 的把握这是机器人的作品,”而实际上它只有 60% 的把握。MCGrad 教练会观察来自微型侦察兵的不确定性信号,并调整大模型的置信度评分,使其更加诚实。这就像一位教练告诉一位充满自信的运动员:“你很棒,但不要把你的全部薪水都押在这上面。”

结果如何?该团队的策略取得了圆满成功。经过 MCGrad 教练指导后的 ModernBERT-large 模型,在最终测试中取得了 0.974 的惊人平均分。这足以让他们在排行榜上获得第二名,击败了许多其他团队,甚至在多个类别中超过了去年的冠军。有趣的是,他们的另一个大模型 DeBERTa-V3-large 虽然整体准确率略低(得分为 0.882),但在识别特定“机器人”文本方面表现得极其出色,这表明不同的策略具有不同的优势。

该论文指出,击败 AI 检测器的关键不在于使用更大的计算机或更多的数据,而在于对你使用的数据进行极其谨慎的筛选。通过使用带有不确定性的微型模型来过滤噪声,然后训练大模型专注于最困难的案例,DACTYL 团队证明了精心的策划可以带来更难被欺骗的检测器。虽然他们的方法并非在所有测试中都能完美运作(一些新型的 AI 文本仍然会让它们出错),但这证明了这种智能的、分层的方法是一种强大的手段,可以让我们数字世界保持诚实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →