← 最新论文
💻 computer science

Memory or Generalization? Temporal Probing of Data Contamination in Bengali LLM Benchmarks

本文引入了“时间探测”(temporal probing),这是一种利用难度匹配且在截止日期之后发布的题目来进行直接有效性测试的方法,旨在衡量孟加拉语大语言模型基准测试中的数据污染情况,研究发现尽管静态翻译测试集广泛存在,但目前模型在 BoolQ-bn 数据集上并未表现出由记忆效应导致的显著性能膨胀。

原作者: Md Fahim Faisal Tanha

发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Fahim Faisal Tanha

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,研究人员依靠测试来衡量一个计算机程序的智能化程度。这些被称为“基准测试”(benchmarks)的测试,就像是机器的标准化考试。长期以来,这些考试一直是用英语编写的。随着技术的增长,开发者们将这些英语测试翻译成其他语言,以观察他们的程序对世界多种语言的理解能力。其中最重要的测试语言之一是孟加拉语,约有四分之一亿人使用这种语言。然而,这些翻译后的测试面临着一个阴影。由于互联网极其庞大,这些考试的文本往往会最终进入教导这些程序如何说话的海量数据库中。如果一个程序在训练期间已经阅读过这些考试题目,那么当它正确回答时,它并不是在展示其真正的智能,而仅仅是在回忆它之前见过的答案。这个问题被称为“数据污染”(data contamination),它使得人们很难判断高分是因为程序具备实际能力,还是仅仅因为记忆力好。

一位名叫 Md Fahim Faisal Tanha 的研究人员致力于为孟加拉语语言模型解开这个谜团。他没有试图去猜测一个模型是否见过某个问题,而是将“时间”作为寻找真相的工具。他意识到,如果一个模型的训练数据截止到某个特定日期,那么它绝不可能知道该日期之后发布的任何内容。为了测试这一点,他采用了现有的旧版孟加拉语考试题目,并利用 2025 年和 2026 年出版的新闻文章和试卷,创建了全新的、难以匹配的问题。这些新问题经过精心设计,难度与旧题相当,但由于它们是在模型停止学习之后编写的,因此可以保证模型从未见过。通过比较模型在旧问题和新问题上的表现,他可以观察旧题的分数是否因记忆而虚高。

这项研究针对七种不同规模(从小型到中型)的开源语言模型进行了研究,并对八十四组对比问题进行了测试。结果令业界感到非常欣慰。对于大多数模型而言,它们在旧问题上的得分与在新的、未见过的题目上的得分几乎完全相同。这表明这些模型并非在死记硬背旧的考试,而是在利用它们对语言的理解来解决问题。发现的最大差异仅为约 8 个百分点的微小差距,统计分析显示,这很可能只是随机噪声,而非数据污染的迹象。换句话说,目前这些孟加拉语模型的得分看起来是可靠的。

有一个有趣的例外,为研究人员提供了关于如何设计这些测试的宝贵教训。其中一个模型——Qwen 系列的一个大型版本——在处理全新的问题时,表现实际上比处理旧问题时要好得多。起初,这看起来很奇怪,但研究人员意识到这并不是数据污染的迹象。相反,这意味着对于该特定模型而言,新问题比旧的翻译题目更容易回答。旧题目需要复杂的推理能力,而该模型对此感到吃力;而新题目则更多是直观的事实。随着研究人员改进匹配过程,这一差距缩小了,这证明最初的差异是测试设计的缺陷,而非模型性能的缺陷。这一发现强调了使用时间来检查数据污染的新方法不仅强大到足以识别记忆,还能识别出细微的难度不匹配。

最终,这项工作为孟加拉语人工智能界提供了一种验证结果的实用方法,而无需依赖昂贵的工具或复杂的猜测游戏。通过使用一种简单的、免费的方法来对比新旧问题,研究人员现在可以更加确信,他们的的高分反映的是真正的智能。研究结论指出,对于所测试的模型而言,基准测试是有效的,且得分是真实的。随着未来出现更新、更强大的模型,同样的方法可以被用来确保所报告的进展是基于真实的能力,从而保持该领域的诚实,并在坚实的基础上不断前进。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →