← 最新论文
🤖 machine learning

Data filtering methods for training language models

本文对置信度学习与数据集制图在检测俄语文本分类数据集标签错误方面进行了比较分析,结果表明,尽管两种方法均优于随机剔除,但其提升模型性能的有效性高度依赖于数据集规模与噪声水平,其中置信度学习在小型高噪数据集上能带来显著增益。

原作者: Egor Shevchenko, Elena Bruches

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Egor Shevchenko, Elena Bruches

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教机器人理解人类语言。你给它一本充满示例和答案的厚重教科书。但这里有个问题:教科书中的某些答案是错误的。也许一句本应标记为“快乐”的句子被意外标成了“愤怒”,或者一个语法正确的句子被标记为“错误”。

如果你用一本充满错误的教科书来教导机器人,它也会学会这些错误。这就是标签噪声问题。

这篇论文就像是对三本用于训练人工智能的俄语教科书(数据集)进行的质量控制检查。作者 E. Shevchenko 和 E. Bruches 测试了两种不同的“侦探工具”,以便在机器人开始学习之前找出并剔除不良示例。

以下是他们实验及其发现的一个简明分解:

两位侦探

研究人员比较了两种自动查找错误的方法:

  1. “第二意见”侦探(可信学习):

    • 工作原理: 想象你让一名学生参加测试。然后,你将这名学生分成四组,让每组给其他组的答案评分。如果根据其他组的评分,某位学生在特定问题上 consistently 答错,但答案键却显示他们答对了,那么“第二意见”侦探就会将其标记为答案键中可能的错误。
    • 风格: 它很彻底,但也具有攻击性。它信任模型预测的共识。
  2. “学习习惯”侦探(数据集绘图):

    • 工作原理: 这位侦探观察学生随时间的学习过程。如果学生在特定问题上反复出现“答对、答错、再答对”的情况,或者在多次学习后似乎仍对此感到困惑,侦探就会将其标记为“棘手”。它关注的是模型置信度随时间的变化。
    • 风格: 它更为谨慎。它只剔除模型 consistently 难以学习的示例。

三本教科书(数据集)

他们在三个截然不同的俄语数据集上测试了这些侦探:

  • 《大书》(ru_emotion_e-culture): 一个包含 49,000 篇情感论坛帖子的庞大合集。它体量巨大,且整体质量较高。
  • 《中书》(RuCoLA): 一个包含 8,500 个句子的合集,用于检查语法是否正确。它体量中等,但颇具挑战性,因为“正确性”可能是主观的。
  • 《小书》(TERRa): 一个仅包含 2,300 对句子的微小合集,用于检查一个句子是否蕴含另一个句子。它体量很小,且被怀疑杂乱无章。

发生了什么?(结果)

1. 《大书》:“勿改未坏之物”
在这个庞大的数据集上,教科书本身已经相当不错。

  • 结果: 当侦探们剔除它们发现的“不良”示例时,机器人在任务上的表现实际上略微变差了。
  • 启示: 当你拥有海量数据时,机器人足够聪明,可以自行忽略少数坏苹果。剔除它们只是让书变薄了,却并未使其变得更好。

2. 《中书》:“优于随机,但非完美”
在这个中等规模的数据集上,两位侦探都发现了许多错误(约占全书的 15–18%)。

  • 结果: 剔除这些错误并没有让机器人变得完美,但它确实使机器人的表现优于你随机扔掉相同数量书页的情况
  • 启示: 侦探们确实找到了真实的错误,而不仅仅是在猜测。然而,数据集仍然过于嘈杂,或者任务过于困难,以至于仅靠清洗数据无法带来巨大的性能飞跃。

3. 《小书》:“清洗的魔力”
这是最引人注目的结果。这个小数据集被怀疑非常杂乱。

  • 结果: “第二意见”侦探发现35%的书页是错误的!当他们剔除这些不良示例后,机器人的性能显著提升
  • 对比: 如果他们只是随机扔掉 35% 的书页,机器人将会彻底失败。但因为他们是剔除了特定的不良示例,机器人变得聪明了许多。
  • 启示: 对于小型且杂乱的数据集,查找并剔除错误是颠覆性的改变。

核心结论

该论文得出结论:不存在“放之四海而皆准”的解决方案。

  • 如果你拥有巨大且干净的数据集,你无需浪费时间进行过滤;人工智能足以应对噪声。
  • 如果你拥有小型且杂乱的数据集,使用像“可信学习”这样的工具来清洗数据至关重要。这就像清理一个狭小且泥泞的房间:如果你不除去泥泞,你就无法看清地板。

作者还指出,“学习习惯”侦探(数据集绘图)更安全,不太可能意外剔除好的示例;而“第二意见”侦探(可信学习)则更具攻击性,在小型数据集中更能发现最严重的错误。

简而言之: 清洗数据就像抛光透镜。如果透镜本身已经清晰且巨大,再多抛光一点也无济于事。但如果透镜很小且覆盖着泥泞,清洗它就是看清事物的唯一途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →