← 最新论文
⚡ electrical engineering

Improving Requirements Classification with SMOTE-Tomek Preprocessing

本研究证明,将SMOTE-Tomek预处理与分层K折交叉验证相结合应用于PROMISE数据集,显著提升了功能性与非功能性需求分类的准确率,使逻辑回归的性能从58.31%的基线提升至76.16%。

原作者: Barak Or

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Barak Or

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位图书管理员,正试图将一大堆混杂的笔记分类到两个主要类别中:"系统必须做什么"(功能性)和“系统应如何表现"(非功能性,例如快速、安全或易于使用)。

问题在于这堆笔记杂乱无章。大多数笔记都关于“安全性”或“可用性”,但关于“可移植性”(将系统迁移到不同计算机)的笔记寥寥无几。如果你只是让计算机来整理这堆笔记,它会变得懒惰。它会因为“安全性”出现的频率最高,而几乎将一切都猜测为“安全性”。由于它没有见过足够多的罕见笔记来学习它们的特征,它会完全忽略这些稀有笔记。

本文旨在通过在进行分类之前先整理好这堆混乱的笔记,教会计算机如何成为一名更优秀的图书管理员。

问题:“类别不平衡”

研究人员使用了一个著名的包含 969 条软件笔记的集合(PROMISE 数据集)。

  • 问题所在: 笔记严重不平衡。某些类别有 125 条笔记,而其他类别仅有 12 条。
  • 结果: 在没有帮助的情况下,计算机的“大脑”(机器学习模型)会产生偏差。它变得擅长识别常见笔记,却极不擅长识别稀有笔记。在该研究中,标准的计算机模型仅能正确分类约 58% 的笔记。

解决方案:"SMOTE-Tomek"配方

为了解决这个问题,作者使用了一种名为 SMOTE-Tomek 的特殊两步清洁与平衡配方。这就像一位厨师在准备汤料时发现某些蔬菜缺失了。

  1. SMOTE(“合成厨师”):
    与其只是复印那几份稀有的笔记(这既枯燥又收效甚微),SMOTE 就像一位富有创造力的厨师。它观察两份相似的稀有笔记,并“烹饪”出一份全新的、虚构的笔记,使其恰好位于两者之间。

    • 类比: 如果你有两份笔记写着“系统必须快速”,SMOTE 会创建一份新笔记,写着“系统需要快速且响应灵敏”。它填补了空白,让计算机能看到足够的示例来学习模式。
  2. Tomek Links(“噪声过滤器”):
    有时,当你创建新笔记时,会不小心制造出一些令人困惑或混乱的笔记(例如一份听起来既像“安全性”又像“可用性”的笔记)。Tomek 就像一位严格的编辑。它会找出这些令人困惑的、处于边缘的笔记并将其丢弃,从而使类别更加清晰。

    • 类比: 如果一份笔记如此模糊,以至于可能属于两个不同的类别,编辑就会将其移除,以免计算机对其归属感到困惑。

实验:“公平测试”

研究人员并没有简单地将所有笔记扔进搅拌机。他们使用了一种名为 分层 K 折交叉验证 的方法。

  • 类比: 想象你有一副包含不同花色的扑克牌。你想测试一名玩家的技能。你将牌分成 10 堆。你让玩家在 9 堆上进行练习(在这些堆中,你使用“合成厨师”来增加更多的牌),然后在第 10 堆(保持原样且纯净)上测试他们。你轮流进行,确保每一堆都有机会作为测试集。
  • 为何重要: 这确保了计算机没有通过死记硬背测试答案来作弊。它证明了计算机确实学会了规则。

结果:逻辑的巨大胜利

他们在此任务上测试了许多不同的“大脑”(算法)。

  • 修复前: 表现最好的模型(线性 SVM)正确率约为 71%。标准的“逻辑回归”(一种简单、合乎逻辑的模型)正确率仅为 58%
  • 修复后(SMOTE-Tomek): 简单的 逻辑回归 模型准确率飙升至 76.16%

为什么简单的模型成为了赢家?
论文发现,简单的模型变得更加稳定。

  • 没有修复时: 模型处于恐慌状态。它大喊:“这一个词意味着‘可移植性’!”并赋予其巨大的权重,仅仅因为它见过的示例太少。
  • 修复后: 模型冷静了下来。它学会了平衡的观点。它意识到:“好吧,‘可移植性’通常涉及‘浏览器’、‘系统’和‘运行’等词汇,但没有单个词是万能钥匙。”

结论

这项研究表明,你并不总是需要一个超级复杂、昂贵的“深度学习”大脑(这需要海量数据和算力)来分类软件需求。

如果你有一个小且混乱的数据集,你可以通过以下方式获得出色的结果:

  1. 清理数据(移除令人困惑的笔记)。
  2. 合成新示例(填补稀有类别的空白)。
  3. 使用简单、可解释的模型(如逻辑回归),该模型能够解释其做出决策的原因

论文总结道,这种方法使计算机成为了一名更加可靠的图书管理员,能够以高精度识别出即使是极其罕见的软件需求类型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →