← 最新论文
📊 statistics

Large Language Models for Imbalanced Classification: Diversity makes the difference

本文提出了一种基于大语言模型的新型过采样方法,该方法通过条件生成策略、一种新的基于排列的微调方法以及插值技术,增强了合成少数类样本的多样性与真实性,从而在不平衡分类任务中显著优于现有的最先进技术。

原作者: Dang Nguyen, Sunil Gupta, Kien Do, Thin Nguyen, Taylor Braund, Alexis Whitton, Svetha Venkatesh

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Dang Nguyen, Sunil Gupta, Kien Do, Thin Nguyen, Taylor Braund, Alexis Whitton, Svetha Venkatesh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于论文《大语言模型用于不平衡分类:多样性成就差异》(Large Language Models for Imbalanced Classification: Diversity makes the difference)的解释,采用了通俗易懂的语言和富有创意的类比。

问题所在:“罕见病例”教室

想象一位老师正在试图教一个班级的学生区分两种类型:“普通学生”(占班级的 90%)和“罕见学生”(仅占 10%)。

如果老师只关注这 90% 的多数群体,他们会了解关于“普通学生”的一切,但对“罕见学生”几乎一无所知。当考试来临时,老师很可能会猜所有人都是“普通学生”,因为这是他们见得最多的。他们无法识别少数群体的独特特征。

在数据科学中,这被称为不平衡分类(Imbalanced Classification)。目标是教会计算机像识别普通群体一样好地识别稀有群体。

旧的解决方案:“复制粘贴”错误

为了解决这个问题,数据科学家通常尝试创造更多“罕见学生”的例子,使班级达到平衡。

  • 旧方法 (SMOTE): 想象一下,取出两个真实的“罕见学生”,测量他们的特征,然后在他们中间画出一个新的学生。这就像是在复印件的基础上再进行复印。
  • 问题所在: 如果数据包含类别信息(如“职位名称”或“受教育程度”),你不能直接在“医生”和“教师”之间画一条线来产生一个新的职业。你必须先将这些词语转化为数字,但这往往会丢失重要的细节。这就像是试图用一张电子表格来描述一幅画作。

新的想法:“AI 讲故事的人”

最近,科学家开始使用大语言模型 (LLMs)——也就是那些能写文章或与你聊天的 AI——来生成这些缺失的“罕见学生”。与其将词语转化为数字,AI 会将数据读作一个故事(例如,“约翰是一名医生,工作 40 小时,年薪 20 万美元”)。

然而,这篇论文发现人们使用这些“AI 讲故事的人”时存在一个重大缺陷:
它们太重复了。如果你问 AI,“请讲一个关于罕见学生的故事”,而它给出了 1,000 个完全相同的故事,那么它对老师的学习过程没有任何帮助。AI 只是在重复同样的几种模式,创造了一个“镜像迷宫”,而不是一个多样化的教室。

解决方案:ImbLLM(“多样化的讲故事的人”)

作者提出了一种名为 ImbLLM 的新方法。他们通过三个聪明的技巧修复了 AI 的讲故事习惯,以确保生成的新“学生”既多样化又真实。

1. “特定提示词”技巧 (采样/Sampling)

  • 旧方法: AI 被要求“讲一个关于罕见学生的故事”。它会选择最可能的词汇,并一遍又一遍地重复同一个故事。
  • ImbLLM 方法: 作者告诉 AI,“讲一个关于罕见学生的故事,并且他还要具备某个特定的特征,比如特定的职业或收入。”
  • 类比: 与其要求厨师“做一份甜点”,然后每次都得到同样的巧克力蛋糕,不如说“做一份甜点,但这次必须带有草莓”;下次再说“做一份甜点,但这次必须带有柠檬”。这迫使 AI 去探索不同的风味(特征),而不是固守一种安全的食谱。

2. “前排座位”技巧 (排列/Permutation)

  • 旧方法: 在训练 AI 时,研究人员会打乱故事的顺序。有时“罕见学生”的标签位于句子的末尾。由于这些 AI 模型的工作原理(从左向右阅读),当读到句子末尾时,AI 会忘记“罕见”这个标签,从而丢失了标签与特征之间的联系。
  • ImbLLM 方法: 他们将“罕见学生”标签放在句子的最开头,就像一个标题一样,然后只对其余的细节进行打乱。
  • 类比: 想象一名侦探正在试图破案。如果线索“嫌疑人是一名医生”被埋在长篇报告的底部,侦探可能会错过它。ImbLLM 把线索用大号粗体字放在页面的顶部,这样 AI 就永远不会忘记它应该描述谁。

3. “演习”技巧 (微调与插值/Fine-Tuning & Interpolation)

  • 旧方法: AI 同时在“普通学生”和“罕见学生”的数据上进行训练。这会让 AI 感到困惑;它会不断尝试让“罕见学生”看起来像“普通学生”。此外,有些方法尝试使用较弱的测试来检查这些新故事是否“真实”,但这往往会失败。
  • ImbLLM 方法: 他们在“罕见学生”(以及一些数学混合后的版本)上训练 AI。
  • 类比: 与其通过展示 NBA 球星和幼儿来训练一名篮球运动员,不如只向他们展示 NBA 球星。你希望他们学习职业选手的特定动作。
  • “插值”加成: 由于可以学习的“罕见学生”非常少,AI 可能不知道所有可能的变体。作者通过提取两个真实的罕见学生,并对他们的连续性特征(如年龄或薪水)进行数学混合,创造出了新的、略有不同的学生。这填补了空白,确保 AI 学习到完整的可能性范围,而不仅仅是它在训练数据中看到的那些。

结果:更好的教室

作者在 10 个真实的现实世界数据集(如医疗记录或信用卡数据)上测试了这种新方法。

  • 表现: ImbLLM 击败了其他 8 种顶尖方法。它在 5 个案例中表现最佳,在 3 个案例中排名第二。
  • 质量: ImbLLM 创建的虚假“罕见学生”不仅非常真实(看起来像真实数据),而且具有多样性(涵盖了许多不同类型的罕见场景)。
  • 为什么这很重要: 因为 AI 从一组多样化的例子中学习,最终的分类器(即“老师”)变得能够更好地识别出它之前忽略的罕见情况。

总结

这篇论文认为,仅仅使用 AI 来生成数据是不够的;你必须教会 AI 如何变得具有创造力专注。通过强制 AI 观察特定特征、保持核心目标清晰可见,并仅针对罕见样本进行训练,他们创造出了一种比以往尝试能更好地解决“不平衡数据”问题的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →