Discrete Diffusion Language Models Are Training-Free Multi-Label Classifiers
本文介绍了 dLLM-SetScore,这是一种无需训练的多标签分类方法,它利用离散扩散语言模型通过逐槽位的“是/否”概率比较来评估候选标签,从而消除了位置偏差,并在无需针对特定任务进行微调的情况下实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,存在着一种持续的张力:一种是靠记忆海量特定数据进行学习的模型,另一种是试图通过通用原理来理解世界的模型。多年来,教计算机将文本分类为多个类别(例如为新闻文章标记多个主题,或为社交媒体帖子标记多种情绪)的标准方法,是在成千上万个带标签的示例上从头开始训练。这是一种监督式方法,即通过向计算机展示正确答案,直到它学会其中的模式。然而,新一代模型已经出现,它们的学习方式有所不同。这些模型不是在记忆答案,而是被训练去填充缺失的文本片段,这一过程被称为“掩码扩散”(masked diffusion)。它们通过学习根据周围的上下文来预测空白处应该填入哪个词。虽然这些模型在生成新文本方面展现出了巨大的潜力,但研究人员一直在思考,它们是否也可以在从未见过该特定任务的任何标记示例的情况下,用于对现有文本进行分类。这个问题之所以重要,是因为为每一项新工作都训练新模型既昂贵又耗时;一种仅利用模型现有知识就能进行文本分类的方法将是一个强大且灵活的工具。
一位研究人员现在已经证明,只要问得对,这些扩散模型确实可以作为高效的分类器,而无需任何专门的训练。他开发了一种名为 dLLM-SetScore 的方法,该方法将分类任务视为一系列简单的“是”或“否”的问题。系统并没有要求模型一次性列出文档的所有相关标签,而是每次只问一个问题:“这篇文章是否表达了[特定情绪]?”或者“这篇文章的主题是[特定话题]吗?”然后,模型通过在提示词中填入一个单一的空格来预测答案是“是”还是“否”。通过对每一个可能的标签重复这个过程,系统便构建出了关于文档内容的完整图景。研究人员发现,这种方法在六个不同的数据集上表现得非常出色,涵盖了从新闻文章、法律文件到社交媒体评论的各种类型,其表现往往能媲美甚至超越那些为这些任务专门训练过的模型。
然而,通往成功的旅程需要研究人员首先识别并修复他们在最初尝试让模型工作时发现的一个微妙但关键的缺陷。在最初的尝试中,他们试图让模型在一个长长的、包含多个空格的列表中预测所有的标签。他们发现模型存在一种基于标签顺序的奇怪偏差。如果答案列表中的第一个标签在字母表顺序中排在前面,那么无论文档实际内容如何,模型几乎总是会对第一个空格预测为“是”。这是因为模型的训练数据很少包含如此长的、完全空白的序列,因此它会对遇到的第一个空格进行默认猜测。这种错误非常严重,以至于在某些数据集上将系统的整体准确率降到了接近于零。研究人员意识到,问题不在于模型的智能,而在于问题的结构。通过转向这种每个标签对应一个问题的全新方法,他们确保了每个标签在句子中的呈现位置完全相同。这一简单的改变消除了偏差,使模型能够公平且独立地评估每个标签。
解决了这个结构性问题后,研究人员测试了两类不同的扩散模型,一类拥有 80 亿个参数,另一类拥有 70 亿个参数。他们对比了这些模型的“基础”(base)版本(仅学习了填空功能)与经过进一步训练以遵循人类指令的“指令”(instruct)版本。结果令人震惊。在几乎所有情况下,“指令”版本的表现都显著优于“基础”版本,尽管两者都没有针对特定的分类任务进行过训练。在一个新闻文章数据集中,“指令”模型实现了 67.2 的宏 F1 分数(衡量其识别所有不同主题能力的指标),而“基础”模型仅达到了 38.2。这表明,遵循指令的能力有助于模型更好地理解问题的细微差别,即使任务仅仅是回答“是”或“否”。研究人员还测试了一个更复杂的想法,即让模型通过观察自己之前的猜测来优化答案,但他们发现这个额外的步骤反而让结果变差了,这证实了简单直接的方法才是最可靠的。
这项研究还强调了问题措辞的重要性。研究人员发现,改变问题的措辞会极大地改变结果。例如,在对新闻文章进行分类时,询问“这篇文章是否表达了[话题]?”会产生一定的准确度,但如果将问题改为“这篇文章的主要话题是[话题]吗?”,则会显著提升性能。这种敏感性表明,模型并非在盲目猜测,而是在响应提示词中的特定语境和意图。虽然该方法并不完美,且仍落后于那些针对数据进行过完整训练的最优模型,但它已经非常接近了。在一种情况下,将这种扩散模型与其他工具结合使用,其得分与顶尖的监督学习模型仅差 7 个点,而整个过程中扩散模型从未见过该任务的任何标记示例。
这项工作为我们理解大型语言模型的能力提供了新的视角。它表明,进行文本分类并不一定需要对模型进行从头开始的重新训练。相反,通过利用模型现有的语言知识,并以尊重其内部结构的方式进行提问,我们可以免费解锁强大的分类能力。研究人员展示了关键不仅在于拥有一个聪明的模型,还在于知道如何与它对话。通过规避结构不佳的问题陷阱,并利用模型的指令遵循能力,我们可以构建出一个既灵活又准确的分类器。这种方法为在训练数据匮乏,或者对速度和适应性要求高于追求最后一点性能提升的情况下,使用这些强大的工具打开了大门。研究结果表明,文本分类的未来可能不在于构建更大、更专门的模型,而在于学习如何向我们现有的模型提出正确的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。