Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training
本文提出了 Data-DPO,一种用于大语言模型后训练的新型数据选择方法,该方法通过轻量级奖励模型利用一步探测(one-step probing)来学习目标模型感知的偏好,从而构建出一个始终优于现有基线甚至全量数据训练的高质量训练子集。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界中,大型语言模型已成为能够进行写作、推理和解决复杂问题的强大工具。然而,教导这些模型执行特定任务需要一个被称为“监督微调”的过程,即系统从大量的示例集合中学习。想象一下,试图通过把整座图书馆的书交给一名学生来教导他们;虽然学生最终可能会学会,但这个过程极其缓慢、昂贵且往往效率低下,因为其中大部分材料对于当前的特定课程而言是冗余或无关的。研究人员长期以来一直在寻求一种方法,只挑选出那座图书馆中最有用的页面,希望在不牺牲智能的前提下,让模型的训练变得更快、更便宜。该领域普遍的假设是,某些数据本身就比其他数据“更好”,就像教科书根据其写作的清晰度被评判一样。
一项新的研究挑战了这种对数据质量的静态看法。由南京大学及其他几家机构组成的团队领导的研究人员认为,一个训练样本的价值不仅取决于样本本身,还取决于它与正在接受教导的特定模型的契合程度。正如一道困难的物理题可能非常适合一名高级学生,但对初学者来说却过于艰深,一个高质量的数据样本可能对一个人工智能模型毫无用处,而对另一个模型来说却恰恰是提升所需的关键。为了解决这个问题,该团队开发了一种名为 Data-DPO 的方法,它充当了选择训练数据的个性化向导。该方法不再依赖于一份预先写好的“优质”示例清单,而是通过观察特定模型在一次简短试运行期间对不同样本的反应来进行工作。通过观察哪些示例能在单步之内让模型学到最多东西,该系统构建了一张定制的偏好图谱,识别出真正能引起该特定模型当前需求共鸣的数据。
这种方法的核心涉及一个巧妙的两步过程。首先,研究人员选取一小组具有代表性的数据,让目标模型在上面练习仅仅一个瞬间。他们测量模型在这一微小步骤后的性能提升了多少。如果某个特定的示例导致误差显著下降,这表明模型正在对该信息产生“激活”或“觉醒”。随后,系统会对这些反应进行比较,从而建立起针对该特定模型在特定时刻最有效的样本排名。这与以往将数据价值视为独立于学习者的固定属性的方法不同。研究人员发现,通过使用这种实时反馈,他们可以构建出一个比随机选择或通过标准质量检查选出的数据集更高效的训练集。
为了确保所选数据不仅易于学习,而且具有多样性和高质量,团队将这种基于模型的特定反馈与其他因素相结合。他们加入了一层外部质量评估,以确保答案的正确性,并加入了一个多样性度量,以确保模型能看到各种各样的情况。这种混合方法使他们能够挑选出一个既覆盖了必要领域又没有冗余的小规模数据子集。在针对两种不同类型的任务(一种涉及通用视觉指令,另一种侧重于复杂推理)进行测试时,新方法始终优于现有的筛选技术。在许多情况下,使用这些精心挑选的子集进行训练的模型,其表现甚至优于使用整个原始数据集进行训练的模型,在某些场景下,其结果甚至超过了全量数据性能的 100%。
该研究还严格测试了这种方法是否依赖于特定类型的模型或特定的质量衡量方式。结果显示,即使研究人员将目标模型更换为不同规模或家族的模型,或者更换用于判断数据质量的工具,该方法依然保持稳健。这表明该方法并非仅在完美条件下才起作用的脆弱技巧,而是一种寻找适合特定模型之数据的可靠策略。然而,研究人员也指出,该方法仍需要一些初始计算量来运行这些试探性探测,并且在数据分布保持相对稳定时效果最佳。最终,这项工作证明了在大型模型时代,最有效的训练数据并非一个普适的常数,而是学习者与课程之间的一种动态关系。通过倾听模型自身的反馈,研究人员现在可以策划出不仅规模更小、而且更聪明的训练集。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。