← 最新论文
🤖 machine learning

From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning

本文介绍了 AutoSelection,这是一个新颖的框架,它将监督微调数据选择重新表述为固定池配方搜索问题,利用双层求解器从原始指令池中高效地发现最佳筛选配方而无需生成新样本,从而在多个模型和任务上超越了传统的实例排序和全数据训练。

原作者: Haodong Wu, Jiahao Zhang, Lijie Hu, Yongqi Zhang

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Haodong Wu, Jiahao Zhang, Lijie Hu, Yongqi Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位厨师,正试图制作一碗完美的汤。你拥有一个巨大的储藏室(原始数据池),里面装满了 90,000 种不同的食材(指令)。你的目标是挑选出最佳的食材组合,以制作出一碗味道惊艳的汤(一个智能的 AI 模型)。

旧方法:“前十名”清单

传统上,厨师(以及 AI 研究人员)试图通过品尝每一种单独的食材,给每种食材打分,然后只挑选得分最高的前 10 种物品来解决这个问题。

  • 问题所在:一种食材单独品尝味道好,并不意味着它适合放入汤中。也许你需要在加盐之前先放一点辛辣的胡椒,或者也许你需要在加入香草之前先去除那些水汪汪的蔬菜。旧方法忽略了顺序组合。它将这碗汤视为一份简单的“最佳物品”清单,而不是一份食谱。

新想法:“食谱搜索”

这篇论文,AutoSelection,提出了一种不同的方法。与其仅仅挑选最好的食材,我们更应该寻找最佳的食谱

将食谱视为一套指令:

  1. 过滤掉所有味道平淡的蔬菜。
  2. 混合辛辣的胡椒与酸涩的柠檬。
  3. 去除任何重复的香料。
  4. 仅保留剩余混合物中的前 50%。

这篇论文称之为固定池数据食谱搜索。“储藏室”保持完全不变(我们不去购买新食材或发明新食材);我们只是尝试不同的有序操作序列,看看哪一种能创造出最佳的最终菜肴。

AutoSelection 如何工作(“智能厨师”)

寻找完美食谱是昂贵的。要测试一个食谱,你必须实际烹饪这碗汤(训练 AI 模型)并品尝它(运行基准测试)。你只有有限的预算来做这件事(比如 15 次尝试)。你不能随意猜测;你需要一个明智的策略。

AutoSelection 是一个双层“智能厨师”系统,帮助你找到最佳食谱而不浪费预算:

  1. “作弊表”(缓存信号):在你开始烹饪之前,系统会查看储藏室并为每种食材写下笔记:“这个很辣”,“那个很重”,“这两个非常相似”。这样,在测试新食谱时,它就不必从头开始重新品尝每一种食材。它利用这些预先写好的笔记来预测食谱可能的样子。
  2. “试运行”(预热):在承诺进行完整的烹饪过程之前,厨师会进行三次快速、小型的测试,看看汤需要是大份、中份还是小份。这有助于奠定基础。
  3. “品尝测试”(状态向量):当执行一个食谱时,系统不仅仅查看最终得分。它会查看汤的状态:“我们是否保留了足够的食材?味道是否平衡?”它会为所选食材创建一个“状态向量”(一份摘要报告)。
  4. “品尝小组”(搜索控制器)
    • 总结者:阅读过去汤品的历史,并说:“嘿,每次我们在胡椒之后加盐,味道都很棒。”
    • 提议者:根据该建议提出新的食谱变体(例如,“让我们尝试交换盐和胡椒的顺序”)。
    • 排序者:查看新建议,并使用“高斯过程”(一种复杂的数学猜测器)来预测哪一个最可能是好的,然后挑选出单个最佳候选者进行实际烹饪。
    • 重播种者:如果厨师一直在做同样的汤且没有变得更好(停滞),系统会说:“好吧,让我们抛弃当前的想法,尝试一个完全不同的起点。”

结果:它奏效了吗?

研究人员在三个不同的 AI 模型(小型和中型)上测试了这种方法,使用了包含 90,000 项指令的池。他们将 AutoSelection 与以下方法进行了比较:

  • 使用整个储藏室(全量数据)。
  • 随机挑选食谱。
  • 仅挑选“前十名”最佳食材(单操作符)。

发现

  • 更好的汤:AutoSelection 创建的模型在推理任务上比甚至那些在整个 90,000 项数据集上训练的模型更聪明。
  • 顺序很重要:他们证明了步骤的序列很重要。例如,执行“步骤 A 然后步骤 B"产生的结果比“步骤 B 然后步骤 A"好得多,即使食材是相同的。
  • 稳定性:该系统不仅仅是一次运气好;它在多次尝试中 consistently 找到了好的食谱。
  • 可迁移性:在小型模型(15 亿参数)上表现良好的食谱,往往在大型模型(70 亿参数)上也表现良好,这表明“食谱”本身捕捉到了关于优质数据的某些根本性特征。

结论

这篇论文认为,让 AI 变得更聪明不仅仅是找到“最佳”的数据点。它是关于找到过滤和混合这些数据的最佳过程。通过将数据选择视为食谱搜索而不是简单的排名列表,并使用一个智能的、预算感知的搜索引擎(AutoSelection)来寻找该食谱,我们可以用更少的浪费精力构建更好的 AI 模型。

它不是

  • 它不发明新数据或重写指令。
  • 它不使用 AI 生成新的训练样本。
  • 它不声称适用于医疗诊断或特定的临床用途(它严格专注于通用推理基准,如数学和逻辑谜题)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →