PROOF-Gen: From Optimized Data to Better Distillation
该论文介绍了 PROOF-Gen,这是一种利用针对特定场景的提示词优化(per-scenario prompt optimization)来从教师模型的失败中恢复成功轨迹的方法,从而显著提升了蒸馏后的工具调用智能体在基准测试及部署流水线中的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,一种常见的教导更小、更快速的计算机程序执行复杂任务的方法,是让一个更大、更聪明的程序来演示如何完成它。这个过程被称为“蒸馏”(distillation),其原理类似于大师向学徒展示完美的技艺:学徒观察大师成功的尝试并学习模仿。然而,这种方法存在一个盲点。如果大师犯了错,学徒只会忽略那次尝试,并等待下一次成功的演示。在工具调用(tool-calling)这一特定领域——即人工智能必须决定使用哪些数字工具来解决问题,例如检查数据库或发送消息——这造成了一个显著的差距。最难的问题往往是那些大师几乎成功但在最后一步失败的任务。由于标准的教学方法会丢弃这些“差一点就成功”的案例,学徒永远无法学会如何应对导致失败的具体决策点,从而导致人工智能无法解决这些最困难的情景。
苹果公司的研究人员开发了一种名为 PROOF-Gen 的新方法来填补这一空白。该方法不再丢弃失败的尝试,而是将它们视为宝贵的学习机会。当主程序执行任务失败时,第二个更先进的程序会充当“反思教练”。这位教练会分析主程序到底在哪里出了错,观察动作序列和最终错误,然后编写一套特定的指令,即一份“指南”,旨在引导主程序再次通过那个完全相同的难题。主程序再次尝试该任务,这一次它会遵循教练的新建议。如果成功了,这条成功的路径就会被保存为一个新的教训。至关重要的是,在学徒看到这个新教训之前,指南会被移除。学徒学习的是纯净的、成功的动作序列本身,而不是那些帮助创造出该序列的额外指令。这确保了学徒学习的是技能本身,而不是死记硬背特定的提示。
这种方法的成果令人瞩目。在利用模拟客户服务交互的基准测试中,丢弃失败案例的标准方法意味着主程序仅在约 7% 的案例中取得成功。而新方法找回了主程序最初失败任务中 93% 的成功解决方案。当较小的 AI 模型在这一扩充后的教训集上进行训练时,它们的任务完成能力得到了显著提升。其中一个模型从完成 13% 的任务跃升至完成 53%,另一个模型也看到了类似的性能飞跃。研究人员证实,这种进步源于学习通过困难决策点的正确路径,而不仅仅是变得更擅长处理任务中的简单部分。事实上,仅针对预选的简单成功案例进行训练,虽然提高了模型进行单个工具调用的能力,但并未帮助它们完成整个工作。只有通过包含这些找回的困难案例,模型才能学会完成完整任务。
该方法还为那些希望在不改变 AI 声音或行为方式的情况下升级其 AI 系统的公司提供了实际优势。由于最终的教训中剥离了教练指令,AI 学习到了强大教练的解决问题能力,同时保留了原始主程序的自然语调和风格。研究人员在用于客户服务的真实生产系统中测试了这一点,结果显示该方法将 AI 的成功率提高了 6.3 个百分点。这些增益在数十种不同的语言和地区都保持一致,表明从失败中恢复的能力是一种通用的技能,并不依赖于特定的语言或文化背景。通过将失败转化为一个结构化的学习过程,研究人员表明,通往更聪明人工智能的路径不仅在于寻找更多完美的范例,还在于理解并纠正那些不完美的范例。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。