← 最新论文
🤖 AI

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

Palmyra x6 是一款面向企业的智能体语言模型,通过使用基于精简且经过验证的数据集的锚定监督微调(Anchored Supervised Fine-Tuning)这一保守且受控的后训练方法,在工具使用基准测试中实现了最先进的性能。

原作者: Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的背景下,一个持久的挑战是如何教导大语言模型成为可靠的助手,而不破坏它们已经具备的技能。传统上,为特定工作创建一个高性能的模型需要从头开始构建整个系统,这个过程类似于为每种不同的车辆建造一个全新的引擎。近来,研究人员发现,如果训练数据具有卓越的质量且学习方法足够精确,那么通过对现有的强大模型进行仔细的行为微调,通常就足以实现特定目的。这种方法专注于“智能体”(agentic)任务,即模型不仅要回答问题,还要能够主动规划步骤、使用网络搜索或代码执行等数字工具,并处理复杂的、多步骤的工作流以解决问题。其目标是创造一种能够有效在现实数字环境中运行的 AI,能够处理需要长期规划以及与各种软件系统交互的任务,而不仅仅是生成文本。

来自 Writer, Inc. 的一个研究团队通过开发 Palmyra x6 解决了这一挑战,该模型专为擅长这些智能体任务而设计。他们并没有从头开始训练一个庞大的新模型,而是以一个名为 GLM-5.2 的复杂现有基础模型为起点,该模型拥有数千亿个参数。在此基础上,他们应用了一种被称为“锚定监督微调”(Anchored Supervised Fine-Tuning)的高度专业化训练方法。这种技术旨在教导模型新技能——特别是如何使用工具和规划复杂任务——同时严格防止它遗忘或退化原有的通用知识和推理能力。其结果是一个能够驾驭复杂数字环境(例如涉及网络搜索、代码执行和文档检索的环境)的系统,其能力水平显著优于他们之前的版本,并能与最先进的模型相媲美。

这一成就的核心在于用于训练的数据的质量和性质。研究人员并没有向模型喂入海量的互联网文本,而是生成了一个由仅 6,26 个示例组成的精简且高度精选的数据集。每个示例都是一个由 AI 智能体完成任务的完整、经过验证的轨迹。这些是合成的“故事”,其中 AI 规划了一系列步骤,调用各种工具来收集信息或执行动作,并最终得出正确的解决方案。为了确保这些示例是完美的,研究人员采用了一个严谨的过程:首先由一个“教师”模型演示一条成功的路径,然后要求一个“学生”模型在仅将教师的计划作为高层级指南的情况下,独立解决同一个问题。如果学生模型试图通过复制答案或未能正确使用工具来绕过过程,该尝试就会被丢弃。只有最成功、最诚实的尝试才会被保留,从而创造了一个极小但质量极高的示例库,教会了模型如何像一个称职的智能体一样思考和行动。

为了在利用这组小规模数据集的同时不丢失其原始能力,研究人员采用了一种起到了“安全锚”作用的方法。在训练过程中,模型不断地被提醒它原本未经训练的状态。这种“锚”确保了在模型学习使用工具和规划任务的同时,不会偏离其最初具备的通用智能和安全行为。这至关重要,因为在极小数据集上进行训练可能会导致模型变得过于专门化,或者丧失处理通用对话的能力。通过将模型锚定在原始状态,研究人员能够在不侵蚀基础能力的前提下注入新的智能体技能。他们还使用了一种专门的数学优化器,这种工具通过将内部连接视为几何形状而非仅仅是数字,帮助模型更高效地学习,使其能够更好地利用有限的数据。

这种方法的成果是立竿见影且巨大的。在针对衡量 AI 使用工具、长期规划任务和遵循复杂指令能力的各类基准测试中,Palmyra x6 相比于 Writer 智能体之前使用的默认模型展现出了巨大的进步。它在金融研究领域(需要搜索网络并分析数据)以及通用工具使用场景中表现尤为强劲。该模型也表现出极强的竞争力,足以与其他领先的前沿模型竞争,并在多个不同测试的平均得分中经常位居前列。或许最重要的一点是,该模型保持了高度的安全性和中立性。在旨在衡量政治偏见和拒绝行为的测试中,Palmyra x6 展现了平衡的处理方式,能够呈现争议性问题的多个方面,并且在拒绝有害请求方面的比例与其基础模型保持一致,证明了新技能的习得并未以牺牲安全性或可靠性为代价。

研究人员谨慎地指出,该模型是一个专门的工具,而非所有 AI 任务的通用替代品。它的优势在于可以调用工具并执行计划的智能体工作流,而它在其他类型任务上的表现仍受限于其所构建的基础模型。虽然训练数据的数量很少,但由于学习方法的设计非常保守且精确,这足以教会模型使用工具的具体行为。该模型现已开放商业用途,提供了一个可以在标准硬件上高效运行的版本。这项工作表明,只要拥有高质量的数据、精心的训练目标和一个稳定的基础,就可以创造出功能强大的 AI 智能体,而无需进行大规模、资源密集型的从头开始的重新训练。Palmyra x6 的成功表明,未来的 AI 助手可以通过精准且安全的手段,根据区区数百个完美的示例而非数百万个不完美的示例,来定制以应对复杂的现实工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →