← 最新论文
💬 NLP

Cross-Domain Hybrid OPD for Generalizable Search Agents

本文介绍了一种用于元宝搜索智能体的混合训练框架,该框架利用跨领域专家在策略蒸馏(On-Policy Distillation)来实现专门化的搜索能力,且不会牺牲甚至能增强通用智能,从而缓解了强化学习优化中常见的对齐税问题。

原作者: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你最喜欢的 AI 助手就像一名刚刚学会成为顶级侦探的天才学生。这个学生可以搜寻互联网,将不同的新闻故事联系起来,并比任何人都更快地发现隐藏的事实。但有一个代价:在成为超级侦探的过程中,他们开始忘记如何写一首有趣的诗、解决一个棘手的数学难题,或者仅仅是像往常一样进行日常聊天。这就是人工智能领域中“专业化”的问题。科学家们称,为了精通某一项特定技能而付出的代价叫做“对齐税”(alignment tax)。这就像是一位厨师因为过于痴迷于完善他的汤品,以至于忘记了如何烤蛋糕。研究人员面临的大问题是:我们能否训练一个 AI 成为世界级的搜索专家,同时又不让它忘记如何做一个乐于助人的全能朋友?

这正是腾讯元宝团队在其最新技术报告中所致力于解决的问题。他们构建了一个智能 AI 智能体(Agent),旨在搜寻网络信息,但他们担心过度训练其搜索能力会导致它在其他方面变得“愚笨”。为了解决这个问题,他们发明了一种巧妙的两步训练法。首先,他们使用一种被称为“强化学习”(Reinforcement Learning)的技术来教 AI 成为搜索专家,这就像是让 AI 玩一场游戏,只要找到正确答案就能获得积分。然后,为了防止 AI 失去通用智能,他们使用了名为“跨领域混合在策略蒸馏”(Cross-Domain Hybrid On-Policy Distillation)的方法。你可以把它想象成聘请了四位不同的天才导师——一位负责数学、一位负责编程、一位负责逻辑、还有一位负责科学——来教这位搜索专家 AI 如何重新成为一名全面发展的学生。结果如何?这个 AI 寻找网络信息的能力与专门化版本一样出色,而且它并没有在每一项数学测试中都变成数学天才,它却找回了大部分失去的阵地,并在逻辑推理和编程等几个关键领域甚至变得比以前更强了。他们不仅解决了问题,还让 AI 在多个领域同时变得更聪明,而没有牺牲其搜索技能。

忘记了杂耍로的侦探

让我们深入了解一下元宝搜索智能体的故事。想象你有一个名叫“搜索机器人”(Search-Bot)的机器人。你想让 Search-Bot 成为在互联网上寻找答案的最强者。于是,你把它放在一个虚拟游乐场里,让它通过点击链接、阅读文章和提出问题来解决谜题。这被称为强化学习 (RL)。这就像训练一只狗:每当 Search-Bot 找到正确的信息时,它就会得到一颗“零食”(奖励);每当它迷路时,它会得到一个温柔的“不”。

过了一段时间,Search-Bot 变得非常擅长寻找信息。但奇怪的事情发生了:随着它搜索能力的增强,它在其他事情上的表现却变差了。它忘记了如何解决简单的数学题或写一段创意故事。论文称之为对齐税 (Alignment Tax)。这就像如果你每天都练习踢足球直到你的腿部力量超群,但却因为不再练习走路而忘记了如何走直线。AI 在“搜索”方面变得过于专业,以至于失去了它的“通用”脑力。

两步救援行动

腾讯团队意识到,仅仅教 Search-Bot 更努力地去搜索并不是解决办法。他们需要一种既能保留搜索技能,又能找回通用智能的方法。因此,他们制定了一个两阶段训练计划。

第一阶段:搜索集训营
首先,他们拿出了他们的基础 AI 模型(一个名为 Hunyuan3 的智能模型),并把它送进了“搜索集训营”。在这里,AI 只练习搜索。它学习如何规划动作、使用网页搜索和图像搜索等工具,以及如何整合来自不同来源的信息。正如预期的那样,它变得非常擅长搜索。但是,正如论文所预测的那样,它开始在数学、科学和逻辑方面失去水准。“对齐税”造成了沉重的打击。

第二阶段:“超级导师”混合模式
这就是见证奇迹的时刻。他们并没有只是让 AI 继续在数学上失败,而是引入了四位专家教师。这些可不是普通的老师,而是专门针对以下领域训练的超级专业 AI 模型:

  1. 数学(解决复杂的方程)
  2. 编程(编写计算机程序)
  3. 逻辑(解决谜题和推理)
  4. 科学(理解自然界)

团队使用了一种称为在策略蒸馏 (On-Policy Distillation, OPD) 的技术。这是一个高级说法,意思是:“让学生(Search-Bot)尝试解决一个问题,然后让专家教师观察并说:‘嘿,你刚才那样做也可以,但这里有一种更好的思考方式。’”

酷的地方在于,他们不仅仅是教 AI 数学搜索。他们把它们混合在一起了!在每一次训练环节中,AI 既会练习搜索一个事实,紧接着又会练习解决一个数学问题或编写一段代码,同时接受相应专家教师的指导。这就像一个学生在早上参加足球训练,下午再去上钢琴课,但钢琴老师也会观察他的足球训练,以确保学生保持专注和自律。

结果:鱼与熊掌兼得

团队将他们的新型“混合型”AI 与旧版本进行了对比测试。以下是他们的发现:

  • 搜索技能: 新的 AI 在搜索方面的表现与那个只练习搜索的版本一样出色。事实上,在一些复杂的搜索测试中,它甚至表现得更好!它仍然能够完美地在网络上寻找信息、规划复杂搜索并遵循指令。
  • 通用技能: 这是最大的胜利。那个只练习搜索的 AI 在数学和逻辑方面变差了。但这款“混合型”AI 呢?它不仅恢复了正常,还在许多领域取得了显著的进步和提升。
    • 逻辑推理测试中,混合型 AI 实现了巨大的飞跃(从 33.95 分跳升至 46.90 分)。
    • 编程任务中,它从 67.74 提升到了 74.15,甚至超过了最初的“基础”模型。
    • 数学问题上,它几乎找回了所有失去的阵地,甚至在一些高难度测试(如 AIME25 和 Math IMO AnswerBench)中超越了原始模型。不过,在一些极具挑战性的基准测试(如 Minerva Math 和 Frontier Science Olympiad)中,它的表现仍略低于原始基础模型。
    • 科学基准测试中,它表现出了强劲的增长,在 GPQA Diamond 上达到了最高准确率。

论文表明,“对齐税”并不是必须支付的永久代价。通过使用这些专家教师在 AI 学习搜索的过程中进行引导,他们成功地“抵消”了大部分损伤。AI 不必在成为侦探和成为天才之间做选择;它变成了一个既是顶尖侦探,又是非常优秀的学生的复合型人才,即使它在宇宙中每一个数学问题上都并非完美。

这为什么重要

你可能会想:“那又怎样?我们为什么要关心 AI 是否变得更擅长数学?”好吧,想象一下你问你的 AI 助手:“我要在巴黎待三天。我想看埃菲尔铁塔和迪士尼乐园,但我不想在两个景点之间花费超过 30 分钟的路程。”

如果你的 AI 仅接受过“纯搜索”训练,它可能会找到这些地点,但随后给出一个完全不合理的行程,或者因为它太专注于寻找地名而忘记了正确计算交通时间。

但有了“混合型”训练,AI 可以:

  1. 搜索地点和交通时间(利用其搜索技能)。
  2. 推理地理位置并计算计划是否符合你的 30 分钟规则(利用其逻辑和数学技能)。
  3. 撰写一份清晰、友好且轻松的行程单给你(利用其通用语言能力)。

论文指出,这种“混合”方法是构建真正实用的现实世界 AI 助手之关键。它们需要能够寻找信息,没错,但它们还需要足够聪明,能够利用这些信息去解决问题、创作故事,并在不“丢掉大脑”的情况下帮助我们的日常生活。

秘诀所在:他们是如何做到的

团队并没有把所有东西直接扔进搅拌机。他们在如何教导专家教师方面非常谨慎。他们使用了一种“课程学习”(Curriculum Learning)策略。这意味着他们并没有一开始就给老师们布置最难、最不可能完成的数学题。相反,他们从难度中等的题目开始,以此建立坚实的基础,然后慢慢引入更难的内容。

他们发现,如果跳过这一步,直接把最难的问题扔给老师,老师(以及学生 AI)的学习效果就不会那么好。“课程”帮助了老师们更好地解释知识,这反过来也让学生 AI 学得更快、更聪明。

总结

腾讯元宝团队向我们展示了,你不需要为了获得专业的搜索智能体而牺牲通用智能。通过将强化学习(用于搜索)与在策略蒸馏(向专家导师学习)相结合,他们创造了一个既是顶级侦探,又是优秀全能学生的 AI。

他们证明了“对齐税”是可以避免的。这个 AI 不仅没有变笨,它在大多数领域都变得更强了,找回了失去的技能,甚至在编程和逻辑推理等领域超越了自我。虽然它没有赢得每一场数学竞赛,但它成为了一个更加强大、多功能的助手。这就像是找到了一种方法,可以在训练超级英雄飞行的同时,还不让他们忘记如何走路。而在一个我们渴望 AI 既有用、又聪明且多才多艺的世界里,这无疑是一件了不起的大事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →