ZeroSearch: Incentivize the Search Capability of LLMs without Searching
ZeroSearch 是一种新颖的强化学习框架,它通过采用轻量级、基于课程设计的模拟搜索模块,有效激励并增强大语言模型的搜索能力,从而克服了真实世界搜索引擎训练中成本高和数据质量不稳定的问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教导一位聪明但缺乏经验的学生(即人工智能)如何通过查阅图书馆中的线索来解决复杂谜题。通常,为了传授这项技能,每当学生提问时,你都得派他们去真实的图书馆。
真实图书馆的问题:
- 不可预测的书籍:有时图书管理员会递给他们一本完美且有用的书;而有时,他们得到的却是一本破损、过时或完全错误的小册子。这使得学生难以进行一致性的学习。
- 昂贵的门票:学生每次前往图书馆都需要花费巨资。如果学生需要往返数千次才能掌握要领,预算会立刻崩溃。
解决方案:ZEROSEARCH(“虚拟图书馆”)
通义实验室的研究人员创造了一种巧妙的训练方法,称为ZEROSEARCH。他们不再将学生派往真实图书馆,而是利用另一款人工智能,在教室内部构建了一个模拟图书馆。
以下是其逐步工作原理:
1. “扮演”图书管理员
首先,研究人员对一款标准人工智能进行快速、轻量级的训练(如同速成班),教导它扮演图书管理员的角色。
- 魔法技巧:他们可以明确指示这位“图书管理员人工智能”提供何种类型的书籍。
- 如果他们说:“给我有用的书籍”,该人工智能就会生成完美、准确的文档。
- 如果他们说:“给我嘈杂的(令人困惑或错误的)书籍”,该人工智能就会生成垃圾内容。
- 为何这很重要:在真实图书馆中,你无法控制图书管理员能找到什么;而在这里,教师可以完全掌控“线索”的质量。
2. “循序渐进难度”游戏(课程学习)
研究人员不会立即将学生扔进深水区。他们采用课程展开策略,这就像一款难度逐级提升的电子游戏:
- 第 1 关(简单):图书管理员人工智能只递送完美、有用的书籍。学生学习基本规则:“提出问题,获得答案,解开谜题。”
- 第 2 关(中等):图书管理员开始混入一些令人困惑或略有错误的书籍。学生必须学会过滤掉不良信息。
- 第 3 关(困难):图书管理员递送的大多是垃圾内容。此时,学生必须化身侦探,找出哪一条微小的信息才是真实的。
当学生完成训练时,他们已擅长从不良信息中筛选内容,能够完美应对真实图书馆。
3. 结果:更经济、更智能
该论文使用不同规模的人工智能“学生”(从 30 亿参数的小型模型到 140 亿参数的较大模型)测试了这种方法。
- 成本:由于他们从未调用真实图书馆(Google),因此节省了巨额资金。“虚拟图书馆”运行在他们自己的服务器上,这比支付数千次真实搜索 API 调用的费用要便宜得多。
- 性能:
- 经过此方法训练的小型人工智能,其表现与使用真实搜索引擎训练的人工智能一样出色。
- 中型人工智能(70 亿参数)达到了真实搜索引擎的水平。
- 大型人工智能(140 亿参数)实际上超越了真实搜索引擎!
- 泛化能力:这种方法适用于不同类型的人工智能模型,无论是“原始”(Base)模型还是“经过指令微调”(Instruct)的模型。
核心结论
ZEROSEARCH 是一种教导人工智能如何搜索网络的方法,且在训练过程中无需真正接触网络。通过使用一个可控的“虚假”搜索引擎,从简单开始并逐步增加难度,人工智能学会了成为更出色的侦探,节省了巨额 API 费用,并最终取得了比在混乱、不可预测的真实互联网上进行训练更好的表现。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。