Multi-Turn Agentic Scientific Literature Search via Workflow Induction
PaperPilot 是一个多轮科学文献搜索智能体,它将搜索构建为一个可诱导、可编辑且由可执行算子组成的流程,通过实验证明,与标准的基于工具的智能体相比,这种方法显著提高了检索性能并消除了执行错误。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一座庞大且混乱的食谱图书馆中寻找一份特定的食谱。你告诉图书管理员:“我想找一份能在我上周做的这道菜基础上进行改进的食谱。”
如果你问的是一个传统搜索引擎(或基础 AI),它可能只会抓取一些包含你请求中关键词的书籍。这就像图书管理员大喊着:“这里有五本书名里带有‘鸡肉’的书!”然后把它们递给你。你可能会碰巧找到想要的,但通常得到的书要么太陈旧,要么太现代,或者是在讲完全不同类型的鸡肉料理。
如果你问的是一个标准 AI 智能体,它会尝试通过阅读你的请求来变得“聪明”并猜测你的意图。但这就像一个试图在不提问的情况下读懂你心思的图书管理员。如果你说:“这太宽泛了,”AI 可能只是把你的句子改写得更短,而不是真正改变它“寻找书籍的方式”。它陷入了一个不断猜测的死循环。
PAPERPILOT 正式登场。
这篇论文的作者创造了一种新型的“超级图书管理员”智能体,叫做 PAPERPILOT。PAPERPILOT 不仅仅是猜测或喊出关键词,它将寻找论文的过程视为构建一台定制机器(或工作流)的过程。
以下是它的工作原理,使用简单的类比:
1. “乐高蓝图”(工作流)
它不仅仅是在搜索,PAPERPILOT 还利用“乐高积木”构建一个分步蓝图(称为 DAG 或有向无环图)。每个积木都是一个特定的工具:
- 积木 A: “寻找引用了这一篇论文的论文。”
- 积木 B: “过滤掉所有 2020 年以前的内容。”
- 积木 C: “按数学逻辑的相似度进行排序。”
- 积木 D: “阅读摘要并检查是否提到了‘AI’。”
该智能体不仅仅运行一次搜索;它将这些积木组装成一台专门为你的需求设计的独特机器。
2. “对话”(多轮交互)
魔力发生在当你与智能体交谈时。
- 你: “我想要能基于这一篇论文进行改进的论文。”
- PAPERPILOT: “好的,我已经造好了一台机器。但在运行之前,您想要过去 5 年内的论文,还是所有时期的?您想要使用相同“方法”的论文,还是仅仅是相同“主题”的论文?”
- 你: “只要过去 5 年内的,并且必须使用相同的方法。”
- PAPERPILOT: “明白了。”
PAPERPILOT 不仅仅是说“好的”,它会物理性地修改蓝图。它会拿起“时间”积木,将其从“所有时期”改为“过去 5 年”。它会将“主题”积木替换为“方法”积木。它根据你的反馈来精炼这台机器本身。
3. “训练”(学习如何构建更好的机器)
研究人员通过向它展示数千个完美的蓝图案例,教会了 PAPERPILOT 如何这样做。
- 首先,他们向它展示了构建机器的“正确”方式(监督学习)。
- 然后,他们玩了一个游戏:他们拿走一个好的机器并把它搞坏(例如,他们移除了一个过滤器或使用了一个错误的工具)。他们问 AI:“哪个版本更好?”AI 学会了偏好那个可以正常工作的机器,而不是坏掉的那个。这被称为偏好优化。
结果:为什么这很重要
论文将该系统与其他的智能搜索工具进行了对比。以下是他们的发现:
- 更高的准确性: 当 PAPERPILOT 被允许进行对话并精炼其“机器”时,它找到正确论文的频率更高。它从找到正确论文的 58% 提升到了 77%。
- 零故障机器: AI 智能体的一个主要问题是它们有时会尝试构建一台无法工作的机器(比如尝试用一个不存在的工具进行过滤)。PAPERPILOT 将这类错误从 9.5% 降低到了 0%。它学会了构建稳定、可运行的工作流。
- 更便宜、更快: 尽管它是一个规模较小、成本较低的计算机模型,但由于它不会浪费时间去猜测,而是直接构建正确的工具,因此它的表现优于许多更大、更昂贵的系统。
核心结论
这篇论文认为,搜索科学论文不应该是一个“一锤子买卖”式的猜测。它应该是一个协作过程,其中 AI 构建一个定制的搜索策略,你给出反馈,而它会编辑自己的策略,直到达到目标。
PAPERPILOT 证明了,如果你赋予 AI 构建并编辑其自身搜索计划的能力(就像机械师调校汽车引擎一样),而不仅仅是让它阅读你的文字,它就会成为一个更加强大且可靠的研究助手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。