← 最新论文
💻 computer science

DRACULA: Hunting for the Actions Users Want Deep Research Agents to Execute

本文介绍了 DRACULA,这是首个捕捉科学深度研究智能体在中间步骤上专家用户反馈的数据集,其结果表明利用用户的选择历史可显著提升对首选动作的预测能力,并凸显了决定执行哪些动作而非仅仅如何执行动作这一关键挑战。

原作者: Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Rachel Rudinger, Eunsol Choi, Jordan Lee Boyd-Graber, Doug Downey, Aakanksha Naik

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Rachel Rudinger, Eunsol Choi, Jordan Lee Boyd-Graber, Doug Downey, Aakanksha Naik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位超级聪明的研究助理(一个 AI 智能体),它能阅读数千篇科学论文,并为你撰写一份长篇、详细的报告。在过去,如果你不喜欢最终的报告,你只能说“这很糟糕”或“这很好”。但这就像告诉厨师“汤的味道不对”,却不告诉他们是用盐过多、忘了放洋葱,还是把大蒜烧焦了。你不知道哪一步出了问题,所以厨师无法真正学会下次如何修正。

这篇论文DRACULA介绍了一种与这些研究助理交流的新方式。研究人员没有让用户只评判最终的“汤”,而是让用户在汤制作完成之前,就对食材和步骤进行品尝测试。

以下是他们所做工作和发现的分解,使用了简单的类比:

1. 问题:“黑盒”报告

通常,当 AI 撰写研究报告时,它会在过程中做出数百个微小的决定:我应该阅读哪些论文?我应该添加图表吗?我应该用类比来解释这个概念吗?
以前,用户只能看到最终结果。如果报告很无聊,AI 并不知道是因为它选错了论文,还是因为写作风格太生硬。这是一个“黑盒”。

2. 解决方案:“食谱卡”方法

研究人员构建了一个系统,在 AI 撰写报告之前,它会向用户展示一个可能操作的菜单(就像一张食谱卡)。

  • 菜单:“我可以添加一个关于数据集的部分”,“我可以用一个现实世界的例子来解释这一点”,或者“我可以只关注过去五年的研究”。
  • 用户的任务:用户选择他们想要的操作(就像在食谱上勾选复选框)并解释原因。
  • 结果:然后,AI 仅使用那些被选中的操作来撰写报告。最后,用户评判:“你真的按我说的做了吗?”

他们从 19 位计算机科学领域的专家研究人员那里收集了超过8,000个此类“操作选择”和5,000个“执行检查”。

3. 重大发现:“知道你想要什么”比“做到它”更难

研究人员发现了两个令人惊讶的事实:

  • AI 实际上非常擅长执行指令。 一旦用户说“添加一个图表”,AI 通常能画出一个不错的图表。
  • AI 非常不擅长在一开始就猜出你想要什么。 AI 经常建议错误的操作。例如,当用户只想要一个简单的摘要时,它却建议添加图表。

类比:想象一位服务员,他非常擅长完全按照你的订单烹饪牛排(五分熟,配蒜香黄油)。但这名服务员非常不擅长猜测你其实想要的是沙拉。问题不在于烹饪,而在于猜测。

4. “读心”实验

团队问道:我们能否训练计算机去猜测人类会做出什么选择?
他们尝试通过观察不同的线索来训练 AI 模型预测用户的选择:

  • 线索 A:用户之前读过哪些论文?(帮助不大)。
  • 线索 B:用户他们喜欢什么?(例如,“我喜欢简短的报告”)。(帮助不大)。
  • 线索 C:用户过去实际选择了哪些操作?(这是获胜者)。

教训:人们的行动比言语更响亮。如果你告诉朋友“我爱吃辣”,但你总是点清淡的汤,你的朋友应该听你点了什么,而不是听你说了什么。AI 学到,查看用户过去的“勾选标记”是猜测他们接下来会选什么的最好方法。

5. “改变主意”的问题

研究人员还发现,人类偏好是棘手的。有时,用户今天选择了一个操作,但如果在几个月后再次询问,他们可能会选择不同的东西,因为他们的目标发生了变化。

  • 例子:用户今天可能想要“详细的技术步骤”,因为他们正在构建一个项目。下个月,他们可能想要“高层摘要”,因为他们只是想理解基础知识。
  • 结论:你无法永远完美地预测人类想要什么。有时,你只能像“食谱卡”菜单那样去询问他们,因为他们的目标会像风一样变化。

6. 最终结果:更好的“食谱”

因为他们了解到查看过去的操作有助于预测,所以他们构建了一个系统,利用用户的历史记录来自动推荐更好的“菜单项”。

  • 当一个有选择“对比表格”历史的用户提出新问题时,系统更有可能建议:“我应该添加一个对比表格吗?”
  • 这使得用户对建议感到更加满意,即使该系统并没有完全了解他们的一切。

总结

DRACULA是一个数据集和一项研究,表明对于 AI 研究智能体而言,最困难的部分不是撰写报告,而是弄清楚采取哪些步骤才能使报告有用。通过让用户在工作开始之前选择步骤(操作),并通过研究这些选择,我们可以构建出更懂我们的 AI。

该论文得出结论,虽然 AI 在执行工作方面变得越来越好,但真正的挑战在于一开始就决定要做什么工作。解决这一问题的最佳方法是倾听用户实际做了什么,而不仅仅是听他们想要什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →