← 最新论文
💬 NLP

Baikal: Structured Search for Deep Research over Data Lakes

本文介绍了 Baikal,这是一个通过将任务视为预算搜索问题来解决数据湖深度研究中迭代检索局限性的框架,其中证据被聚类为语义区域并进行自适应探索,以平衡探索与利用,从而实现比现有基准显著更高的报告质量。

原作者: Dhruv Agarwal, Rishitha Guttapalle Mohan, Aarti Kumari, Ashi Sinha, Athulya Anil, Kavitha Srinivas, Horst Samulowitz, Andrew McCallum

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Dhruv Agarwal, Rishitha Guttapalle Mohan, Aarti Kumari, Ashi Sinha, Athulya Anil, Kavitha Srinivas, Horst Samulowitz, Andrew McCallum

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名试图破解重大谜团的侦探,但你拿到的不是几本写满线索的笔记本,而是一个规模如城市般庞大的仓库,里面堆满了数百万份零散的文件、电子表格和手写笔记。这就是“深度研究”(Deep Research)相对于“数据湖”(Data Lakes)而言的世界。在现实世界中,公司和科学家面对的不只是一个需要阅读的文件;他们拥有成千上万张数字表格和数百万段文字,而且这些信息之间并不总是能相互沟通。为了解决一个复杂的问题,人工智能(AI)需要扮演一名超级聪明的调查员:它必须找到正确的线索,弄明白这些线索的含义,并撰写一份能够将所有点连接起来的报告。棘手之处在于,AI 的时间与精力(即“预算”)是有限的。如果它对一个微小的、容易发现的小线索过于兴奋,它可能会错过隐藏在仓库另一个角落里的巨大且重要的秘密。科学家们正在提出的核心问题是:我们如何教会 AI 在一个巨大的、混乱的图书馆中进行探索,而不至于困在某一个过道里,或者错过最好的故事?

这正是 Baikal 背后的研究人员致力于解决的问题。他们意识到,通常 AI 寻找答案的方式——仅仅抓取下一个看起来有趣的文本片段并继续前进——就像一只在同一棵树周围转圈圈的松鼠。它找到了一些坚果,但它从未探索过整片森林。为了解决这个问题,团队发明了一种新方法,将搜索视为一场策略性的探索游戏。

首先,Baikal 不会直接把整个仓库堆到 AI 面前。相反,它扮演着一位能够瞬间整理混乱秩序的资深图书管理员。它将成千上 de 无关的表格和文档归类为“语义区域(semantic regions)”——你可以把它们想象成贴有标签的箱子或社区。其中一个箱子可能存放着所有关于“塞尔维亚运动员”的内容,而另一个则存放着“板球场馆”。这一切在 AI 开始提问之前就已经完成了。

一旦图书馆组织完毕,Baikal 会派遣其 AI 智能体执行一项任务,并赋予其 50 步(或称为“提问次数”)的严格预算。该智能体不会仅仅随机挑选一份文档,而是使用一种聪明的策略来决定下一个要访问哪个“社区”。这就像是在玩一场游戏,你必须决定进入这座巨大豪宅中的哪间房间。有些房间可能已经被探索过且发现是空的,而另一些房间则可能藏满了黄金。Baikel 使用一种数学上的“猜谜游戏”(称为强盗问题/bandit problem)来平衡“访问其认为有希望的房间(利用/exploitation)”与“尝试新的、未被探索的房间以看看是否藏有更好的东西(探索/exploration)”之间的关系。

在选定的社区内部,AI 会生成具体的、有据可查的问题。例如,如果它处于“塞尔维亚”这个箱子里,它可能会问:“塞尔维亚运动员获得的奖牌最多的是哪些运动项目?”然后,它会深入挖掘该箱子中特定的表格和文本以寻找答案。一个特殊的“评判者”AI 会根据答案是否真实、有用以及是否不同于之前发现的内容来为其评分。如果答案很棒,系统就会记住该社区是有价值的。如果答案很乏味,它就会将该区域标记为“完成”并继续前进。

研究结果令人印象深刻。研究人员在两个大规模数据湖上测试了 Baikal:一个包含近 11,000 张表格和 227,000 段文本(约等于维基百科规模),另一个包含超过 2,700 张表格和 13,000 份财务报告。他们给出了 15 个复杂的科研问题让 AI 回答。当他们将 Baikal 与现有的最强方法进行对比时,差异巨大。在维基百科数据上,Baikal 的最佳设置将最终研究报告的质量提升了 28%;在财务数据上,提升了 36%

至关重要的是,论文表明,这种魔力不仅仅在于有了组织的箱子,更在于其搜索策略。当研究人员给一个强大的编程 AI 同样的组织好的箱子,但让它在没有 Baikal 那种聪明的“社区跳转”规则的情况下进行搜索时,它并没有获得同样的提升。这表明,仅仅对数据进行组织是不够的;你需要一种聪明的办法来决定下一步去哪里看。通过将搜索视为一场结构化的探索游戏,而非随机的寻宝活动,Baikal 帮助 AI 智能体即使在与时间赛跑的情况下,也能找到更有用、更独特且有据可查的事实。它将一个混乱的数据倾倒过程变成了一场系统的发现之旅,证明了有时,寻找真相最好的方法是知道在哪里去寻找。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →