← 最新论文
🤖 AI

AgenticData: An Agentic Data Analytics System for Heterogeneous Data

AgenticData 是一个创新的智能体系统,它通过利用具有反馈驱动规划和语义优化的多智能体协作策略,实现通过自然语言查询对异构结构化与非结构化数据进行自主分析,从而获得优于现有方法的卓越准确性。

原作者: Ji Sun, Guoliang Li, Peiyao Zhou, Yihui Ma, Jingzhe Xu, Yuan Li

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Ji Sun, Guoliang Li, Peiyao Zhou, Yihui Ma, Jingzhe Xu, Yuan Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解开一个巨大的谜团,但线索散落在各处。有些线索整齐地记录在带有“姓名”、“日期”和“金额”等清晰列名的账本中。另一些线索则杂乱无章,埋藏在成千上万份未经组织的日记、扫描文档和网页中,信息隐藏在段落文字之中。长期以来,计算机非常擅长阅读这些整齐的账本,却很难理解那些杂乱的日记。它们通常需要人类专家编写复杂的指令(代码)来将两者之间的点连接起来。这就像是要求一名图书管理员寻找一个特定的事实,但在他们开始寻找之前,你必须先写出整个搜索引擎的代码。这既缓慢、昂贵又令人沮丧。计算机科学领域的这个大问题是:我们能否构建一个系统,让它充当一名超级聪明的侦探,既能阅读整齐的账本,也能理解杂乱的日记,并能理解我们的自然语言需求,从而独自解决这个谜团?

由此,AgenticData 应运而生,这是一个旨在成为那名超级聪明侦探的新型系统。把它想象成一个在繁忙新闻编辑室里协同工作的专业化智能体团队。它并没有使用一个试图同时处理所有事情的巨大大脑,而是采用了“多智能体”方法。它拥有一个负责扫描整个图书馆以了解存在哪些书籍及文件及其相互关系的数据剖析师(Data Profiler);它有一个负责制定逐步执行策略以回答问题的规划者(Planner);它有一个充当严厉编辑的角色,在任何人开始工作前检查计划是否存在错误,即验证者(Validator);还有一个负责记录过往成功与失败经验,确保团队不再重蹈覆辙的记忆管理器(Memory Manager)。当你用自然语言提出问题时——例如“显示所有获得超过10个冠军的篮球运动员的总薪水”——这个团队就会通力合作,寻找正确的数据,计算出数学结果,并在你无需编写任何一行代码的情况下给出答案。

AgenticData 背后的研究人员发现,这种团队协作的方法效果极佳。在实验中,他们通过五个不同的基准测试(类似于数据分析的标准考试)对该系统进行了测试。结果显示,AgenticData 的准确性显著高于目前的最佳方法。在一些困难的任务中,它的准确率比其他顶尖系统提高了近 30%。例如,在一个涉及真实银行数据的数据库中,它比排名第二的竞争对手高出了近 20%。该系统并非仅仅靠猜测,而是使用了一个巧妙的反馈循环。如果“验证者”发现了计划中的错误,系统并不会直接放弃。它会将错误存储在记忆中,从中学习,然后尝试一个新的、更好的计划。这种“尝试、失败、学习、再尝试”的过程,使其能够解决困扰其他系统的复杂谜题。

最令人兴奋的发现之一是 AgenticData 如何处理“杂乱”的数据。传统系统在无法找到文档清晰结构时往往会表现挣扎。然而,AgenticData 利用其智能体将非结构化文本分解为有用的片段,寻找不同文档之间的联系,甚至将它们与结构化表格进行关联。在涉及维基百科文章和真实银行记录的测试中,该系统成功地在这些混乱的数据源中寻找到精确答案。研究人员还测量了系统的成本和速度。他们发现,通过优化智能体使用“脑力”的方式(具体而言,是调用大语言模型的次数),AgenticData 能够以大约其他方法一半的成本实现高质量的结果。

论文明确反对仅靠一个单一的、庞大的 AI 模型来独立处理所有这些任务的观点。他们发现,如果依赖单个模型来进行规划、执行和验证所有环节,往往会导致错误和“幻觉”(即 AI 编造事实)。相反,他们的实验表明,将工作分解为一个具有特定角色和稳健记忆系统的协作团队才是成功的关键。他们同时也排除了人类需要为每一次新分析编写代码的设想;他们的系统展示了其能够自主生成必要的步骤。虽然该系统并不完美——处理复杂查询仍需几分钟时间,且有时在面对极其罕见的数据模式时会感到吃力——但结果表明,这是向前迈出的重要一步。该团队已经将此系统部署在包括银行和电网公司在内的现实场景中,目前正帮助专业人士在无需数据科学家为每个问题编写代码的情况下分析复杂数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →