Discovery Agents for Real-Time Analytics: Toward Proactive Insight Systems
本文提出了一种多智能体架构,该架构利用大语言模型、Apache Kafka 和 Apache Flink,从实时数据流中自主发现、验证并可视化洞察,通过契约驱动的设计将分析从被动查询转变为主动发现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一家庞大、繁忙且永不眠的新闻编辑室的主管。每一秒,成千上万条新故事(数据)正从世界各地涌入。在过去,你不得不坐在办公桌前,阅读报纸,然后手动决定:“好吧,我想写一篇关于周二有多少人参观公园的报道。”接着,你会指派一名记者去查找那个具体的数字。
问题在于,在实时世界中,有太多的故事需要思考,而当你提出请求时,新闻往往已经发生了变化。你可能会因为不知道要询问什么而错过重大新闻。
本文介绍了一种运营该新闻编辑室的新方法。编辑室不再等待你要求获取故事,而是雇佣了一支AI 侦探团队,他们全天候工作,为你寻找故事、撰写报道、核实事实,甚至围绕这些故事制作电视节目。
以下是这个“发现代理”系统的工作原理,分解为简单步骤:
1. 专业侦探团队(代理)
系统并非让一个巨型 AI 试图包揽一切,而是使用一支拥有特定职责的专业代理团队。他们像接力赛一样,将一份“工作文件夹”依次传递下去。
- 创意生成器:该代理审视原始数据(如一堆未分类的收据),并问道:“嘿,这里有什么有趣的?”它不只是猜测;它会观察数据的形态,并提出诸如“公园活动是否在夏季更频繁?”或“免费活动在布鲁克林是否更受欢迎?”之类的问题。
- 架构师(数据分析师):一旦创意生成器提出了问题,架构师就会将其转化为计划。他们决定如何计算答案。他们使用两种语言编写指令:一种用于快速的一次性检查(Python),另一种用于实时监视数据流(FlinkSQL)。
- 检查员(验证代理):在任何人看到成果之前,检查员会进行核查。架构师是否犯了数学错误?代码是否有误?计划是否安全?如果计划失败,检查员会将其退回给架构师进行修复。这确保了最终结果的可信度。
- 设计师(可视化代理):一旦数学计算完成,设计师就会审视这些数字,并指出:“这看起来像是一个条形图,”或者“这是一条趋势线。”他们会自动创建可视化仪表板,以便人类能够轻松理解发现结果。
- 构建者(部署代理):最后,构建者将代码、图表和计划打包成一个即用的应用程序。这就像交给你一个制作完成的电视节目,你只需按下“播放”键即可。
2. “契约”系统
该系统最重要的部分是代理之间的沟通方式。他们不会只是大声喊出模糊的指令,而是使用类型化契约。
这就像一家严格的快递服务。
- 创意生成器不会只说“这是一个想法”。他们会递交一个标有特定名称的盒子,称为假设。
- 架构师接过那个盒子,并返回一个计划。
- 检查员则返回一份报告。
由于每个盒子都有标签且具有特定格式,系统确切地知道每一条信息的来源。如果你在屏幕上看到一张图表,你可以一路追溯回最初的问题以及计算它的代码。这使得整个过程透明且安全。
3. 现实世界示例
该论文在三个不同的“新闻编辑室”中测试了该系统:
- 零售:系统查看了商店销售数据,自动发现了诸如“周二下雨时人们会购买更多雨伞”的模式,并构建了展示这一情况的仪表板。
- 金融:它监视资金的流入流出,并在无需人类告知其寻找什么的情况下,标记出异常的峰值或不寻常的活动。
- 公共数据(纽约市公园):系统分析了一组公园活动数据集。它自动发现活动集中在夏季,大多在周末,且大多数是免费的。随后,它构建了一个完整的网站来展示这些事实。
核心要点
本文的主要观点是我们使用数据方式的转变。
- 旧方式:你提出问题,计算机给出答案。(被动反应)
- 新方式:计算机审视数据,自行发现有趣的问题,回答问题,并向你展示结果。(主动出击)
作者认为,由于数据变化如此迅速,我们无法通过手动提问来跟上节奏。我们需要一个像主动合作伙伴一样的系统,不断扫描地平线以寻找洞察,自我核查工作,并提供现成的应用程序,以便人类能够专注于做出决策,而不是编写代码。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。