Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
本文介绍了\textsc{Ptah},这是一个多智能体框架,它通过协调规划、利用视觉工作记忆进行证据收集以及由验证器强制执行的报告生成,来产出可靠、忠实于引用且视觉交错的多模态深度研究报告。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你请一位智能助手撰写一份关于复杂主题的详细专业报告,例如“深度神经网络如何工作?”或“电动汽车市场的现状如何?”
在过去,这些助手只会吐出一大段文字。有时,它们会搞错事实(产生幻觉);如果尝试添加图片,这些图片往往随机、无关或摆放得十分突兀,就像由一个没读过说明书的人拼贴而成的拼贴画。
本文介绍了一种名为PTAH的新系统,它被设计为构建此类报告的专业施工队。不同于让一名孤立的工人试图一次性完成所有工作,PTAH 采用了一支在严格监督下协同工作的专业智能体团队,以构建文本与图片完美融合的报告。
以下是 PTAH 的工作原理,分解为简单步骤:
1. 蓝图(规划)
首先,规划智能体(Planner Agent)扮演建筑师的角色。在砌下第一块砖之前,它绘制详细的蓝图。它决定:
- 报告需要哪些部分。
- 需要查找哪些事实。
- 关键的是:图片应放置在哪里,以及需要何种类型的图片(例如,“我们需要在这里放一张图表来展示销售增长”,或者“我们需要一张图解来说明发动机”)。
2. 搜集小队(研究)
接下来,一支研究智能体(Researcher Agents)团队前往互联网搜集材料。
- 它们查找事实并记录下来。
- 它们还像进行视觉寻宝一样行动。它们不只是抓取任何图片,而是寻找与蓝图匹配的具体图片。
- 它们将这些“来源对齐”的图片(即确实来自它们访问过的网站的图片)放入一个特殊的视觉工作记忆中。这就像一个数字工具箱,其中的每件工具(图片)都标明了确切来源及其旨在证明的内容。
3. 质量控制检查员(验证者)
这是最重要的部分。在报告进入下一阶段之前,验证智能体(Verifier Agent)充当严格的建筑检查员。
- 它检查:“你确实找到了你所声称的事实吗?”
- 它检查:“这张图片确实来自你引用的网站吗?”
- 它检查:“这张图片放在这段文字旁边是否合理?”
- 如果答案是“否”,小队必须回去修正。这防止了系统编造虚假事实或粘贴随机、令人困惑的图片。
4. 装配线(撰写)
最后,撰写智能体(Writer Agent)组装最终产品。它不是只输入文字并指望稍后能配上图片,而是像指挥家引领乐团一样,将文字和图片指令一起撰写。
- 它使用经过验证的图片“工具箱”。
- 如果尚不存在所需的特定图表,它可以生成一张。
- 随后,它将整个内容转化为一个经过润色的交互式网页(像一个微型网站),外观专业且易于阅读。
“测试时扩展”(润色)
在将报告交付给你之前,PTAH 会进行最后一轮“润色”。它会再次审视整份报告,以调整间距,确保图片不会过于拥挤,并保证布局在屏幕上看起来美观。这就像房屋出售前的最后一次 walkthrough(全面检查)。
他们如何测试它(PTAHEval)
研究人员意识到,旧的测试仅检查文本是否良好。他们创建了一个名为PTAHEval的新测试来评估整个方案:
- 图片内容质量:图片是否清晰?它是否真正有助于解释文本?
- 呈现质量:最终网页看起来是否美观?它是易于阅读,还是杂乱无章?
结果
当他们将 PTAH 与其他智能系统进行测试对比时:
- 更准确的事实:PTAH 犯的错误更少,引用真实来源的频率高得多。
- 更恰当的图片:图片确实相关且有用,而不仅仅是装饰。
- 更佳的布局:最终报告看起来像专业文件,而非杂乱的草稿。
简而言之:PTAH 就像雇佣一支由建筑师、建造者和检查员组成的团队来建造房屋,而不是让一个人去猜测蓝图并一次性完成所有工作。其结果是一份不仅智能,而且在视觉上可信、易于人类理解的报告。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。