Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing
本文介绍了一种认知结构化多模态智能体,该智能体通过将视觉信息外部化为具有结构化抽象与检索功能的情景记忆,克服了单体统一模型在长程任务中的局限性,在实现比更大规模基准模型更高准确率与效率的同时,提供了一个可扩展的工具增强型部署框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图与一位同样是艺术家的朋友进行一场漫长而深入的对话。你想聊聊你看到的一座山,然后画出那座山,接着改变画中天气,再放大观察你在生物书上看到的一个细胞,编辑那个细胞,最后回到最初的那座山,为它加上一场流星雨。
当今大多数“超智能”的 AI 模型试图通过将你发送过的每一张图片和每一个词都保存在它们的活跃大脑(称为“上下文窗口”)中来实现这一点。这就像是试图在阅读一页纸的同时,手里还要捧着一整个图书馆的书。随着对话变长,你的双手变得太满,你会掉落东西,并开始混淆哪本书属于哪个故事。这篇论文称之为“视觉标记爆炸”(visual token explosion),并指出仅仅通过增大 AI 的大脑(增加参数量)并不能解决这个混乱问题;这只会让这座图书馆变得更沉重,更难搬运。
论文的核心思想:“聪明图书管理员”智能体
与其将整个图书馆塞进 AI 的手中,作者提出了一种名为**认知结构化多模态智能体(Cognitive-structured Multimodal Agent)**的新系统。你可以将这个智能体视为不仅仅是一个大脑,而是一个由三个特定角色组成的高度组织化的团队:
- 感知抽象引擎 (PAE): 这是“图书管理员”。当你向它展示一张图片时,它不会在活跃对话中保留整个巨大的图像文件。相反,它会快速写下一份整洁的摘要卡片(带有标签、描述和一个微缩缩略图),并将其存档到特殊的**情景视觉记忆(Episodic Visual Memory)**中。这就像是拍下一本书的封面并写下一句摘要放在卡片上,然后把沉重的书放回书架。
- 认知检索引擎 (CoRE): 这是“搜索者”。当你询问关于 15 轮对话前发生的事情时,搜索者不会查看图书馆里的每一张卡片。它使用一种智能策略来寻找与你当前问题相关的特定卡片。
- 多模态执行控制器 (MEC): 这是“经理”。它观察你的需求,抓取搜索者找到的特定卡片,然后决定:“我们需要画一张新图吗?编辑一张旧图?还是仅仅进行聊天?”随后,它将指令发送给正确的工具。
为什么这很重要(研究结果)
作者使用他们构建的新基准测试 M2CA-Bench,针对具有切换话题或对比很久以前图像等复杂任务的 20 轮对话,将他们的团队与“沉重图书馆”方法(单体模型)进行了对比测试。
以下是他们的发现:
- 准确性: 他们的 80 亿参数智能体在英语检索任务中的准确率达到了 91.4%。相比之下,他们测试的最大的“全能型”模型(320 亿参数)仅达到了约 83.2%。在处理最难的问题时,这种差距进一步扩大,因为大模型在记忆 20 轮前的细节方面表现挣扎。
- 速度: 由于该智能体只查看少数相关的卡片,而不是整个图书馆,因此速度快了近两倍。它每轮耗时 12.7 秒,而那些试图阅读所有内容的模型则需要 23.1 秒。
- 质量: 因为该智能体记住了正确的图像,它生成的或编辑的图片质量更高。作者使用另一个 AI 进行测量,其智能体的综合得分达到了 8.49(总分 10 分),击败了 320 亿参数的基准模型。
他们排除了什么
论文明确反对“越大越好”的观点。他们证明了,如果只是单纯地扩展单个巨型模型(如 32B 基准模型)而不建立记忆系统,会导致“语义漂移”,即 AI 会忘记正在谈论的内容或混淆图像。他们还发现,如果仅使用文本摘要(而不保留视觉缩略图)来记忆图像,在处理困难任务时表现极差,准确率会降至 24.4% 左右。这表明,对于视觉记忆,你确实需要保留一个视觉“缩略图”,而不仅仅是文字描述。
他们是如何训练该智能体的
你可能会问,“智能体如何知道该抽取哪张卡片?”作者注意到,现有的数据集并没有教会 AI 如何检索旧图像。因此,他们构建了一个统一场景引擎(Unified Scenario Engine)。这是一个能够自动生成数千个虚构对话,并包含每一步应记住哪个图像的“正确答案”的工具。他们分两步训练该智能体:
- 首先,他们使用标准的监督微调(SFT)来教导“搜索者”如何找到正确的卡片。
- 然后,他们使用了一种**强化学习(RL)**技术。在这个阶段,只有当智能体选择了正确的卡片且最终结果良好时,它才会获得“奖励”。这教会了“图书管理员”(PAE)如何编写专门用于辅助后续“搜索者”工作的优质摘要卡片。
总结
作者认为,对于涉及图片、文本和绘画的长篇复杂对话,一个结构化的记忆系统比单纯做大 AI 的大脑是更好的路径。他们甚至发布了一个名为 CMA-Harness 的工具,将整个系统与网页搜索和图像编辑工具整合在一起,证明了这种“专家团队”的方法在现实世界中是行之有效的。
简而言之:不要试图同时记住一切。要做一个好的图书管理员,把卡片整理好,只取出你需要的那张。这才是赢得长线竞争的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。