← 最新论文
💬 NLP

Sandboxed Coding Agents are Competitive Omni-modal Task Solvers

本文证明了配备沙盒工具的纯文本编程智能体可以通过将多模态问题转化为信息处理工作流,从而有效地解决复杂的音视频任务,其表现往往优于原生全模态模型,同时还引入了 Code-X 训练方案和 TerminalBench-O 基准测试,以推进开源多模态处理的发展。

原作者: Dongping Chen, Xuanao Huang, Zhihan Hu, Qingyuan Shi, Dianqi Li, Tianyi Zhou

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Dongping Chen, Xuanao Huang, Zhihan Hu, Qingyuan Shi, Dianqi Li, Tianyi Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:“聪明实习生” vs. “超级天才”

想象一下,你有一个由视频剪辑、音频录音和文档组成的庞大且复杂的拼图,你需要解开它。

长期以来,科技界一直认为你需要一位**“超级天才”**(原生全模态 AI)来解决这个问题。这位“超级天才”是一个试图将整个视频和音频文件整体“吞下”的模型,试图在脑海中同时理解每一帧画面和每一个声波。

这篇论文认为,你其实并不需要一位“超级天才”。相反,你可以使用一位**“聪明实习生”**(编程智能体/Coding Agent)。

“聪明实习生”不会试图吞下整个视频。相反,它拥有一个工具箱。它观察文件,拿起特定的工具(比如视频编辑器或语音转文字工具),提取出它所需的微小信息片段(比如一段转录文本或某一特定帧),然后利用这些微小的证据来解开拼图。

该论文的核心观点是: 使用工具的“聪明实习生”实际上比试图一次性记住所有内容的“超级天才”更快、更便宜,而且通常表现得更好。


“聪明实习生”是如何工作的

把“聪明实习生”想象成一名在图书馆里的侦探。

  1. 旧方法(原生模型): “超级天才”走进图书馆,试图同时阅读书架上的每一本书、听完每一盘磁带并看完每一部电影。它会被信息淹没,消耗大量能量(Token),并且有时会因为试图处理过多内容而忽略细节。
  2. 新方法(沙盒智能体): “聪明实习生”走进图书馆,但它只拿走它需要的特定书籍或磁带。
    • 如果它需要知道某人说了什么,它会使用语音转文字工具将音频转化为书面转录文本。
    • 如果它需要知道视频里有什么,它会使用帧提取工具抓取几张关键图片。
    • 然后,它通过阅读这些转录文本或查看这些图片来回答问题。

结果: “聪明实习学家”消耗的能量(Token)要少得多,因为它不需要把整个图书馆都装进脑袋里。它只携带它所需的特定证据。

证据:谁赢得了比赛?

研究人员在涉及视频和音频的四个不同“拼图竞赛”(基准测试)中对这一方法进行了测试。

  • 结果: 使用了 GPT-5.4 和 Claude Opus 等模型的“聪明实习生”,在多个类别中击败了最优秀的“超级天才”模型(如 Gemini 3.1 Pro)。
  • 类比: 这就像是在进行一场比赛:一个人试图背诵整部百科全书来回答一个常识问题,而另一个人则知道如何在图书馆索引中准确查找特定页面。拥有索引的人赢得了比赛,因为他们既高效又精准。

为什么他们能赢?(“工具”优势)

研究发现,“聪明实习生”之所以获胜,是因为它们将视频/音频视为需要处理的原材料,而不是需要存储的记忆

  • 选择性检索: 与其观看一场 90 分钟的足球赛来寻找一个进球,不如让实习生使用工具扫描视频中的“进球”事件,并只观察那 30 秒钟。
  • 错误修正: 如果某个工具失效了(例如,语音转文字机器被噪音干扰而产生混乱),实习生可以尝试使用不同的工具,或者编写一个小脚本来修复它。而“超级天才”往往会直接卡在噪音中无法自拔。

哪里出了问题?(失败分类学)

即使是“聪明实习生”也会犯错。研究人员创建了一个“失败菜单”来解释原因:

  1. 听觉失灵: 语音转文字工具误听了音频。
  2. 视觉失灵: 工具选取了错误的视频帧。
  3. 过早放弃: 智能体在找到答案之前就停止了寻找线索。
  4. 事实错误: 它找到了正确的视频,但在数据库中查找了错误的信息。
  5. 计算错误: 它掌握了正确的事实,但计算过程出错了。
  6. 工具损坏: 计算机没有安装运行该工具所需的软件。

我们能否教实习生变得更聪明?(技能注入)

研究人员问道:“我们能否在不重构其大脑的情况下,让实习生变得更聪明?”

他们尝试了三种方法:

  1. 人类教练: 给实习生一份由专家编写的手册。
  2. 自我练习: 让实习生尝试、失败,并根据简单的“对/错”检查来调整自己的规则。
  3. 从日志中学习: 让第二个 AI 观察实习生的工作日志,找出哪些做法有效以及哪些无效,并为实习生编写一份新的“最佳实践”指南。

胜出者: 日志驱动的自我蒸馏(Learning from Logs) 效果最好。这就像是有位教练在复盘实习生的比赛录像,并指出:“你总是忘了在猜测时间之前先检查时间戳。”这显著提高了实习生的准确性。

未来:从“理解”到“执行”

论文指出,我们正在从 AI 仅仅“理解”媒体(回答关于视频的问题)的时代,转向 AI “处理”媒体(编辑视频、剪辑音频、创建新文件)的时代。

他们引入了一个新的测试,称为 TerminalBench-O,用以衡量这种能力。

  • 任务: 不仅仅是问“这个视频里有谁?”,AI 还必须创建一段精彩集锦、编写一段说明文字并保存文件。
  • 挑战: 这要难得多。即使是最优秀的 AI,也只能完成约 24% 的此类任务。这需要长期的规划和可靠的工具使用能力,这也是这些“聪明实习生”的下一个前沿领域。

总结

要解决复杂问题,你并不需要一个能记住每个视频和声音的巨大、昂贵的脑容量。你需要的是一个聪明的、高效的智能体,它知道如何使用工具来提取所需的特定证据。与试图一次性“理解”一切相比,这种方法更便宜、更快,而且通常更准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →