← 最新论文
💻 computer science

MMTB: Evaluating Terminal Agents on Multimedia-File Tasks

本文介绍了包含 105 项任务的 MultiMedia-TerminalBench(MMTB)基准测试以及 Terminus-MM 框架,旨在评估终端智能体理解并操作音频和视频文件的能力,从而弥补现有基准测试主要聚焦于文本和代码的不足。

原作者: Chiyeong Heo, Jaechang Kim, Junhyuk Kwon, Hoyoung Kim, Dongmin Park, Jonghyun Lee, Jungseul Ok

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Chiyeong Heo, Jaechang Kim, Junhyuk Kwon, Hoyoung Kim, Dongmin Park, Jonghyun Lee, Jungseul Ok

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《MMTB:评估多媒体文件任务中的终端智能体》的解释,已用通俗易懂的语言并辅以生动的类比进行翻译。

宏观图景:“盲”机器人 vs. “看得见”的机器人

想象一下,你有一个非常聪明的机器人助手,它生活在计算机的命令行界面(一个纯文本界面)中。这个机器人擅长阅读文本、编写代码和整理文件。但是,当你要求它编辑视频、剪辑歌曲,或者在会议录音中找到特定的发言人时,会发生什么呢?

目前,大多数这类机器人对音频和视频文件的实际内容是“视而不见”的。它们只能“看到”文件名(如 meeting.mp4)或文件大小。为了理解内容,它们必须依赖“拐杖”——即特殊的基于文本的工具,试图通过将视频转换为数字列表或将音频转换为粗略的转录文本来猜测发生了什么。这就像试图通过只看电影海报并阅读一个没去过现场的人写的模糊摘要来描述一部电影。

这篇论文介绍了一种测试这些机器人的新方法,以及一套新工具,帮助它们真正看见和听见它们正在处理的内容。


1. 新测试:MMTB(“多媒体障碍赛”)

作者们创建了一个名为MMTB(MultiMedia-TerminalBench,多媒体终端基准)的新测试。把它想象成驾驶考试,但机器人不是开车,而是仅使用键盘和命令行工具来编辑多媒体文件。

  • 任务:共有 105 个不同的挑战。范围从“剪辑视频以仅显示正在说话的人”到“在播客中找到特定声音发生的确切时刻”。
  • 来源:这些并非凭空捏造的谜题。它们基于人们在自由职业网站(如 Upwork)上实际从事的工作,例如为 YouTube 编辑视频、转录会议记录或修复电影音频。
  • 目标:机器人必须生成一个最终文件(如剪辑后的视频或时间戳的 JSON 列表),以证明它理解了内容。

类比:想象你让一位厨师做一道特定的菜。

  • 旧测试:你给厨师一份食材清单(文本),让他们烹饪。他们尝不到食物的味道,只是盲目地遵循食谱。
  • MMTB:你给厨师实际的食材,并说:“尝尝这个酱汁,调整盐量直到完美。”机器人必须真正“品尝”(感知)音频和视频才能成功。

2. 新工具:Terminus-MM(“超级感官”装备)

为了测试当机器人拥有“超级感官”时表现是否更好,作者们构建了一个名为Terminus-MM的新系统。

  • 旧方法(盲):机器人必须运行像 ffmpeg 这样的命令,将视频转换成一堆静态图像,然后运行另一个命令将这些图像转换为文本描述,然后再尝试做出决定。这是一条漫长且混乱的猜测链条。
  • 新方法(Terminus-MM):该系统赋予机器人直接的“耳朵”和“眼睛”。它可以“直接聆听这个音频文件”或“直接观看这个视频片段”,而无需先将其转换为文本。

类比

  • 盲机器人:试图通过阅读歌词和节奏的文本描述来识别一首歌。
  • Terminus-MM:戴上耳机直接听这首歌。

3. 他们的发现(结果)

作者测试了不同版本的机器人,看看哪些能通过 MMTB 测试。

  • “盲”机器人失败了:只能阅读文本或将文件转换为文本的机器人(如标准的 Codex CLITerminus-2)表现挣扎。它们只解决了约 16% 的任务。它们迷失在为了“猜测”内容而需要的漫长命令链条中。
  • “看得见”的机器人赢了:当机器人能够直接访问音频和视频(Terminus-MM)时,其成功率显著提升(最佳模型高达 37%)。
  • 效率至关重要:“盲”机器人不仅失败率更高,而且更慢、成本更高。因为它们必须运行如此多的转换工具来猜测内容,所以消耗了更多的金钱和时间。“看得见”的机器人则直奔主题。

类比
想象你需要在停车场里找到一辆特定的红色汽车。

  • 盲机器人:给每辆车拍张照片,写下每辆车的描述,然后阅读这些描述来找到红色的那辆。这既耗时又容易出错。
  • 看得见机器人:直接看着停车场,立即指出那辆红色的汽车。

4. “金发姑娘”问题:工具太多反而不好

最有趣的发现之一是关于如何向机器人呈现工具。

  • 错误:如果你给机器人所有可能的工具(麦克风、相机、放大镜),即使任务只涉及视频文件,机器人也会感到困惑。它可能会浪费时间试图“聆听”一个没有独立音轨的视频文件,或者陷入不断检查的循环中。
  • 修正:最好的系统(Terminus-MM)明智地提供工具。如果任务只有视频文件,它会隐藏音频工具;如果只有音频,它会隐藏视频工具。这防止了机器人在死胡同里浪费时间。

类比
如果你在做蛋糕,你不需要锤子或扳手。如果你把装满所有东西的工具箱递给面包师,他们可能会花 20 分钟试图弄清楚是否需要用锤子敲面粉。最好的系统只递给他们搅拌器和碗。

总结

这篇论文认为,为了让 AI 智能体真正掌握涉及视频和音频的现实世界任务,它们不能仅仅是“文本处理器”,去猜测文件内部是什么。它们需要原生访问权限,直接听见和看见文件。

  • 没有这种访问权限:机器人速度慢、成本高且容易出错,因为它们依赖笨拙的变通方法。
  • 拥有这种访问权限:机器人变得高效得多且更准确,尽管仍需小心引导,以免被不需要的工具分散注意力。

论文结论指出,终端智能体的未来在于结合直接感知(听/看)与可靠的工具使用(执行命令),而不是试图先将所有内容都转换为文本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →