← 最新论文
💬 NLP

HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding

本文提出了名为 HERMES 的免训练架构,通过将 KV 缓存构建为分层记忆框架来复用紧凑的缓存信息,从而在无需辅助计算的情况下实现了兼具低显存开销、实时响应(TTFT 提升 10 倍)和高精度的流式视频理解。

原作者: Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 HERMES 的新方法,旨在解决一个非常棘手的问题:如何让 AI 像人类一样,实时、流畅地“看”懂正在播放的长视频,同时还不把电脑的内存撑爆?

为了让你轻松理解,我们可以把整个过程想象成**“一位超级聪明的图书管理员(AI)在管理一个不断涌入的图书馆(视频流)”**。

1. 现在的困境:图书馆要炸了

想象一下,你正在给 AI 播放一部长达几小时的电影。

  • 传统 AI 的做法:它试图把每一帧画面(每一个瞬间)都记在脑子里(显存)。就像图书管理员试图把每一本书都塞进自己的口袋里。
  • 后果
    1. 内存爆炸:口袋太小,书太多,最后书掉了一地(显存溢出,程序崩溃)。
    2. 反应迟钝:当用户问“刚才那个反派说了什么?”时,管理员得在堆积如山的书里翻找半天,回答很慢(延迟高)。
    3. 顾此失彼:为了塞进新书,它不得不把旧书扔掉,结果忘了电影开头的情节。

2. HERMES 的解决方案:分层记忆法

HERMES 的核心思想是:不要试图记住所有细节,而是像人类大脑一样,建立一套“分层记忆系统”

作者发现,AI 模型内部的“注意力机制”(它看东西的焦点)其实天然就有层次感。HERMES 利用这一点,把 AI 的KV Cache(一种临时记忆缓存)变成了一个三层结构的记忆库

🧠 第一层:浅层 = “感官记忆”(像刚喝的一口咖啡)

  • 特点:只记得最近发生的事。
  • 比喻:就像你刚喝了一口咖啡,嘴里还有味道,但几秒后味道就淡了。
  • HERMES 的做法:对于视频里最新的画面,AI 会非常关注,保留得最完整。一旦画面变旧,它就迅速遗忘。这保证了 AI 对“当下”的反应极快。

🧠 第二层:深层 = “长期记忆”(像刻在石头上的故事)

  • 特点:只记得关键节点(比如每一帧画面的核心内容)。
  • 比喻:就像你记不住电影里每一秒的对话,但你记得“主角在 10 分钟时拔出了剑”这个关键情节。
  • HERMES 的做法:对于很久以前的画面,AI 不再死记硬背每一帧,而是提取出“关键帧”或“摘要”。就像把一本厚厚的书压缩成一张“剧情大纲”,只保留最核心的信息。

🧠 第三层:中层 = “工作记忆”(像书桌上的便签)

  • 特点:连接过去和现在。
  • 比喻:就像你在书桌上的便签,既记着刚才的灵感,也记着昨天的计划,用来处理当下的任务。
  • HERMES 的做法:这一层负责把“最近的画面”和“关键剧情”平滑地融合在一起,确保 AI 不会突然断片。

3. 三大魔法技能

为了完美运行这套系统,HERMES 还用了三个小技巧:

  1. 智能丢弃(Hierarchical Management)
    • 不像以前那样“谁先来谁先走”(FIFO),而是根据记忆的重要性来丢弃。重要的“关键帧”永远留着,不重要的“过场画面”果断扔掉。
  2. 跨层平滑(Cross-Layer Smoothing)
    • 比喻:防止“精神分裂”。有时候浅层觉得某画面重要,深层觉得不重要,HERMES 会协调它们,确保记忆的一致性,不会让 AI 产生幻觉。
  3. 重新编号(Position Re-Indexing)
    • 比喻:就像图书馆的书被抽走后,书架上的编号乱了。HERMES 会实时把剩下的书重新排号,让 AI 知道“这是第几本书”,防止它因为位置错乱而看不懂剧情。

4. 为什么它这么牛?(成果)

  • 🚀 速度极快(10 倍提升)
    • 以前的方法,用户一问问题,AI 得去硬盘里翻旧数据(像去仓库取书),很慢。
    • HERMES 不需要去外部找数据,所有需要的信息都在它自己的“分层记忆”里。用户一问,它立刻就能回答(延迟极低)。
  • 🧠 省内存(减少 68% 的 Token)
    • 它能把视频信息压缩掉一大半,但准确率反而更高。就像把一部 2 小时的电影压缩成 1 小时的精华版,关键剧情一个没少,但看的人更累了。
  • 🛠️ 无需训练(Training-Free)
    • 它不需要重新教 AI 怎么看书,而是直接给现有的 AI 戴上一副“智能眼镜”,让它学会怎么高效管理记忆。这就像给老手机装了一个新的内存管理 APP,立马变流畅。

总结

HERMES 就像是给 AI 装了一个**“人类大脑式的记忆管理系统”。它不再死记硬背每一帧画面,而是懂得“抓重点、记当下、忘细节”**。

这使得 AI 能够:

  1. 实时观看超长视频(比如直播、监控)。
  2. 秒回用户的问题(没有卡顿)。
  3. 不花昂贵的显卡钱(内存占用极低)。

这项技术让 AI 从“只能看静态图片”进化到了“能像人一样实时看直播、聊剧情”的新阶段。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →