← 最新论文
💻 computer science

HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming

本文提出了 HiVid 框架,首次利用大语言模型作为可扩展的人类代理,通过感知、重排序和预测三个模块解决视频内容感知流媒体中的关键挑战,显著提升了 VOD 和直播场景下的权重预测精度及用户体验质量(QoE)相关性。

原作者: Jiahui Chen, Bo Peng, Lianchen Jia, Zeyu Zhang, Tianchi Huang, Lifeng Sun

发布于 2026-02-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiahui Chen, Bo Peng, Lianchen Jia, Zeyu Zhang, Tianchi Huang, Lifeng Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 HiVid 的新系统,它的核心目标是让网络视频(无论是点播电影还是直播)变得更聪明、更流畅,同时还能让你看得更爽。

为了让你轻松理解,我们可以把看视频的过程想象成**“在拥挤的晚高峰开一辆满载乘客的巴士”**。

1. 核心问题:为什么现在的视频有时候会卡?

想象一下,你的视频数据就像巴士上的乘客。

  • 传统做法:以前的网络传输(ABR 算法)不管乘客是谁,也不管他们想不想看,只是平均分配座位(带宽)。结果就是,精彩的高潮部分(重要乘客)和无聊的过场(不重要乘客)抢一样的资源。一旦路不好(网络波动),精彩部分就会卡顿,观众体验极差。
  • 理想做法:我们需要给“重要乘客”(精彩画面)安排 VIP 座位(高画质),给“无聊乘客”(平淡画面)安排普通座位(低画质)。这样,即使路有点堵,精彩部分也能丝滑播放。

难点在于:怎么知道哪部分是“精彩”的?

  • 人工打分:请人一个个看视频打分,太贵、太慢,直播根本来不及。
  • 旧版 AI:以前的计算机视觉模型像“近视眼”,只能看到局部,不懂剧情,经常把无聊的镜头误判为精彩,或者反过来。

2. HiVid 的解决方案:请一位“超级导演”做裁判

HiVid 引入了 大语言模型(LLM) 作为这个“超级导演”。它不像旧 AI 那样只看画面,它像人一样能理解视频内容(比如知道这是进球瞬间,那是尴尬的冷场)。

但是,直接让 LLM 看整个长视频有两个大问题:

  1. 记性有限:LLM 的“短期记忆”(Token 限制)装不下几小时的视频。
  2. 反应太慢:直播时,等 LLM 看完再打分,黄花菜都凉了。

为了解决这些问题,HiVid 设计了三个聪明的“助手”模块:

助手一:【分段观察员】(感知模块)

  • 比喻:想象 LLM 是个视力不好但很聪明的导演。它不能一次看完整部电影,于是它把电影切成很多小片段(比如每 10 秒一段)。
  • 做法:它只看每个片段里的“关键帧”(比如动作最激烈的那一帧),然后打分。看完一段,它就在小本本上记一句总结(比如“刚才那段很紧张”),带着这个总结去评下一段。
  • 效果:这样既解决了“记性”问题,又让 LLM 能理解上下文,不会断章取义。

助手二:【全局纠偏官】(排序模块 - 专为点播 VOD 设计)

  • 比喻:有时候,导演在评“第 1 段”时觉得“挺好看(70 分)”,评“第 100 段”时觉得“超级好看(85 分)”。但如果把这两段放在一起比,可能第 1 段其实比第 100 段更精彩,只是导演当时没参照物,打低了。这就叫“评分标准不统一”。
  • 做法:HiVid 发明了一种**“导演指导下的合并排序”**算法。它把所有片段的小打分收集起来,让 LLM 像裁判一样,拿着“全局剧本总结”重新排个序。
  • 效果:把原本忽高忽低的分数拉平,确保整部电影的评分标准是统一的,精彩的地方绝对高分。

助手三:【未来预言家】(预测模块 - 专为直播 Live 设计)

  • 比喻:直播是实时的,导演(LLM)还在评上一段,下一段已经播出去了。这时候怎么办?
  • 做法:HiVid 训练了一个**“多模态时间序列预测模型”**。它看着过去的打分趋势,结合画面和文字总结,出未来几分钟的分数会是多少。
  • 关键点:这个预言家是**“自适应”**的。如果 LLM 反应慢了,它就多猜几个未来的分数;如果 LLM 快了,它就少猜点。它像是一个灵活的缓冲器,确保网络传输永远有“未来分数”可用,不会卡顿。

3. 成果如何?

  • 更准:在测试中,HiVid 对视频重要性的判断准确度比现有的最先进模型(SOTA)提高了 11.5%(点播)和 26%(直播)。
  • 更爽:真人测试显示,使用 HiVid 后,观众的主观体验(QoE)相关性提升了 14.7%。简单来说,就是精彩的地方更清晰,卡顿的时候更少
  • 更省:虽然用了昂贵的 LLM,但通过巧妙的分段和预测,它并没有让成本爆炸,反而比请人打分便宜得多。

总结

HiVid 就像给视频流装上了一个“智能大脑”

  1. 它把长视频切成小块,让 AI 导演能看懂(感知)。
  2. 它把分散的评分统一标准,确保不偏不倚(排序)。
  3. 它能在直播时“未卜先知”,提前规划好带宽(预测)。

最终,它让网络视频在有限的带宽下,把最好的画质留给最精彩的瞬间,让你看直播再也不怕转圈圈了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →