← 最新论文
⚡ electrical engineering

ScalablePromptus: Scalable and High-Fidelity Prompt-Based Video Streaming

ScalablePromptus 是一个鲁棒的视频流框架,它通过采用丢弃训练策略和先进的插值技术,克服了现有基于提示的方法在面对网络波动时的脆弱性,从而实现了从任意截断的提示中进行高保真视频重建,并在丢包条件下将性能下降降低了 82%–95%。

原作者: Zehao Cao, Bowei Xu, Xun Cao, Zhan Ma, Hao Chen

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Zehao Cao, Bowei Xu, Xun Cao, Zhan Ma, Hao Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向远在波涛汹涌的大洋另一端的的朋友传递一条秘密信息。在旧时代,你会尝试发送一个沉重且巨大的板条箱,里面装有一张像素完美的日落照片。但海浪很狂暴,板条箱太重了,而且如果哪怕只有一块木板损坏,整张照片都会毁于一旦。这就是传统视频流媒体的工作方式:它试图将图像的每一个微小细节都挤进一个文件中,但当互联网连接出现波动时,画面就会变成模糊、充满色块的乱码。

现在,想象一种更聪明的方法。与其发送那个沉重的像素板条箱,不如发送一张微小的、神奇的小纸条,上面写着:“画一个带有橙色云朵和紫色天空的日落。”你的朋友那里有一台超级聪明的艺术家机器人,他读完纸条后,就能立刻画出这幅画。这就是“基于提示词的视频流媒体”(prompt-based video streaming)背后的理念。这是一个计算机科学的新前沿,我们不再发送图像本身,而是开始发送创建图像的“指令”。其目标是让视频变得如此之小,以至于即使通过最细微的互联网连接也能飞速穿梭,而不至于迷失方向。但这里有一个难点:如果大海变得过于狂暴,导致纸条被撕成两半,机器人可能会画出一个紫色的太阳,或者一个由浓汤组成的蓝天。这正是这篇论文试图解决的问题。


问题所在:当纸条被撕碎时

研究人员从一个名为“Promptus”的酷炫系统出发,该系统在发送这些神奇的“画这个”指令而非沉重图像文件方面已经做得相当不错了。但 Promptus 有一个致命弱点:它非常脆弱。如果互联网连接出现一次卡顿,导致纸条只传到了一半,另一端的机器人就会陷入恐慌。它会尝试用破碎的指令来作画,结果会导致灾难性的后果——质量彻底崩溃,视频变得面目全非。

把它想象成一份食谱。如果你寄出一份蛋糕食谱,上面写着“加入 2 杯面粉、1 杯糖和 3 个鸡蛋”,但邮递员把袋子弄掉了,结果只送到了“2 杯面粉”的部分,你的朋友就不能仅仅靠这部分来做一个“半个蛋糕”。他们可能会尝试只用面粉来烘焙,最后做出一个硬邦邦的面团。旧系统(Promptus)就像那份食谱;它需要完整的清单才能工作,一旦丢失了结尾,整个过程就会失败。

解决方案:“按秩排序”的食谱

由曹泽豪(Zehao Cao)和陈浩(Hao Chen)领导的南京大学团队构建了一个名为 ScalablePromptus 的新系统。他们的核心创意是让指令具有“秩排序”(rank-ordered)特性。

想象你在写一份食谱,但你用一种特殊的方式来写。前几行是最重要的:“面粉、糖、鸡蛋”。接下来的几行是细节:“一撮盐、一滴香草精”。最后几行是华丽的点缀:“撒上一点金粉”。在旧系统中,如果你丢了最后一行,你还能应付;但如果你丢了第一行,你就彻底完了。而在 ScalablePromptus 中,系统经过训练,使得无论纸条被撕掉多少部分,剩余的部分依然能自圆其说。

如果汹涌的大海只送来了前两行(“面粉、糖”),你的朋友仍然可以烤出一个像样的蛋糕。如果送来了前五行,蛋糕会变得更好。如果送来了全部,它就是一件杰作。这被称为“秩排序表示法”。系统强制要求将最关键的信息放在纸条的最前面,因此即使是一个被截断的微小纸条,也能生成一段可辨识的视频。

他们是如何做到的:三个魔法技巧

为了实现这一点,团队使用了三种聪明的技术:

  1. “智能艺术家”训练(Dropout): 他们使用一种“捉迷藏”的游戏来训练 AI 机器人。在训练期间,他们会随机隐藏指令的一部分(比如遮住食谱的最后几个单词),并强迫机器人学习如何利用剩下的内容画出一幅好画。这教会了机器人将最重要的细节放在纸条的最前端。这是他们“Dropout 训练策略”的核心。
  2. “色彩检查”(语义与色彩损失函数): 有时,机器人的画作看起来构图没错,但感觉很奇怪——也许天空太灰了,或者颜色很暗淡。为了修复这个问题,他们加入了“色彩检查”和“意义检查”。他们确保机器人不仅是在复制像素,而是真正理解了场景的“氛围”和“色彩”。他们还修复了一个数学问题,即机器人的指令在不同帧之间移动时会发生“挤压”,导致视频看起来色彩暗淡。他们用一种曲线式的、“球面”的数学方法(称为 Slerp)取代了直线数学方法,从而保持了色彩的丰富度和形状的锐利度。
  3. “无重置”升级: 在旧系统中,如果你的互联网速度在视频中间变快了,系统必须丢弃已经发送的低质量指令并重新开始,发送一套更大的指令集。这非常浪费。有了 ScalablePromps,如果连接变好了,发送方只需把“剩余部分”的纸条(即“金粉”和“香草精”)添加到已有的内容中即可。无需重启,没有浪费。

结果:坚如磐石

研究人员在各种视频(从自然景观到人物动作)上测试了他们的系统。他们模拟了数据包丢失或被截断的恶劣网络环境。

结果令人印象深刻。当互联网连接完美时,他们的系统生成的视频质量略优于旧系统。但当网络连接糟糕、纸条被切断时,差异巨大。当旧系统的视频质量崩塌时,ScalablePromptus 依然能维持运行。论文报告称,该方法将由于这些截断导致的性能下降降低了 82% 到 95%

简单来说:如果旧系统在纸条被撕碎时损失了 100% 的质量,那么新系统仅损失了极小的一部分。它证明了你可以通过发送更聪明、更具韧性的指令,而不是沉重的图像文件,在不稳定且不可预测的连接下传输高质量视频。

为什么这很重要

这不仅仅是一个实验室实验;它是让视频流媒体在现实世界中发挥作用的一大步,因为现实中的互联网连接永远不会是完美的。无论你是在拥挤的体育场、行驶的火车上,还是在 Wi-Fi 信号不稳定的偏远地区,ScalablePromps 都表明,我们终于可以通过发送更聪明、更具韧性的指令,而不是沉重的图像文件,来实现高质量视频的流畅播放,而不再是画面冻结或满屏马赛克。它将一个脆弱的系统变成了一个鲁棒的系统,能够应对互联网复杂多变的现实情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →