← 最新论文
💻 computer science

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

该论文提出了面向长视频音频 - 视觉脚本生成的新任务 OmniScript,通过构建首个标注基准、设计分层评估框架,并训练了一个采用链式思维微调与强化学习策略的 8B 参数多模态模型,在长叙事理解与脚本生成任务中实现了超越更大开源模型并媲美顶尖商业模型(如 Gemini 3-Pro)的性能。

原作者: Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 OmniScript 的新技术,它就像是一个超级智能的“电影编剧助手”

想象一下,你给这个助手看一整部电影(比如 30 分钟甚至更长),它不仅能看懂画面,还能听懂声音,然后立刻为你写出一份极其详细的剧本。这份剧本不仅告诉你“谁在说话”、“说了什么”,还记录了“谁在做什么动作”、“表情是什么”、“背景音乐听起来怎么样”,甚至精确到每一秒发生在哪里。

为了让你更容易理解,我们可以用几个生动的比喻来拆解这项技术:

1. 核心任务:从“看热闹”到“写剧本”

以前的 AI 看视频,就像是一个普通的观众,看完后只能大概说:“哦,这里有个男人在追车,挺紧张的。”
而 OmniScript 则像是一个专业的场记兼编剧。它看视频时,脑子里会同时运行两个频道:

  • 视觉频道:看到谁穿了什么衣服、做了什么动作、表情是愤怒还是悲伤。
  • 听觉频道:听到背景音乐是欢快的还是压抑的,听到了谁在说话(哪怕是画外音),甚至听到了脚步声的轻重。

它把这些信息整合起来,生成一份结构化的“剧本”,就像电影开拍前导演手里拿的那份详细文档一样。

2. 遇到的三大难题(为什么以前做不到?)

要把电影变成剧本,以前有三个巨大的拦路虎:

  • 记性不好(长视频遗忘):就像让你背一篇 30 分钟的文章,读到后面忘了前面是谁。很多 AI 看了一会儿就“断片”了,搞不清人物关系。
  • 数据太少(没人教过):以前没有现成的“电影转剧本”的教材。给电影逐字逐句、逐帧逐秒地标注剧本,就像要把一座图书馆的书手抄一遍,工作量巨大。
  • 算不过来(太慢太贵):要把几分钟的视频描述得那么细,生成的文字量巨大,以前的模型算起来太慢,成本太高。

3. OmniScript 的三大绝招

绝招一:建立“人物档案库”(记忆增强)

为了解决“记性不好”的问题,OmniScript 有一个超级管家(Character Profile Manager)

  • 比喻:想象你在看一部连续剧,管家会专门拿个小本子,每出现一个新角色就记一笔:“这是张三,穿红衣服,性格急躁”。
  • 作用:当张三在电影第 10 分钟和第 40 分钟再次出现时,管家会立刻提醒 AI:“嘿,这是刚才那个穿红衣服的张三,不是别人!”这样就能保证整部电影里人物名字和关系不乱套。

绝招二:先“想”后“写”(思维链 CoT)

OmniScript 不会一上来就急着写台词,它会先打草稿

  • 比喻:就像你写文章前会先列大纲。AI 会先思考:“这一场戏的大概剧情是什么?人物之间是什么关系?情绪基调是怎样的?”
  • 作用:有了这个“思维骨架”,它生成的剧本逻辑才通顺,不会前言不搭后语。

绝招三:分块处理与强化训练(长视频策略)

面对超长视频,OmniScript 有两种策略:

  • 策略 A(全神贯注):直接硬啃长视频,适合 10-20 分钟的内容,像是一个记忆力超群的学霸。
  • 策略 B(化整为零):对于 30 分钟以上的电影,它先像剪辑师一样把电影切成几个小片段,给每个片段写好小剧本,最后再像拼乐高一样把它们完美地拼成一个大剧本。
  • 奖励机制:在训练时,如果它写错了某个细节(比如把“悲伤”写成了“开心”),系统会像严厉的教练一样立刻扣分,强迫它下次改对。

4. 它的厉害之处

  • 小身材,大能量:它只有 80 亿参数(相当于一个中等身材的模型),但表现却比那些几百亿参数的“巨无霸”模型还要好,甚至比某些昂贵的商业闭源模型(如 Gemini 3 Pro)在某些方面更胜一筹。
  • 耳朵和眼睛并用:很多模型只看画面,OmniScript 是视听双修。实验证明,如果遮住字幕,很多模型就听不懂对话了,但 OmniScript 依然能靠听声音和看口型准确理解剧情。
  • 抗干扰能力强:即使视频很长,它也不会像其他模型那样“越写越乱”,能保持从头到尾的一致性。

总结

OmniScript 就像是一个不知疲倦、过目不忘、且精通视听语言的超级编剧。它不仅能看懂电影,还能把电影“翻译”成最标准的剧本格式。

这项技术的意义在于,未来我们可以用它来:

  • 自动整理电影资料:瞬间生成任何电影的详细剧本。
  • 辅助创作:给编剧提供灵感或检查逻辑漏洞。
  • 精准搜索:你想找“所有主角在雨中哭泣的片段”,它能瞬间定位到具体秒数。

简单来说,它让 AI 从“看懂视频”进化到了“读懂故事”的境界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →