← 最新论文
💻 computer science

CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning

CogPortrait 是一个两阶段框架,它利用分层多模态大语言模型智能体将高层标签转化为精确的面部关键点,从而在保持高视觉质量和身份一致性的同时,实现对肖像动画中眼部区域动态及超越情绪状态的细粒度控制。

原作者: He Feng, Yongjia Ma, Donglin Di, Lei Fan, Tonghua Su

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: He Feng, Yongjia Ma, Donglin Di, Lei Fan, Tonghua Su

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你希望让一张静态的人物照片“活”过来,能够说话并做出动作。目前大多数方法就像给导演一份极其模糊的剧本:“让他看起来生气”或“让她看起来开心”。结果尚可,但眼神往往显得呆滞,或者动作过于平滑而显得机械。另一方面,有些方法允许你控制每一块微小的肌肉运动,但这就像要求导演手动逐像素地移动每一只眼睑和每一道眉毛——工作量极其巨大,且需要高超的技术技能。

CogPortrait 是一个新系统,试图找到完美的中间地带。它允许你给出简单、高层的指令(例如“他正在苦思冥想”或“她开始犯困”),并自动计算出眼睛和头部应如何运动以呈现真实感,无需你亲自承担繁重的具体工作。

以下是其工作原理,分为两个主要阶段:

第一阶段:“大脑”(智能体团队)

在视频生成之前,系统会利用由三个 AI“智能体”组成的团队(可将其视为一个专业化的制作团队),将你的简单想法转化为详细的运动计划。

  1. 规划者(导演): 该智能体接收你的简单标签(例如“认知努力”),并将其分解为时间线。它会决定:“首先,人物向上看一秒,然后微微眯眼,接着向左看。”它创建了一个事件分镜脚本。
  2. 编排者(图书管理员): 该智能体进入真实人类行为记录的“图书馆”。它会寻找人们“思考时眯眼”或“疲倦时缓慢眨眼”的真实示例。它将这些真实生活的片段拼接起来,形成逼真的运动序列,确保眼睛不会以怪异、机械的方式运动。
  3. 批评者(质量控制检查员): 该智能体对计划进行双重检查。它会问:“这真的看起来像有人在思考吗?人类眨眼速度这么快在生理上是否可能?”如果计划怪异,它会将计划退回给编排者或规划者进行修正。

该团队的成果是一套精确的坐标(关键点),告诉计算机在每一时刻眼睑、眉毛和瞳孔的确切位置。

第二阶段:“身体”(视频生成器)

一旦运动计划准备就绪,第二阶段便接手。这是实际绘制视频的部分。

  • 绘制者: 它接收你的原始照片、音频(使嘴唇随声音运动)以及来自第一阶段详细运动计划。
  • 智能画笔(动态引导): 通常,当 AI 进行绘制时,可能会混淆面部与背景的颜色,或者使眼睛看起来模糊。CogPortrait 使用一种“智能画笔”,对眼睛施加额外的关注。它会说:“保持背景稳定自然,但对眼睛和眉毛施加额外的精度,使眨眼和注视的感觉更真实。”
  • 安全网(KTO 优化): 有时,AI 在处理棘手情况时会遇到困难,例如人物将头几乎完全转向侧面,或只扬起一只眉毛。为了解决这个问题,该系统在特殊的“困难模式”数据集上进行了训练。它从这些困难案例自身的错误中学习,以确保即使在奇怪的角度下,人物的面部也不会变形,且身份保持一致。

为什么这很重要?

该论文引入了一项名为EMH(情绪及超越情绪)的新测试,以评估这些系统的表现。它不仅测试“快乐”或“悲伤”等基本情绪,还测试微妙的状态,例如:

  • 认知努力: 那种深度专注的神情。
  • 困倦: 沉重的眼睑和缓慢的点头。
  • 回避反应: 迅速移开视线。

结果表明,CogPortrait 在控制眼睛方面远优于以往的方法。它能够高精度地让角色看起来“疲倦”或“正在思考”,同时保持人物面貌特征不变,并维持高视频质量。它弥合了“易于使用”(只需输入标签)与“高度逼真”(精确的眼部运动)之间的差距。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →