SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
SRUM 为统一多模态模型引入了一种自我奖励的训练后框架,该框架利用模型自身的理解模块作为内部评估器,通过全局-局部双重奖励系统,在无需外部奖励模型或人工标注数据的情况下,显著增强了视觉生成的保真度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢的艺术家,同时也是一位非常严厉的艺术评论家。这位艺术家居住在一个名为**统一多模态模型(Unified Multimodal Model, UMM)**的单一计算机程序中。
这里存在一个问题,这篇论文指出了该问题:
这位艺术家非常擅长评论图片。如果你给他们看一张画,并问:“这张画是否符合‘蓝色桌子上的红苹果’这个描述?”,他们能瞬间发现错误。然而,当你要求他们画出那张完全一致的图时,他们往往会出错。他们可能会画出一个绿色的苹果,或者把桌子放错位置。他们的“评论大脑”比他们的“绘画之手”更聪明。
SRUM(用于统一多模态模型的自我奖励机制)是一种全新的训练方法,它弥补了这一差距。它教会艺术家利用自己的“评论大脑”来指导自己的“绘画之手”,而无需人类老师或另一个专门的程序来为他们的作品评分。
以下是 SRUM 的工作原理,分为简单的步骤:
1. “尝试、评判与修正”循环
与其等待人类来给画作评分,模型会自行完成:
- 第 1 步(艺术家): 模型根据提示词(例如“蓝色桌子上的红苹果”)尝试绘制一幅图像。
- 第 2 步(评论家): 模型自身的“理解”模块会观察它刚刚画出的图像。它充当内部评委。它不仅仅是说“好”或“坏”,它还会给出分数并解释原因。
- 第 3 步(教训): 模型利用这个自生成的评分来调整未来的绘画。如果评论家说“苹果太绿了”,艺术家就会学习在下次画图时让苹果变得更红。
2. “全局与局部”评分卡
论文认为,仅仅说一句“做得好”是不够的。为了变得真正优秀,艺术家需要两种特定的反馈,而 SRUM 提供了这些反馈:
- 全局奖励(大局观): 这就像一位在展厅里巡视的画廊主。他们检查整个场景是否合理。桌子真的在苹果下方吗?天空是在地面之上吗? 这确保了整体布局是正确的。
- 局部奖励(精细细节): 这就像一个放大镜。它会聚焦于特定的物体。苹果真的是红色的吗?木桌的纹理是否真实? 这修复了宏观视角可能忽略的微小且具体的错误。
通过结合这两者,模型会得到一份完整的成绩单:“房间看起来是对的(全局),但苹果需要更红一点(局部)。”
3. 为什么这意义重大
通常,要训练 AI 画得更好,你需要:
- 数以千计的人类专家来看图并评价“这个好,那个不好”。
- 或者,一个独立的、庞大的 AI 程序来充当裁判。
SRUM 都不需要。它利用模型自身的内部知识来为自己评分。这就像一个学生写了一篇练习作文,然后利用学习过的同一本教科书来给自己批改作文,接着再重写作文以获得更高的分数。
实验结果
论文在复杂任务上测试了该方法,例如画出特定数量的物体或在 3D 空间中排列物品(例如“红香蕉放在黄苹果上面”)。
- 在使用 SRUM 之前,模型理解能力很强,但绘画能力较差,难以处理这些复杂的场景。
- 使用 SRUM 之后,模型的绘画能力显著提升。它学会了将强大的理解力转化为更好的生成能力。
简而言之: SRUM 是一个自我提升系统,它让多模态模型能够利用自己的“大脑”来教导自己的“双手”如何更好地绘画,并通过一套检查大局和微观细节的双重系统来实现。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。