Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning
Stable-Layers 是一个强化学习框架,它通过两阶段评估流程利用视觉语言模型评分的反馈对图像层分解模型进行微调,以克服奖励压缩问题,从而在无配对监督的情况下实现更优的层分离与重建质量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一幅美丽而复杂的画作。目前,它只是画布上的一张平面图像。如果你想编辑它——比如把树移到左边,或者改变汽车的颜色——你就得使用“魔法橡皮擦”和“魔法画笔”手动剪下树并重新绘制背景。这既繁琐,又常常显得不真实。
Stable-Layers 是一款新工具,它能自动将这幅平面画作分离成一组透明的“图层”(就像 Photoshop 中的图层一样)。其中一张图层只包含树,另一张只包含汽车,而最底层的图层则包含背景,并且树和汽车原本所在的位置已被“绘制”填补。这使得编辑变得简单:你只需拿起树的图层并移动它即可。
然而,教计算机完美地完成这种分离极其困难。现实世界的照片没有“标准答案”。如果你让计算机分离一张桥上人物的照片,存在多种分离方式,而我们并没有一个完美的范例来向计算机展示什么是“正确”的。
问题:计算机在猜测
作者们从一个已经很擅长此任务的智能计算机模型(称为 Qwen-Image-Layered)出发。但它仍会犯错。有时它会:
- 留下黑色或模糊的背景。
- 将整个画面放在一个图层上,而让其他图层留空。
- 将一个人切成两半,把头部放在一个图层,脚部放在另一个图层。
为了解决这个问题,他们需要一种方法,在不让人类为每一张照片绘制完美答案的情况下教会计算机。
解决方案:“艺术评论家”与“味觉测试”
作者们使用了一种称为 强化学习 的巧妙技巧。他们不是向计算机展示正确答案,而是让它尝试,然后使用一位 AI 艺术评论家(一种视觉 - 语言模型,即 VLM)来评估它的尝试。
以下是他们如何利用一个简单的类比来使训练生效:
1. “味觉测试”(群体挑战)
想象你是一位厨师,试图制作完美的汤。你一次制作了 16 碗汤(候选方案)。
- 旧方法: 你逐一品尝每碗汤,并给出 1 到 10 分的评分。问题在于:评论家可能过于客气或过于严苛,给每碗汤都打"7 分”。如果它们都得 7 分,你就不知道哪一碗实际上更好。
- Stable-Layers 方法(两阶段评分):
- 第一阶段: 评论家逐一品尝每碗汤,给出粗略的评分。
- 第二阶段(网格校准): 评论家将全部 16 碗汤并排放在一张大桌上。现在,评论家将它们放在一起审视,并说:“好吧,第 3 碗明显比第 12 碗好,但第 5 碗是所有中最好的。”
- 这为何重要: 这种并排比较迫使评论家变得挑剔。它建立了清晰的排名(方差),让计算机确切知道该复制哪些尝试、避免哪些尝试。
2. “魔法画笔”(Flow-GRPO)
计算机利用一种特殊的数学过程(Flow-GRPO)从这些排名中学习。它不只是死记硬背“最好”的汤;它学习调整其“配料”的方向,以接近最佳汤品。经过数千次尝试,它在分离图层方面变得越来越出色。
他们取得的成果
通过使用这位“艺术评论家”和“并排”评分系统,新的 Stable-Layers 模型比原始模型聪明得多:
- 更清晰的分离: 它将不同的物体(如人、树或汽车)放在各自的图层上,而不会将其切断。
- 更优质的背景: 当它移除一个物体时,它会以写实的方式填补背景(例如在桥后显现出山脉),而不是留下一个黑洞。
- 无“空白”图层: 它不再生成仅包含空白或噪点的图层。
注意事项(局限性)
论文指出了几点需要注意的事项:
- 评论家是一个黑盒: 他们使用了一个特定的专有 AI(Gemini)作为评判者。如果该 AI 未来对“好”的标准改变看法,训练可能需要进行调整。
- 成本: 为训练的每一步运行这些“味觉测试”需要大量的计算能力和资金。
- 图层数量: 为了效率,他们训练它一次处理最多 5 个图层,尽管基础模型可以处理更多。
简而言之,Stable-Layers 通过让计算机练习、由 AI 评判者评估其工作,并迫使该评判者将所有尝试并排比较以找出“尚可”与“出色”之间的细微差别,从而教会计算机将复杂图像解构为可编辑的片段。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。