From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing
本文提出了一种面向开放式图像编辑的经验式框架,该框架将生成原子任务分解的规划器与选择工具和区域的协调器紧密耦合,并利用视觉语言评判器提供基于结果的奖励,从而迭代优化这两个组件,以实现更连贯、更可靠的多步编辑。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢但思维略显刻板的艺术家。如果你告诉他“给那个人戴上一顶帽子”,他会愉快地加上帽子。但如果你说“让这则广告对生活在乡村的人们感觉更友好”,他可能会感到困惑。他可能只是加上一头牛,或者把整幅画面改得面目全非,以至于原始品牌消失不见。他们难以驾驭那些需要一系列具体微小改动的大而抽象的概念。
本文介绍了一个名为Plan2Pix的新系统,它通过为这位艺术家配备一位项目经理和一位质量检查员来解决这个问题。该系统不再试图一步到位完成整个任务,而是将任务分解、规划,并从错误中学习。
以下是其逐步工作原理:
1. 项目经理(规划器)
当你向系统发出“为乡村受众调整这则广告”这样宏大而模糊的指令时,规划器便会介入。将规划器想象成一位正在阅读复杂食谱的厨师。它不会凭空猜测,而是会写出一份检查清单。
- 诀窍:规划器并非仅仅猜测步骤。它利用一份“检查清单”(例如一组规则:“必须保留标志”、“必须更改背景”、“必须更新文字”)来生成逐步计划。
- 自我学习:关键在于,规划器通过练习它自己的检查清单来学习。它不仅仅是模仿一位主厨;它通过练习制定自己的清单来提升能力,这有助于它更好地理解自己能做什么。这防止了它在尝试新事物时陷入困惑。
2. 工头(协调器)
一旦规划器有了检查清单,协调器便接手工作。将协调器想象成工地上的工头。规划器说:“我们需要用农场场景替换背景。”协调器必须决定:
- 使用什么工具? 我应该使用“画笔”工具(针对整幅图像)还是“模板”工具(仅针对某一部分)?
- 在哪里操作? 我具体应该对图像的哪一部分进行绘制?
协调器不会凭空猜测。它会观察其操作的结果,并询问一位评判者是否做得好。
3. 评判者(奖励系统)
这是其中的秘诀。在协调器做出更改后,一位智能 AI“评判者”会审视新图像和原始指令。它会提出三个问题:
- 你遵循了指令吗?(例如:你确实让它看起来具有乡村风格了吗?)
- 你破坏了原图吗?(例如:你是否不小心删除了公司标志?)
- 它看起来好吗?(图像是否模糊或怪异?)
如果协调器获得高分,它会记住:“嘿,在背景上使用‘农场模板’效果很好!”如果得分低,它会吸取教训:“好吧,别再那样做了。”随着时间的推移,协调器将成为为正确任务选择正确工具的专家。
4. 安全网(细化)
有时,规划器可能会写出一条无法执行的步骤(例如,当工具只能添加真实动物时,却要求“添加一只飞行的独角兽”)。系统在开始执行前设有一个安全网来检查计划。如果某一步骤无法用现有工具完成,它就会被从计划中剔除。这确保了团队永远不会尝试做不可能的事情。
为什么这比我们现在的方法更好?
- 旧方法:你要求单个 AI“让这则广告具有乡村风格”。它试图一次性完成所有事情。它经常失败、改动过多,或者偏离重点。
- Plan2Pix 方法:它将工作分解为小而可管理的任务(更改背景 -> 更改文字 -> 添加谷仓)。它为每个小任务使用正确的工具。它在每一步之后都会检查工作。
结果
论文表明,这种“规划、执行、检查”的方法生成的图像更能忠实于用户复杂的指令。最终图像看起来专业,保持了原始品牌标识的完整性,并且真正解决了抽象问题(例如让广告感觉具有“乡村风格”),而不仅仅是进行随机更改。
简而言之,Plan2Pix将混乱的一次性尝试转变为一个结构化的、基于学习的项目管理系统,随着工作的推进,它会变得越来越好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。