WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
WinTok 是一种混合视觉分词器,它通过将源自预训练基础模型的可学习语义分词与像素分词相结合,从而解耦理解与生成任务,在显著少于现有统一方法所需的训练数据下,于两项任务中均实现更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人同时完成两项截然不同的工作:用文字描述一幅图片(理解),以及从零开始重绘这幅图片(生成)。
问题在于,这两项工作需要不同的“语言”。
- 要描述一幅图片,机器人需要高层次、抽象的概念(例如“一只悲伤的狗”或“阳光明媚的海滩”)。它不需要知道每个像素的确切颜色。
- 要重绘一幅图片,机器人需要低层次、精确的细节(例如天空中蓝色的确切色调,或毛发的纹理)。它并不关心狗的“悲伤”情绪,只关注像素。
旧方法:“万事通,无一精”的策略
之前的尝试试图强迫机器人使用同一套“令牌”(数字构建块)来完成这两项工作。这就像要求一位厨师用同一把刀既切蔬菜又进行精细的外科手术。结果是妥协:机器人在描述方面表现尚可,在绘图方面表现尚可,但在任何一方面都从未达到卓越。
新方案:WinTok(“专业团队”策略)
这篇论文介绍了WinTok,这是一个新系统,通过赋予机器人两套既协同工作又保持独立的工具集来解决这一问题。这就像一支拥有两个专业小组的施工队:
- 像素团队(艺术家们): 该团队负责处理“像素令牌”。他们就像一支专注于精细细节、纹理和色彩的画家团队。他们唯一的工作是确保最终图像与原始图像完全一致。他们非常擅长生成。
- 语义团队(哲学家们): 该团队负责处理“可学习令牌”。他们就像一支艺术评论家团队,审视整幅画面并总结核心思想(“这是一只狗”,“它很快乐”)。他们不关心笔触,只捕捉含义。他们非常擅长理解。
它们如何协同工作:“非对称蒸馏”
这里是巧妙之处:如何在不从零开始训练数年的情况下,教会“哲学家们”(语义团队)变得如此聪明?
作者使用了一种称为非对称令牌蒸馏的技术。想象一位著名的世界级艺术评论家(一个预训练的“基础模型”)看着一幅图片,并将图像的“精髓”低声告诉机器人的语义团队。机器人的团队倾听、学习,并试图模仿这位专家的见解。
- 转折: 这位专家并不教导“艺术家们”(像素团队)任何新东西;他们只需继续做他们擅长的事(描绘细节)。
- 结果: 语义团队因为向专家学习而成为意义的掌握者,而像素团队则继续保持细节的掌握者。它们并肩工作,互不干扰。
成果:双赢
由于两个团队拥有清晰、独立的角色,机器人无需做出妥协。
- 对于理解: 它利用语义团队的总结来回答诸如“这张照片里是谁?”或“情绪如何?”之类的问题。在分类任务上,它比之前的最佳系统提高了 11.2%。
- 对于生成: 它利用像素团队的细节来重绘图像。其重建质量与最佳系统一样好,但它使用的训练数据要少得多(5000 万张图像,而非 10 亿张)。
一言以蔽之
WinTok 就像一家不再试图让一位厨师包揽所有工作的餐厅。相反,它聘请了一位副厨师,这位副厨师在切菜和摆盘(生成)方面表现出色;还聘请了一位美食评论家,这位评论家在描述风味和食材(理解)方面表现出色。通过让他们发挥各自最擅长的能力,这家餐厅提供的食物(图像)和撰写的评论(描述)比以往任何时候都要好,同时使用的食材(数据)却更少。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。