← 最新论文
🤖 AI

Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization

本文介绍了 MO-DiT+HPPO,这是一种结合了度量排序序列训练与混合策略偏好优化,旨在有效平衡连续嵌入空间中模式保留与属性针对性的生成式检索框架。

原作者: Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位图书管理员,正试图寻找更多类似于你刚刚发现的一本稀有故事的图书。我们可以把这个特定的故事称为你的“种子”(Seed)。

问题在于,这座图书馆非常庞大,书籍是按照一个巨大的、隐形的地图(向量空间)进行组织的。你有两个糟糕的选择:

  1. “平均值”法(The "Average" Approach): 你拿着你的“种子”书去询问管理员,寻找它的“平均值”。这能让找到的故事与你的“种子”极其相似,但你找到的书会变得平庸、乏味且缺乏特色,失去了你想要的那个特别的火花。
  2. “属性”法(The "Attribute" Approach): 你要求管理员寻找任何具有特定有趣特征的书(比如“有龙出现”)。这能找到有趣的图书,但它们可能是关于太空龙、海洋龙或恐怖片里的龙——这些与你的“种子”故事完全不同。

目标: 你想要既具备有趣特征(属性),又依然讲述着与你的“种子”同类故事(模式)的书。

这篇论文介绍了一种新的 AI 图书管理员——MO-DiT+HPPO,它解决了这个复杂的平衡难题。以下是它的工作原理,步骤如下,并使用简单的类比:

1. 核心理念:一个“扩散”侦探(A "Diffusion" Detective)

与其只是挑选一本现有的书,这个 AI 会发明一个新的“搜索查询”(心理地图坐标),这个坐标能精准地指向“有趣特征”与“相同故事”重叠的那个甜蜜点。它使用了一个扩散 Transformer(Diffusion Transformer),它就像一个侦探,从一个模糊、多噪的猜测开始,通过一步步地清理,最终变成一个完美、清晰的搜索方向。

2. 第一步:学习地图(预训练/Pretraining)

在学习特定任务之前,AI 阅读了数百万个随机的书籍序列,以了解图书馆地图的运作方式。它学习到“关于龙的书”通常在某一个街区,而“关于骑士的书”在另一个街区。这给了它一个基本的方向感。

3. 第二步:“度量排序”训练(徒步路径/The "Metric-Ordered" Training)

这是这篇论文的高明之处。AI 需要学习如何从一个“乏味”的版本过渡到一个“有趣”的版本,同时又不改变故事类型。

  • 问题: 图书馆并没有标签写着“这本书有 80% 的趣味性”。只有在你真正找到书并检查后,你才会知道。
  • 解决方案: 研究人员构建了一个预测器(一个聪明的猜想者),用来估算一本书有多“有趣”。
  • 路径: 他们根据这个猜想将书籍排列成一条线(一个序列):
    • 起点: 乏味但属于相同故事类型的书。
    • 终点: 有趣且属于相同故事类型的书。
  • 训练: AI 练习“延续”这条线。它观察乏味的开头,学习预测下一步,然后是再下一步,一直直到到达有趣的终点。通过在许多不同的故事类型(领域)中进行这种练习,它学到了一个通用的规则:“如何在不丢失故事性的情况下,向着有趣的方向移动?”

4. 第三步:“尾部质心”微调(The "Tail-Centroid" Fine-Tuning)

一旦 AI 学会了如何行走在路径上,它就开始练习一个特定的动作。它不再仅仅是预测“下一本书”,而是观察这条线的整个“有趣终点”,并学习直接跳向那个有趣群体的中心(质心)。这确保了它不会意外地选中一个奇怪的、孤立的离群值,而是选中一个稳固、具有代表性的“有趣”书籍。

5. 第四步:HPPO(“帕累托过滤器”教练/The "Pareto Filter" Coach)

这是最后的润色。AI 现在已经很出色了,但它可能仍会试图“作弊”。它可能会找到一种方法,通过切换到完全不同的故事来获得“有趣”的书(从而偏离原有的模式)。

为了阻止这种情况,研究人员使用了混合策略偏好优化(Hybrid-Policy Preference Optimization)系统,并配备了一个特殊的规则,称为帕累托过滤器(Pareto Filter)

  • 设置: AI 生成了一堆候选搜索方向。有些是“静态的”(安全的、经过计算的平均值),有些是“策略性的”(AI 自己的创意猜想)。
  • 测试: 他们实际上在真实的图书馆中运行这些搜索,以查看哪些效果最好。
  • 过滤器(教练的规则): 如果 AI 发现某种搜索虽然得到了更有趣的图书,但却丢失了故事模式,教练会说:“不对!这是作弊。”
    • 教练只允许 AI 从那些“胜者在获取有趣图书方面表现更好,在保持故事模式方面也表现更好”的配对中进行学习。
    • 这迫使 AI 向外推向边界(寻找更多相同故事的有趣内容),而不是向侧面滑动(寻找不同故事的有趣内容)。

结果

论文在四种不同类型的内容(如视频、文本等)上测试了该系统。他们发现:

  1. “度量排序”训练教会了 AI 正确的移动方向。
  2. 最后一步中的“帕累托过滤器”确保了 AI 不会为了获得更多“有趣”的结果而牺牲故事模式。

简而言之: 这篇论文构建了一个学习如何走钢丝的系统。它知道如何在不掉入“不同事物”的侧边的情况下,向着“更好”的事物移动,它利用了聪明的训练路径和一个严格的教练来确保它不偏离航道。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →