← 最新论文
💬 NLP

TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

本文介绍了 Token 级 Bregman 偏好优化(TBPO),这是一种新颖的方法,它从标准的序列级比较中推导出 Token 级 Bradley-Terry 偏好模型,旨在提升对齐质量、训练稳定性和输出多样性,同时保持直接偏好优化(DPO)的简洁性。

原作者: Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van, Duy Minh Ho Nguyen, Khoa Doan, Trung Le

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van, Duy Minh Ho Nguyen, Khoa Doan, Trung Le

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人写故事。你向它展示同一故事的两个版本:一个是“优胜者”(好、有帮助、安全),另一个是“失败者”(坏、无帮助或危险)。你的目标是调整机器人,使其学会写出“优胜者”版本的故事。

很长一段时间以来,实现这一目标的标准方法(称为DPO)就像是对整篇故事进行一次性评分。你会说:“整个这个故事很棒,而那个整个故事很糟糕。”机器人随后会尝试调整其“大脑”,以使整个故事变得更好。

问题所在:
该论文指出,这有点像仅凭马拉松选手的完赛时间来评判他们,而不观察他们的步态。语言模型并非一次性写出整篇故事;它们是逐词书写的。它们选择的每一个词都是基于前文做出的微小决策。如果机器人在第一个词上犯了一个微小的错误,即使“整篇故事”的评分最终有所提升,整个故事也可能偏离正轨。

现有的“词元级”(token-level)方法试图通过分解故事来解决这个问题,但它们本质上仍然只是将“整篇故事”的评分分摊到各个词上,而不是教导机器人在每一步都做出正确的选择。

解决方案:TokenRatio (TBPO)
作者提出了一种名为**词元级 Bregman 偏好优化(Token-level Bregman Preference Optimization, TBPO)**的新方法。以下是他们使用简单类比进行的解释:

1. “GPS 逐段导航”类比

想象你要从纽约开车到洛杉矶。

  • 旧方法(序列级): 你只看最终目的地。如果你抵达洛杉矶,你就会得到一颗金星;如果你最终到了加拿大,你就会得到红灯。你试图调整驾驶方式以获得那颗金星,但你不知道具体是哪一次转弯导致了错误。
  • TBPO 方法(词元级): 这种方法就像一个提供逐段导航评分的 GPS。在每一个路口(每一个词),它都会问:“你走的是通向好故事的路,还是坏故事的路?”它教导机器人在每一步都做出完美的选择,而不仅仅是希望最终结果是好的。

2. “两条不同道路”问题

这是论文解决的棘手部分。当比较“优胜者”故事和“失败者”故事时,它们往往在很早的阶段就看起来不同了。

  • 场景: 假设优胜者故事以“猫坐着……"开头,而失败者故事以“狗跑着……"开头。
  • 问题: 如果你只是比较下一个词,你不仅仅是在比较这个词,而是在比较两个完全不同的起点。这就像比较一个从山顶起跑的选手和一个从山脚起跑的选手。山顶的选手拥有不公平的优势。
  • 修正: 论文引入了一个“校正因子”(称为基线)。
    • TBPO-Q: 此版本构建了一个小型、轻量级的“计算器”,用于估算起点(前缀)有多“好”。它减去这种优势,这样你就只评判下一个词,而不是整个历史。
    • TBPO-A: 此版本执行相同的数学运算,但使用了一种不同的技巧(称为“优势归一化”),无需单独的计算器即可抵消起点差异。

3. “密度比”魔法

论文使用了一个名为密度比匹配(Density Ratio Matching)的高级数学概念(具体使用了称为 Bregman 散度的东西)。

  • 简单类比: 想象你有一袋红珠子(好词)和蓝珠子(坏词)。你想教机器人挑选红珠子。
  • 论文的方法不仅仅是数数,而是查看“好”故事与“坏”故事中红珠子与蓝珠子的比率。它试图让机器人内部的比率与“好”比率完美匹配。
  • 通过在词级别执行此操作,机器人学习到一个在每一刻都是最优的“策略”(一套规则),而不仅仅是针对最终结果。

他们发现了什么?
作者在多种任务中,针对两个流行的 AI 模型(Mistral 和 Llama 3)测试了这一新方法:

  • 更聪明的推理: 模型在数学和逻辑谜题(如 GSM8K 和 MMLU)方面表现更好。
  • 更好的对齐: 它们变得更有帮助,且更少说出有害的内容。
  • 更多样性: AI 训练的一个常见问题是模型变得枯燥且重复(像坏掉的唱片)。TBPO 保持了模型的多样性和创造力,而其他方法则使它们变得更加机械。
  • 效率: 它们在无需复杂、昂贵的强化学习循环的情况下实现了这些结果。这是对标准方法的“即插即用”式改进。

简而言之:
论文指出:“停止一次性给整篇文章评分。教导 AI 为每一个词做出正确的选择,同时修正某些故事起步即占优势的事实。”其结果是,AI 变得更聪明、更有帮助,且更少重复。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →