← 最新论文
💬 NLP

LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models

该论文提出了 LARFT 框架,通过将强化学习与后见之明的长度自我认知相结合,解决了大语言模型内在的长度认知缺陷,从而显著提升了其遵循长度指令的精确性与可靠性。

原作者: Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

发布于 2026-03-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 LARFT 的新方法,旨在解决大语言模型(LLM)的一个常见“毛病”:明明用户要求写"100 个字”,模型却要么写成了"10 个字”的短文,要么啰嗦地写了"1000 个字”的长篇大论。

为了让你轻松理解,我们可以把大语言模型想象成一个才华横溢但缺乏“数数”天赋的作家

1. 核心问题:作家“心里没数”

以前的模型就像那个作家:

  • 认知与行动的脱节:他脑子里知道要写故事(认知),但写的时候完全控制不住字数(行动)。
  • 旧方法的局限
    • 外部强制(External Constraints):以前的方法像是在作家的手边放个计数器,或者强行规定“写满 100 个字才能停”。这就像给作家戴上了手铐,不仅累赘,而且一旦遇到长文章,作家就晕了,根本不管用。
    • 单纯奖励(Reward Signals):另一种方法是告诉作家:“写对了给糖,写错了挨打”。但这有个问题,作家为了拿糖,可能会把“字数”和“故事内容”混在一起,导致故事写得很奇怪,或者为了凑字数而胡编乱造。

根本原因:模型内部其实没有真正建立起“长度”这个概念。它不知道"100 个字”到底是个什么感觉,它只是在猜。

2. 解决方案:LARFT(让作家学会“自我反省”)

LARFT 就像给这位作家安排了一套特殊的特训营,包含三个核心步骤:

第一步:目标导向的强化训练(Length-Oriented RL)

  • 比喻:就像教练给作家定下明确的规则:“写 100 个字,多一个少一个都不行,做到了就发奖金。”
  • 作用:这直接告诉模型,你的目标就是控制字数,并尝试去接近它。

第二步:事后诸葛亮式的“长度意识”(Hindsight Length Awareness)—— 这是最精彩的部分!

  • 比喻:这是 LARFT 的独门秘籍。
    • 想象一下,作家写了一篇稿子,结果字数不对(比如写了 200 字,要求 100 字)。
    • 以前的做法是直接把这篇稿子扔进垃圾桶。
    • LARFT 的做法:把这篇“失败”的稿子拿回来,问作家:"你自己数数,这篇稿子到底有多少个字?"
    • 作家被迫去数:"1, 2, 3... 哦,原来我写了 200 个字。”
  • 作用:通过这种“自我复盘”,模型不再只是盲目地生成文字,而是学会了“感知”自己生成的内容有多长。它把“写”和“数”结合在了一起,建立了内部的“长度感”。

第三步:动态平衡的“双管齐下”(Unified Optimization)

  • 比喻:特训初期,教练重点抓“数数”的能力(先让你心里有数);等到你心里有数了,教练再重点抓“写得准”的能力(让你行动跟上)。
  • 作用:这种方法让模型先建立对长度的认知,再优化生成的行动,两者互相促进,最终达到“想写多少就写多少”的境界。

3. 训练成果:既准又稳

经过这套特训,模型发生了质的变化:

  • 精准度大幅提升:在四个不同的模型测试中,LARFT 让模型遵循长度指令的能力平均提升了 20.92 分(满分 100 分的话,这是巨大的进步)。
  • 没有副作用:很多方法为了练好“数数”,会让作家变笨(比如逻辑变差、回答变蠢)。但 LARFT 非常聪明,它在练好“数数”的同时,几乎没有让作家的其他能力(如数学、常识、逻辑)下降,甚至写作质量还稍微提高了一点点。

总结

简单来说,LARFT 就是给大语言模型装上了一个内置的“字数计数器”和“自我反省机制”

它不再依赖外部的强制命令,而是让模型自己学会感知长度,从而在写故事、写报告时,能够精准地控制篇幅,既不多嘴,也不啰嗦,真正做到了“指哪打哪”。这对于需要严格控制字数的场景(如新闻摘要、短信回复、特定格式报告)来说,是一个巨大的飞跃。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →