← 最新论文
💬 NLP

CROP: Token-Efficient Reasoning in Large Language Models via Regularized Prompt Optimization

本文提出了 CROP 方法,通过在自动提示优化中引入响应长度正则化,在保持推理任务准确率基本不变的同时,实现了高达 80.6% 的 Token 消耗降低,为生产环境中的高效推理系统提供了实用解决方案。

原作者: Deep Shah, Sanket Badhe, Nehal Kathrotia, Priyanka Tiwari

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Deep Shah, Sanket Badhe, Nehal Kathrotia, Priyanka Tiwari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 CROP(Cost-Regularized Optimization of Prompts,即“成本正则化提示优化”)的新方法。

为了让你轻松理解,我们可以把大语言模型(LLM)想象成一个才华横溢但有点啰嗦的超级顾问

1. 背景:为什么我们需要 CROP?

想象一下,你问这位顾问一个数学题:“买 16 个杯子,第一个 5 美元,第二个打六折,一共多少钱?”

  • 以前的做法(Chain-of-Thought,思维链):
    顾问会非常详细地回答:“好的,让我先思考一下。首先,我们要明确第一个杯子的价格是 5 美元。然后,第二个杯子是 60% 的价格,也就是 0.6 乘以 5 等于 3 美元。我们要买 16 个,所以可以分成 8 对……"

    • 优点: 答案通常是对的。
    • 缺点: 他说了太多废话!为了算出这个简单的数字,他生成了几百个单词(Token)。在现实世界中,这就像你雇人干活,他不仅干活,还写了三页日记,导致你花钱太多(Token 成本高)等待时间太长(延迟高)
  • 现有的自动优化工具(如 TextGrad):
    这些工具就像是一个只会盯着“对错”的监工。如果顾问算错了,监工就让他重写;如果算对了,监工就让他继续。结果呢?顾问为了保险起见,把解释写得越来越长,生怕漏掉任何细节,导致啰嗦程度变本加厉。

2. CROP 的核心创意:给顾问戴上“紧箍咒”

CROP 的作者想出了一个绝妙的主意:不仅要问“答案对不对”,还要问“话说得简不简单”。

这就好比给这位啰嗦的顾问加了一条新规则:

“你可以详细解释,但如果你废话太多,我就扣你的分;如果你能用最精炼的语言把逻辑讲清楚,我就给你加分。”

具体是怎么做的?(三个步骤)

  1. 双重打分机制(就像两个考官):

    • 考官 A(准确性): 检查答案对不对。如果错了,给反馈:“这里逻辑不对,要改。”
    • 考官 B(简洁性): 检查废话多不多。如果顾问说了“让我们开始吧”、“首先”、“其次”这种废话,考官 B 就会说:“太啰嗦了!删掉这些,直接上干货。”
  2. 自动“修剪”提示词(Prompt):
    系统会自动把这两个考官的意见合并,然后去修改给顾问的“工作指令”(Prompt)。

    • 一开始,指令可能是:“请一步步思考。”
    • 经过 CROP 的几轮“修剪”后,指令变成了:“直接列出关键计算步骤,省略所有客套话和中间标签,只保留核心算式。”
  3. 发现“草稿思维”(Chain-of-Draft):
    神奇的是,经过这种“逼着说人话”的训练,模型自己学会了一种新的说话方式。它不再像写散文一样解释,而是像打草稿一样,直接写出紧凑的数学公式或逻辑链条。

    • 比喻: 就像让一个习惯写长篇大论的作家,突然被要求只写“电报体”。他被迫学会了用最短的词汇表达最复杂的意思,反而显得更专业、更高效。

3. 实验结果:省了 80% 的钱,没丢分

作者用几个很难的数学和逻辑测试题(比如 GSM8K 数学题、LogiQA 逻辑题)来测试这个方法。

  • 效果惊人: 使用 CROP 优化后的提示词,模型生成的回答长度缩短了 80.6%
  • 质量未降: 虽然话变少了,但准确率几乎没有下降,依然和那些啰里啰嗦的长回答一样准确。
  • 比喻: 这就像你原本雇了一个人,他每天写 1000 字的报告给你,现在他改成了只写 200 字的精华版,但核心信息一点没少,你省下了 80% 的打印费和阅读时间。

4. 为什么需要强大的“教练”?

论文还发现了一个有趣的细节:要训练出这种“精简版”的模型,需要一个非常聪明的“教练”(Meta-Optimizer)

  • 如果教练不够聪明(用小模型),它可能会误判,直接告诉模型:“别思考了,直接给答案。”结果模型就变傻了,答案全错。
  • 只有用最顶尖的模型当教练,它才能精准地分辨出:“哪些是必要的逻辑步骤(不能删),哪些是无用的废话(必须删)。”

总结

CROP 就像是一个“提示词修剪师”。

它不再让 AI 盲目地“多说多错”或“为了安全而啰嗦”,而是通过一种自动化的奖惩机制,教会 AI 如何**“惜字如金”**。它证明了,在保持高智商(高准确率)的同时,我们可以让 AI 变得极其高效(低 Token 消耗),这对于未来让 AI 真正走进千家万户、降低使用成本具有巨大的实际意义。

一句话概括: CROP 让 AI 学会了“少说话,多办事”,既省了钱,又没耽误事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →