← 最新论文
🤖 AI

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

该论文提出利用熵减作为监督信号,通过设计稀疏结果奖励和稠密过程奖励两种策略,有效解决了大语言模型智能体在长轨迹中工具调用过多且质量低的问题,显著提升了调用效率与任务性能。

原作者: Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

发布于 2026-03-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣的问题:如何让大语言模型(LLM)在“使用工具”(比如查资料、写代码)时变得更聪明、更省劲?

想象一下,你雇佣了一个非常聪明的超级实习生(这就是大语言模型)。这个实习生很博学,但有个毛病:当他遇到难题时,他可能会疯狂地打电话、发邮件、查资料(调用工具),哪怕有些电话根本没必要打,或者打错了人。

结果就是:

  1. 效率低:他花了很多时间打电话,却还没解决问题。
  2. 成本高:每打一个电话都要花钱(计算资源)。
  3. 容易晕:信息太多,他反而把自己绕晕了,最后答错了。

这篇论文就是为了解决这个“实习生乱打电话”的问题,提出了一套新的**“熵减”(Entropy Reduction)**训练法。


1. 核心发现:什么是“熵减”?

首先,我们要理解一个概念:熵(Entropy)
在物理学里,熵代表“混乱度”。在 AI 的世界里,熵代表“不确定性”或“困惑度”

  • 高熵 = 模型很迷茫,不知道下一步该干嘛,心里七上八下。
  • 低熵 = 模型很确定,思路清晰,知道答案在哪。

论文做了一个小实验,发现了一个惊人的规律:

  • 当实习生打了一个高质量的电话(比如查到了关键信息),他的困惑度(熵)会瞬间下降,思路突然清晰了。
  • 当他打了一个低质量的电话(比如查了无关信息),他的困惑度反而上升了,变得更迷茫。

比喻:
想象你在玩一个“寻宝游戏”。

  • 高质量工具调用:就像你拿到了一张藏宝图,迷雾散去,你离宝藏更近了(熵降低)。
  • 低质量工具调用:就像你走进了一片新的迷雾森林,或者拿了一张假地图,你更不知道在哪了(熵升高)。

结论: 只要看模型在调用工具后,是变得更“清醒”了(熵减),还是更“糊涂”了(熵增),就能判断这个工具调用是好是坏。


2. 解决方案:TEPO(两个不同的训练策略)

基于这个发现,作者设计了一套名为 TEPO 的训练系统,并给出了两种不同的“奖励机制”,就像给实习生两种不同的KPI(绩效考核)

策略 A:TEPO-Sparse(追求“效率”的 KPI)

  • 目标:让实习生少打电话,但每次电话都要管用。
  • 怎么奖励
    • 如果实习生最后做对了题,而且打电话的次数很少,或者大部分电话都让他变清醒了,就给他发大奖。
    • 如果打电话太多,哪怕做对了,奖金也会打折。
  • 效果:就像教实习生“能少跑一趟就别跑两趟”。
    • 结果:工具调用次数减少了 72%!就像把原本要打 10 个电话的工作,压缩到了 3 个电话就搞定,而且答案一样对。

策略 B:TEPO-Dense(追求“质量”的 KPI)

  • 目标:让实习生每一步都走对,追求最高的准确率。
  • 怎么奖励
    • 只要他打了一个电话,并且这个电话让他瞬间变清醒(熵减),就立刻给他发一个小红包(即时奖励)。
    • 不管最后结果如何,只要过程是“清醒”的,就值得鼓励。
  • 效果:就像教实习生“每一步都要深思熟虑,确保方向正确”。
    • 结果:虽然打电话的次数没怎么减少(甚至稍微多了一点),但解题准确率提升了 22%!就像虽然多打了一个电话,但因为这个电话打得太关键,直接让他从“可能做对”变成了“绝对做对”。

3. 为什么这很重要?

以前的训练方法,通常只告诉实习生:“最后做对了给钱,做错了扣钱”。

  • 缺点:实习生不知道中间哪一步做对了,哪一步做错了。他可能运气好蒙对了,也可能中间绕了一大圈才蒙对。

这篇论文的新方法,相当于给实习生装了一个**“实时导航仪”**:

  • 每走一步,导航仪就告诉他:“刚才那个动作让你更清晰了(熵减),做得好!”或者“刚才那个动作让你更晕了(熵增),下次别这么干!”

这就好比:

  • 旧方法:你让实习生去迷宫找出口,只有找到出口才给钱。他可能在迷宫里乱撞,撞了 100 次才找到。
  • 新方法:你告诉他,每走一步,如果感觉离出口近了(熵减),就给你点赞。这样他就能学会如何高效地走出迷宫,而不是盲目乱撞。

4. 总结

这篇论文的核心思想可以用一句话概括:
“好的工具调用,能让 AI 从‘迷茫’变得‘清醒’。我们要奖励这种‘清醒’,惩罚这种‘混乱’。”

通过这种方法,AI Agents(智能体)可以:

  1. 更省钱:少做无用功(减少 72% 的工具调用)。
  2. 更聪明:每一步都更精准(提升 22% 的准确率)。

这就像是从一个“只会蛮干的实习生”,培养成了一个“懂得权衡、做事高效的精英员工”,让 AI 在现实世界中(比如查资料、写代码、做决策)变得更加实用和可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →