← 最新论文
🤖 AI

Learning CLI Agents with Structured Action Credit under Selective Observation

本文通过引入σ\sigma-Reveal 推理时机制、动作优势分配(A3\mathrm{A}^3)强化学习方法以及用于可验证评估的 ShellOps 数据集套件,解决了学习命令行界面(CLI)智能体过程中面临的选择性观察和稀疏奖励信用分配的挑战。

原作者: Haoyang Su, Ying Wen

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoyang Su, Ying Wen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一位非常聪明但视力稍差的助手来管理一座庞大而混乱的图书馆。这位助手可以阅读书籍、移动书架并撰写新笔记,但在任何给定时刻,他只能看到图书馆的一小部分。此外,你只在最后才告诉他是否解开了整个谜题,而不会在他第一步选对了书或第二步写对了笔记时给予反馈。

这正是该论文所面临的挑战:教导CLI 代理(与计算机命令行交互的计算机程序)在复杂的文件系统中工作,在这些系统中,它们无法看到所有内容,且仅在最终获得“做得好”或“失败”的信号。

作者提出了一种训练这些代理的新方法,主要依靠两个核心技巧:σ-RevealA3

两大核心问题

  1. “蒙眼”问题(选择性观察):
    图书馆(计算机的文件系统)拥有成千上万个文件。由于内存(令牌预算)有限,代理无法一次性读取所有文件。如果你向它展示整个图书馆,它会不堪重负;如果你什么都不展示,它就只能靠猜测。

    • 论文的解决方案(σ-Reveal): 这就像一位聪明的图书管理员,他根据代理的具体问题,在代理开始工作之前,只提取并展示相关的书籍和文件夹。图书管理员不会把整个图书馆堆在桌上,而是说:“这是你解决此问题实际需要的 5 个文件,忽略其余部分。”这有助于代理专注于正确的证据,而不会迷失方向。
  2. “黑盒”奖励问题(信用分配):
    代理需要采取许多步骤(回合)来完成任务。在结束时,你只说“成功!”或“失败”。但究竟是哪个具体步骤起了决定性作用?是代理在第 2 步找到了正确的文件,还是在第 4 步输入了错误的命令?

    • 论文的解决方案(A3): 这是一种向代理行为分配信用的新方法。A3 不再仅仅给出“整体做得好”的评价,而是将分数分解为三个层次:
      • 回合得分(Episode Score): 这次尝试是否比同一任务的其他尝试更有效?
      • 回合得分(Turn Score): 这个特定命令是否与其他成功尝试中的命令相似?(论文使用一种特殊的“指纹”称为AST(抽象语法树)来比较命令的结构,就像比较句子的骨架而不仅仅是单词一样)。
      • 树得分(Tree Score): 这一特定行动路径是否比其他代理采取的类似路径带来了更好的结果?
    • 类比: 想象一位教练在观看足球队比赛。教练不只是说“我们赢了”,而是说:“第 10 分钟的传球很棒(回合得分),那个动作与上周进球的动作完全一致(结构得分),而且选择进攻左侧而非右侧是正确的策略(树得分)。”这有助于代理确切地知道应该重复什么。

新游乐场:ShellOps

为了测试这一点,作者建立了一个名为ShellOps的新训练环境。

  • 你可以将其视为计算机代理的健身房
  • 它包含 1600 多个任务,范围从简单的“找到这个文件”到复杂的“编辑这 20 个文件并给我一个摘要”。
  • 它被设计为可验证的:计算机可以自动检查代理是否真正做了正确的事情(例如,文件是否确实被正确编辑了?),而不仅仅是猜测答案听起来是否合理。

尝试后的结果如何?

作者使用一个 140 亿参数的模型(中等规模但强大的大脑),将他们的新技术(A3 + σ-Reveal)与其他顶级 AI 代理进行了测试。

  • 结果: 他们的方法显著优于其他方法。
    • 在最困难的任务(“混合”任务,既需要查找信息又需要编辑文件)上,他们的代理正确率约为24.6%,而次优方法仅为11.3%
    • 训练过程也更便宜、更快速。其他一些方法需要第二个“裁判”AI 来评估每一步,这既慢又昂贵。他们的方法利用代码本身的结构进行数学评分,从而保持了低成本。

核心结论

该论文声称,通过为代理提供所需文件的聚焦视图(σ-Reveal)以及对哪些具体行为是有效的详细成绩单(A3),我们可以教会它们更好地导航和修复计算机文件系统。

他们并未声称这适用于医疗诊断、自动驾驶汽车或创意写作。他们专门专注于命令行任务:查找日志、编辑代码、汇总电子表格中的数据以及修复数据库条目。在这个特定的领域,他们这种新的“聪明图书管理员”和“详细教练”方法使代理变得更加聪明和可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →