← 最新论文
🤖 machine learning

Agentic Skill Optimization over Lie Algebroids

本文介绍了 LASKO,这是一个利用李代数(Lie algebroids)来表示编辑策略及其非交换组合,从而对智能体技能优化进行建模的新型框架,通过在进行昂贵的 LLM 验证之前,利用廉价的李括号(Lie-bracket)测试来筛选编辑,从而实现了数量级的加速。

原作者: Sridhar Mahadevan

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Sridhar Mahadevan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图修理一台由乐高积木组成的巨大且复杂的机器,每一块积木都是一个特定的指令、一条规则或是一个给机器人的检查清单。这台机器是一个旨在执行智能任务的“智能体系统”(agentic system)。问题在于,当机器人犯错时,你不能仅仅更换掉一块乐高积木并寄希望于好运;有时候,更换积木的顺序至关重要。如果你先修复了“安全规则”再修复“数学规则”,机器就能正常工作;但如果你反过来操作,整个机器就会崩溃。

这就是 LASKO(李代数技能优化,Lie Algebroid SKill Optimization)论文试图解决的谜题。

问题所在:“顺序陷阱”

把机器人的指令想象成一段用一种特殊语言(称为 Markdown)编写的长篇故事。为了让机器人变得更强大,一个 AI 优化器会尝试编辑这个故事。它会提出微小的改动建议:“在这里添加一条规则”、“删除那个例子”或“修复这个模式(schema)”。

在旧的方法中(称为 SKILLOPT),优化器表现得像个笨拙的花匠。它尝试一个改动,观察植物是否生长,然后尝试另一个改动。它假设每个改动都是独立的,就像在花园里添加一朵单花。但本文指出这是错误的。这些改动更像是时钟里的齿轮。如果你在修好连接的齿轮之前就去修弹簧,时钟就不会滴答作响。论文表明,两个本身看起来都完美的改动,如果顺序错了,结果会一败涂地。

论文明确反对那种“通过逐一尝试每种可能的组合来解决问题”的想法。它指出,尝试每一种可能的顺序(即“暴力破解”法)成本太高且速度太慢,因为每次都要让机器人经历一次大规模且昂贵的测试。它也反对认为单个改动的“得分”就能说明全部情况;有时一个改动虽然即时效果看起来很好,但却会破坏机器人未来的学习能力。

解决方案:“秘密握手”检测器

作者提出了一个名为 LASKO 的新框架。要理解它,请想象机器人的指令不仅仅是一个扁平的列表,而是一个具有隐藏层的 3D 结构。

  1. 可见层(锚点/Anchor): 这是你在屏幕上看到的——文档中发生变化的实际文字。
  2. 隐藏层(内核/Kernel): 这是不可见的部分:内部路由、模板变量,以及你无法立即看到但会影响未来改动行为的机器人“情绪”。
  3. 秘密握手(括号/Bracket): 这是论文的核心思想。这是一个数学测试,用于检查两个改动是否能正确地“握手”。如果先做改动 A 再做改动 B,其结果是否与先做改动 B 再做改动 A 相同?

在 LASKO 的世界里,如果两个改动不“交换”(即顺序改变会导致结果不同),系统就会将其标记为“高括号”(high-bracket)对。这就像繁忙路口的一个交通警察。系统不再让每一辆车(每一种可能的编辑顺序)都尝试通过并看是否撞车,而是使用一个快速、廉价的传感器来检查交通流。

奇迹:提速 15 倍

这里是数字令人兴奋的地方。论文进行了一系列测试,以观察这种“交通警察”理念是否奏效。

他们设置了一个挑战,要求机器人修复一个包含 10 个特定锚点(如“模式”、“工具契约”、“校验器”等)的工作流。

  • 旧方法(暴力破解): 为了找到完美的修复方案,你必须尝试所有可能的编辑顺序。对于 10 个项目,那就是 90 种有序对。如果你对每一对都运行一个巨大的 AI 模型(例如论文中提到的拥有 671B 参数的 DeepSeek V3.1 4-bit 模型),这会耗费极长时间。
  • LASKO 方法: 系统首先运行一个超快速的“括号探测器(bracket probe)”。这是一个极其微小、廉价的计算过程,耗时仅为微秒级(具体而言,论文指出在一次测试中,一个探测器仅用了约 0.000127 秒)。该探测器可以预测哪些编辑对实际上是重要的“高括号”对。
  • 结果: LASKO 没有测试所有的 90 个对,而是先运行 90 次括号探测 来过滤列表,然后仅验证预测出的前 10 个对。

在实验中,这种方法实现了相对于暴力破解法近 15 倍 的加速。在一次使用 DeepSeek V3.1 模型的测试中,暴力破解法验证所有选项需要 538.1 秒,而 LASKO 完成同样的工作仅需 36.2 秒。这是 14.85 倍 的加速。

更令人印象深刻的是,在一次使用 Nemotron 70B 模型的测试中,时间从 712.4 秒 降至 86.0 秒8.28 倍 加速)。在他们测试的所有模型中,平均加速比为 6.94 倍

这究竟意味着什么

论文非常谨慎地表示,这并不是一个能瞬间解决一切问题的魔杖。它并不会消除对“验证”这一昂贵步骤的需求(即机器人实际尝试修复的过程)。相反,它扮演的是一个过滤器的角色。

把它想象成夜店门口的保镖。 “括号探测器”就是检查身份证的保镖。它既快又便宜。它拦住了那些注定进不去的人(错误的编辑顺序),使得昂贵的“服务验证”(实际进入俱乐部)只需处理那些真正有机会的人。

作者指出,这种方法允许系统在仅花费一小部分时间和金钱的情况下,找到完美的修复序列(获得 1.000 的得分)。在一次包含 160 个编辑 的测试中,暴力破解法需要进行 25,441 次昂贵的验证检查。而 LASKO 利用其括号筛选功能,仅需 168 次探测(包括括号检查和最终验证调用)就达到了同样的完美得分。

核心结论

论文表明,通过将技能编辑视为一个结构化系统(其中顺序和隐藏上下文至关重要),而不仅仅是一个扁平的选项列表,我们可以更快地优化 AI 智能体。这不仅仅是关于如何更好地猜测,而是关于如何知道哪些猜测值得进行昂贵的测试。

虽然结果令人期待,且在大型模型实验中得到了测量,但作者将其定义为一个新的优化框架。他们展示了“李括号”(Lie bracket,即顺序敏感性测试)是一个强大的工具,可以在这些路径消耗我们的时间和金钱之前,将错误的路径过滤掉。它将一场在迷宫中的混乱搜索变成了一场有导向的游览,确保我们只走那些最有希望通往出口的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →