← 最新论文
🤖 AI

Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents

Trace2Policy 引入了一种错误驱动的迭代式技能精炼(EISR)框架,该框架能够系统地将专家决策规则恢复并改进为高准确度、确定性的 Python 代码,在合规敏感型任务中优于静态 LLM 蒸馏和纯 LLM 基准模型,同时显著降低了精炼成本。

原作者: Junli Zha, Jinbo Wang, Chao Zhou, Xiang Song

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Junli Zha, Jinbo Wang, Chao Zhou, Xiang Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一家繁忙的物流公司,资深审核员每天都在处理数以千计的运输索赔案件。他们观察照片、阅读报告,并做出判断:“这件损坏是承运方的责任,还是发货方的责任?”这些专家基于一套复杂的、不成文的心理规则进行决策,这些规则是他们多年积累下来的。他们知道诸如“如果照片显示包装破损,但系统显示‘完好’,则以照片为准”或“如果审核员写的备注以‘C:’开头,这意味着他在秘密重新分配责任”之类的逻辑。

问题在于,这些规则被困在专家的脑海中。如果你试图仅仅通过展示几个例子来教计算机(AI)做这项工作,它会感到困惑。它会错过专家使用的那些微妙且隐藏的技巧。

Trace2Policy 是一个旨在解决此问题的全新系统。你可以把它看作是一个“规则提取与精炼机器”。以下是它的工作原理,我们使用简单的类比来解释:

1. 侦探阶段(捕捉行为)

首先,系统充当一名沉默的侦探。它观察资深审核员在电脑上的操作过程,记录每一次点击、查看的每一个屏幕以及输入的每一条备注。它不仅记录他们点击了什么,还试图理解他们为什么要这样做。

  • 类比: 想象一位教练正在记录一位名厨烹饪复杂菜肴的过程。教练不仅会写下“加盐”,还会记录:“厨师尝了汤,皱了皱眉,然后加了一小撮盐,因为汤的味道太酸了。”

2. 起草阶段(初次尝试)

系统获取这些记录,并要求一个聪明的 AI 写出它认为厨师正在遵循的规则。

  • 问题: 初稿通常是肤浅的。它只能捕捉到显而易见的步骤(“检查箱子”),但会错过深层的、隐藏的逻辑(“检查当前的代码,而不是原始代码,因为系统会实时更新”)。
  • 结果: 这个初稿(称为“v1 Skills”)表现尚可,但只能正确处理大约 70% 的决策。这就像一个背下了教科书的学生,但还没学会如何应对期末考试中的陷阱题。

3. “EISR”引擎(魔力循环)

这是核心创新点。系统使用了一个名为 EISR(错误驱动的迭代技能精炼)的过程。

  • 工作原理: 系统将起草的规则应用于一组测试案例。当它犯错时,它不仅仅是说“错了”。它表现得像一个严厉的编辑:
    1. 诊断: 它对错误进行分组。是“缺失”(没有规则覆盖到这种情况)?“错误”(规则存在但给出了错误答案)?还是“冲突”(两条规则发生了争执)?
    2. 修补: 它针对该组错误编写一个特定的修复方案。
    3. 安全检查(回归门控): 在保存修复方案之前,它会再次运行之前的正确案例。如果新的修复方案破坏了之前正常工作的部分,它就会丢弃该修复方案。
  • 类比: 想象一名机械师正在修理汽车发动机。每当他们通过拧紧一个螺栓来消除异响时,他们都会立即测试发动机,以确保他们没有意外地松动了火花塞。他们不断重复这个过程,直到汽车运行完美且不再出现其他问题。

4. “陷阱规则”的发现

通过这个循环,系统发现了“陷阱规则”——即那些无法通过单次访谈就能写出来的深度知识。

  • 示例: 其中一个陷阱是,屏幕上的某个特定代码可能看起来像是“共同责任”,但实际上它只是一个在五分钟前从“包装损坏”变更而来的临时标签。专家知道要忽略这个标签,转而观察审核员采取的动作。AI 是在反复出错并被纠正后才学到这一点的。

5. 最终产物:编译版 vs. 提示词版

论文提出了一个非常具体且令人惊讶的观点,关于如何使用这些规则:

  • 提示词方法(The Prompt Method): 你可以将规则作为一长串指令喂给 AI(即“提示词”)。这可行,但就像要求一个天才在阅读 50 页手册的同时解决一道数学题。这种方法的准确率约为 70%。
  • 编译方法(The Compiled Method): 系统将这些规则转化为严格的计算机程序(Python 代码)。这就像把那本手册变成了一个只会进行数学运算的计算器。
  • 结果: “编译版”的准确率跃升至 79.6%。论文认为,对于这类特定且规则密集的任务,规则的质量AI 的智能程度 更重要。一个遵循完美规则的简单计算机,比一个遵循糟糕规则的聪明 AI 表现更好。

6. “飞轮效应”(自我改进)

一旦部署,系统就不会停止工作。

  • 循环: 人类审核员仍会按照正常工作流程审核每个案例。系统会将自己的答案与人类的答案进行对比。如果两者不一致,系统会标记该差异,分析错误,并自动触发另一个“EISR”轮次来修正规则。
  • 成本: 如果人工手动完成,一个周期需要人类专家花费 70 小时。而自动化版本(Auto-EISR)仅需 5–10 美元 且只需几个小时。

总结性主张

  • 它在做什么: 将专家行为转化为自我改进的决策规则。
  • 它的发现:
    • 单次学习(向 AI 提问一次)无法捕捉到深层、隐藏的规则。
    • 迭代错误纠正(EISR)能找到“陷阱规则”,从而显著提升准确率。
    • 对于这些特定任务,将规则作为严格的计算机程序运行,比让 AI 阅读规则作为提示词的效果更好。
    • 加入 AI “安全网”(即在不确定时让 AI 修正规则)在特定情况下反而降低了准确率,因为 AI 太过急于拒绝索赔,而规则本身已经针对公司的特定需求进行了完美调优。
  • 适用范围: 该研究是在一家物流公司的损坏索赔数据(3,349 个案例)以及一些法律推理基准测试上进行的。作者并非声称这适用于所有类型的决策,而是专门针对那些专家遵循系统化、隐性规则的任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →