← 最新论文
💻 computer science

Harnesses for Inference-Time Alignment over Execution Trajectories

本文提出了一种推理时轨迹对齐框架,用于分析大语言模型智能体的 Harness 工程,揭示出通过平衡任务分解与引导式执行以避免过度分解和幻觉等失败模式,往往需要部分而非完全结构化的工作流程才能实现最优性能。

原作者: Boyuan Wang, Bochao Li, Minghan Wang, Yuxin Tao, Fang Kong

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Boyuan Wang, Bochao Li, Minghan Wang, Yuxin Tao, Fang Kong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《执行轨迹上的推理时对齐 harness》的解释,使用通俗易懂的类比语言进行翻译。

核心理念:“过度管教”问题

想象你正在教一个非常聪明但缺乏经验的机器人烘焙一款复杂的蛋糕。你有两种帮助它的方法:

  1. “全手册”方法:你写一份 50 步的食谱。第 1 步:“预热烤箱”。第 2 步:“打开冰箱”。第 3 步:“取出鸡蛋”。第 4 步:“敲开鸡蛋”。以此类推,直到抹上糖霜。
  2. “部分指南”方法:你给机器人前三步(“预热、取食材、敲开鸡蛋”),然后说:“好的,剩下的你知道了。去完成蛋糕吧。”

这篇论文认为,更多的指令并不总是意味着更好的蛋糕。事实上,如果你给机器人太多琐碎、具体的步骤,它可能会感到困惑,犯下会累积的小错误,或者因为试图遵循一条不适合当前情况的规则而卡住。有时,给机器人更少的结构,让它自己搞定中间部分,反而能带来更好的结果。

作者将这种现象称为“Harness 工程”(Harness 即“挽具”或“约束装置”)。"Harness"只是一个 fancy 的词,指代你给 AI 的一套规则、子任务和指导,以帮助它解决大问题。

两大主要杠杆

这篇论文将我们要如何帮助 AI 分解为两种不同的工具:

1. 地图(任务分解)

这是将一个大任务拆解成更小的块。

  • 类比:想象徒步登山。
    • 太粗糙:你告诉徒步者,“去爬那座山”。(太模糊;他们可能会迷路)。
    • 太精细:你告诉徒步者,“迈出一只脚。现在再迈一步。现在抬起左脚。现在把它放下”。(管得太细;徒步者会困惑并绊倒)。
    • 刚刚好:你给他们检查点:“走到那棵树,然后到那块石头,再到山顶。”
  • 发现:论文证明,这些检查点的大小至关重要。如果检查点太大,AI 无法到达;如果太小,AI 会累积微小的错误(就像数学中的舍入误差),从而毁掉最终结果。这个“甜蜜点”取决于特定 AI 的能力水平。

2. 指南针(引导)

这是你在 AI 执行特定步骤时给出的建议。

  • 类比:想象你在雾中开车。
    • 对齐的引导:你说,“保持在车道内,但要小心大雾。”这能帮你保持安全。
    • 未对齐的引导:你说,“开快点,忽略大雾,因为地图显示你没问题。”这可能会让车更快撞毁,因为 AI 是在遵循你的规则,而不是道路的现实情况。
  • 发现:只有当引导与现有证据相匹配时,它才有帮助。如果你告诉 AI 在信息不足时“要自信”,它就会开始产生幻觉(编造内容)。如果你告诉它“核实事实”,它的表现会更好。引导的强度不如引导是否符合当前情况重要。

令人惊讶的发现:“部分 Harness"

这是论文中最反直觉的发现。

通常人们认为:“如果一点点帮助是好的,那么很多帮助一定很棒。”
论文说:不。

他们发现,最佳策略往往是部分 Harness

  • 类比:想象 GPS 导航。
    • 全 Harness:GPS 告诉你整个 3 小时车程中的每一个转弯。“前方 500 英尺左转。前方 200 英尺并入右侧车道。”如果 GPS 在途中出现信号故障,或者突然封路,整个计划就会崩溃,因为 AI 正忙于遵循僵硬的脚本。
    • 部分 Harness:GPS 说,“开车到高速公路入口,然后并入 I-95 号公路。”一旦你上了高速,AI 就会接管,并根据实时交通状况自行规划剩余路程。
  • 结果:在他们的实验中,那些只被给予前几步然后被放手让其自行完成工作的 AI 智能体,往往比那些被给予完整、详细计划的智能体更常取得成功。AI 只需要足够的结构来确保起步方向正确,但随后需要自由去适应旅程的其余部分。

为什么会发生这种情况?

作者使用了一个名为**“可恢复性”**的概念。

  • 想象 AI 正在走钢丝。
  • 如果你给它一个僵硬的脚本(太多步骤),而它犯了一个微小的错误,它就会从钢丝上掉下来,因为脚本不允许修正。
  • 如果你给它一个部分指南,它可以踉跄一下,意识到自己偏离了轨道,然后利用自己的大脑修正错误并重新回到钢丝上。

规则总结

基于他们的数学推导和实验,这篇论文提出了构建 AI 助手的三条规则:

  1. 将步骤大小与 AI 能力匹配:不要将任务分解成 AI 无法处理的步骤,也不要分解得如此细小以至于它迷失在细节中。为那个特定的 AI 找到“金发姑娘”(大小适中)的尺寸。
  2. 将建议与事实匹配:只给出 AI 实际能看到的内容所支持的指导。如果你让它猜测,它就会撒谎。
  3. 该停手时就停手:不要编写整个脚本。给 AI 一个起点,让它运行一会儿,然后让它完成工作。最有效的 Harness 通常是那个能防止 AI 从悬崖跌落的最短的 Harness。

简而言之:不要过度设计 AI 的路径。给它一个好的起点,一个好的指南针,然后让它去驾驶。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →