← 最新论文
💬 NLP

LHAW: Controllable Underspecification for Long-Horizon Tasks

该论文提出了 LHAW 框架,通过系统性地从目标、约束、输入和上下文四个维度移除信息,将明确任务转化为可控的欠规格变体,并基于实证结果对变体进行分类,从而为长周期任务中智能体的歧义处理与澄清行为提供了首个系统化评估基准。

原作者: George Pu, Michael S. Lee, Udari Madhushani Sehwag, David J. Lee, Bryan Zhu, Yash Maurya, Mohit Raghavendra, Yuan Xue, Samuel Marc Denton

发布于 2026-03-23
📖 1 分钟阅读☕ 轻松阅读

原作者: George Pu, Michael S. Lee, Udari Madhushani Sehwag, David J. Lee, Bryan Zhu, Yash Maurya, Mohit Raghavendra, Yuan Xue, Samuel Marc Denton

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 LHAW 的新工具,它的核心目的是帮助测试和训练“超级智能助手”(AI Agent),让它们在面对信息不全的任务时,学会如何聪明地提问,而不是盲目行动或默默失败。

为了让你更容易理解,我们可以把这篇论文的内容想象成在训练一个刚入职的“全能实习生”

1. 核心问题:实习生太“自信”或太“啰嗦”

想象一下,你给一个实习生布置了一个任务:“去把那个文件整理好,发给团队。”

  • 情况 A(信息缺失): 你其实心里想的是“把 3 月份的销售报表(文件)整理好,发给销售部(团队)”,但你没说出来。
    • 糟糕的实习生(沉默型): 他可能随便找了一个文件,或者随便发给一个部门,结果做错了,而且直到最后你才发现。这就是论文里说的“静默失败”。
    • 糟糕的实习生(啰嗦型): 他可能问了你 10 个问题:“哪个文件?哪个团队?什么格式?什么颜色?……"虽然最后做对了,但他浪费了你大量时间,让你觉得他缺乏判断力。

现在的 AI 助手面临同样的问题: 在长周期的复杂任务中(比如写代码、处理公司财务),如果信息不全,它们要么盲目猜测导致错误,要么问太多问题让人厌烦。目前的测试方法只关注“任务做没做完”,没关注“它知不知道什么时候该问人”。

2. 解决方案:LHAW —— 给任务“故意挖坑”

为了解决这个问题,作者们开发了一套叫 LHAW 的系统。你可以把它想象成一个**“故意刁难人的考官”**。

LHAW 的工作流程就像是在给原本完美的任务说明书上“动手术”:

  1. 挖坑(信息移除): 它从原本清晰的任务中,随机拿走关键信息。比如把“销售报表”改成“那个文件”,把“销售部”改成“团队”。
    • 它从四个维度挖坑:目标(要做什么)、约束(怎么做/限制条件)、输入(用什么数据)、背景(行业常识)。
  2. 分级(难度控制): 它可以控制挖坑的深度。
    • 轻度挖坑: 只是把词变模糊(比如“那个文件”),聪明的实习生可能猜得到。
    • 重度挖坑: 直接删掉关键信息(比如完全没说发谁),这时候如果不问人,任务必败。
  3. 实战演练(真实测试): 它不是靠猜 AI 会不会问,而是真的让 AI 去跑任务。
    • 如果 AI 不问人就直接做,结果做错了 -> 判定为“致命缺陷”(Outcome-Critical)。
    • 如果 AI 问了人,做对了 -> 判定为“成功”
    • 如果 AI 问了人,但问了一堆废话 -> 判定为“效率低下”

3. 发现:不同 AI 的“性格”差异

作者用这套系统测试了市面上最顶尖的几个 AI 模型(像 GPT-5.2, Claude, Gemini 等),发现了一个有趣的现象,就像测试不同性格的实习生:

  • GPT-5.2(过度热情的实习生):
    • 特点: 只要有一点点不确定,它就疯狂提问。
    • 结果: 任务成功率很高,因为它问得够多,总能拿到答案。
    • 缺点: 效率低,问了很多没必要的问题,让“老板”(用户)很累。它的“提问性价比”很低。
  • Gemini 模型(过于自信的实习生):
    • 特点: 即使信息缺失,它也倾向于自己瞎猜,很少提问。
    • 结果: 经常因为猜错而失败,或者做出来的东西不符合要求。
    • 缺点: 缺乏“自知之明”,不知道什么时候该求助。
  • Claude 模型(比较均衡的实习生):
    • 特点: 在提问和独立行动之间找到了不错的平衡点,提问比较精准。

4. 核心指标:提问的“性价比”

论文提出了一个很棒的指标叫 Gain/Q(每个问题带来的收益)

  • 这就好比问:“你每问一个问题,能帮任务成功多少分?”
  • 有的 AI 问一个问题能解决一个大麻烦(高收益);有的 AI 问了一堆问题,只解决了小细节(低收益)。
  • 研究的目标就是训练出那种**“问得少,但问得准”**的 AI。

5. 为什么这很重要?

以前的 AI 测试,就像是在考“填空题”,题目给得很全,看谁填得快。
但现实世界的工作(长周期任务)更像是**“侦探破案”**,线索往往是不完整的。

  • 如果 AI 不懂提问: 它可能会在错误的道路上越走越远,造成巨大的损失(比如把错误的代码部署到服务器上)。
  • 如果 AI 太爱提问: 它会打断人类的工作流,让人类觉得它很笨,不敢信任它。

LHAW 的意义在于: 它建立了一套标准,教会 AI 如何**“战略性地提问”**。它让 AI 明白:

  • 什么时候必须停下来问人(因为不问就会搞砸)。
  • 什么时候可以自己猜(因为猜错也没关系,或者能自己查到)。
  • 如何用最少的提问,换取最大的成功概率。

总结

简单来说,这篇论文就是给 AI 搞了一场**“抗压面试”
它故意把任务变得模糊不清,看 AI 是
盲目自信**、过度依赖,还是能聪明地沟通。通过这种测试,未来的 AI 助手将不再是只会执行命令的机器,而是懂得在信息不足时,像人类专家一样,知道何时该停下来问一句:“老板,您具体是指哪一个?”从而真正变得可靠和自主。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →