← 最新论文
🤖 AI

Answer Engineering: Local Trajectory Editing for Protocol-Constrained Decision Making in Large Language Models

本文介绍了“答案工程”(Answer Engineering),这是一种确定性的运行时层,通过在生成过程中对推理轨迹应用局部、规则引导的干预,来提高大语言模型的协议遵循能力,在无需模型重训的情况下,显著提升了突发性传感器神经性听力损失临床决策的准确性。

原作者: Victor Lavrenko, Anastasiia Molodnitskaia

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Victor Lavrenko, Anastasiia Molodnitskaia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“自信却错误”的 AI

想象一下,你雇佣了一位非常聪明、口才流利的实习生来编写一份医疗报告。你给了他一份必须严格遵守的检查清单(即“协议”)。

  • 问题所在: 即便你告诉实习生,“请务必按步骤执行清单”,他们也往往会变得过于自信,写出一份看起来逻辑通顺、实则暗中跳过了关键安全步骤或过早得出结论的报告。他们可能会写出一篇完美的解释来为错误的答案辩护,而不是真正通过遵循规则来寻找正确答案。
  • 论文发现: 仅仅要求 AI “一步步思考”并不能解决这个问题。事实上,在针对特定病症(突发性耳聋)的测试中,这种做法反而让 AI 遵循规则的能力变差了——成功率从 54% 下降到了 25%。

解决方案:“答案工程”(实时编辑器)

作者提出了一种名为**“答案工程”(Answer Engineering)的新方法。与其试图重新训练 AI(这既昂贵又缓慢),或者仅仅寄希望于它能做对,不如构建一个位于 AI 与最终答案之间的实时编辑器**。

把 AI 的思考过程想象成沿着轨道行驶的火车

  • 标准 AI: 火车只是不断向前行驶。如果它走错了路,它会一直开下去,直到撞上死胡同或到达错误的车站。
  • 答案工程: 这就像是在轨道旁站着一位拿着遥控器的交通管理员。随着火车的移动,管理员会观察每一步。
    • 如果火车试图跳过强制性的停靠站(即违反协议规则),管理员就会按下刹车。
    • 管理员随后会将火车倒退到上一个安全的位置。
    • 管理员会强迫火车采取不同的路径,或者插入一个 AI 遗漏的必要路标。
    • 然后,火车从这个修正后的位置继续行驶。

它是如何运作的(三种手段)

论文描述了这位“交通管理员”在 AI 写作过程中进行修复的三种具体方式:

  1. 编辑过去(“撤销”按钮): 如果 AI 写了一句违反规则的话(例如,在检查症状之前就写道“这肯定是心脏病发作”),管理员会删除这句话,并用一个更安全、符合规则的版本来替换它。
  2. 回溯并重试(“绕行”): 如果 AI 开始走向错误的路径,管理员会将它送回上一个交叉口,并询问:“尝试一个不同的方向。”它会测试几种选项,并选择那个符合规则的选项。
  3. 强制未来(“强制路标”): 如果规则规定 AI 必须 提到某个特定的警告(例如“这是紧急情况”),管理员会在 AI 继续写作之前,直接将该短语插入文本中,确保规则绝不会被跳过。

实验结果:修复火车轨道

作者在涉及突发性耳聋的医疗场景中测试了这一方法。

  • 修复前: 当 AI 仅被告知要“一步步思考”时,它遵循规则的成功率仅为 25%
  • 修复后: 有了“答案工程”编辑器的实时观察和纠正,AI 遵循规则的成功率达到了 83.5%
  • 额外收获: 它不仅修复了主要问题,还帮助 AI 避免了在其他类似但不同的案例(传导性耳聋)中犯错,这证明它不仅仅是在“猜测”正确答案,而是在真正遵循逻辑。

局限性(不足之处)

论文坦诚地说明了这种方法的局限性:

  • 它是一种补丁,而非万能药: 它在规则清晰且错误属于局部性问题(如跳过某一步骤)时效果最好。如果 AI 的基本“性格”就是无视规则,那么它无法解决所有问题。
  • 它很耗时: 由于系统必须停止、检查并有时需要让 AI 回溯思考,它的运行速度比普通 AI 慢了约 2.8 倍
  • 它需要人类来编写规则: 你仍然需要人类专家来编写控制器所执行的“交通法规”(即规则)。系统本身不会发明规则,它只是执行规则。

总结

这篇论文表明,我们并不总是需要构建更聪明的 AI 大脑来获得更安全的结果。有时,我们只需要一个聪明的编辑器,它能在实时监控 AI 工作的同时,捕捉到它违反规则的行为,并在任务完成前温柔地将其引导回正确的轨道。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →