← 最新论文
🤖 machine learning

Mitigating Errors in LLM-Generated Web API Invocations via Retrieval-Augmented Generation and Constrained Decoding

本文提出并评估了检索增强生成(RAG)与约束解码(CD)作为互补策略,旨在提高大语言模型生成的 Web API 调用正确性,研究发现,虽然 RAG 在完整调用生成中能有效减少幻觉,但 CD 在防止非法参数方面更为可靠,并在不同场景下显著提升了整体正确性。

原作者: Daniel Maninger, Leon Chemnitz, Jannis Brugger, Tushar Lamba, Amir Molzam Sharifloo, Mira Mezini

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniel Maninger, Leon Chemnitz, Jannis Brugger, Tushar Lamba, Amir Molzam Sharifloo, Mira Mezini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图建造一栋房子,但你没有聘请一位建筑大师,而是请了一位非常聪明、博学但有点丢三落四的助手(即大语言模型,LLM)来为你编写蓝图。

问题在于,建造这栋房子的“规则”并不在助手的脑子里。它们被写在一本极其庞大且复杂的说明书中,叫做 OpenAPI 规范(这份文档准确地告诉了你该打开哪扇门、使用哪把钥匙,以及该订购多大尺寸的砖块)。

如果你只是要求助手“造一扇门”,它可能会猜错尺寸、用错钥匙,或者发明一个说明书中根本不存在的门。这就是所谓的幻觉(Hallucination)

这篇论文介绍了一种方法,通过给这位助手提供两种特定的工具,来阻止它胡编乱造规则,并让它能够完美地遵循说明书。

问题所在:“猜谜游戏”

研究人员发现,当他们要求 AI 模型编写代码来连接 Web 服务(例如发送 Slack 消息或检查 Google 日历)时,AI 会不断出错。

  • 它会选错“门”(端点/endpoint)。
  • 它会尝试使用一个并不存在的“钥匙”。
  • 它会发明说明书中没有的功能。

解决方案:两种新工具

研究人员使用一个真实世界的编码任务数据集,测试了两种不同的修复方法。

工具 1:“小抄”(检索增强生成 - RAG)

类比: 想象你正在参加一场考试,但你可以把教科书中的特定页面带进考场。在 AI 写出答案之前,一个机器人图书管理员(检索器)会查看那本庞大的说明书,找到关于你要找的那扇“门”的准确页面,然后把它递给 AI。

  • 运作方式: 研究人员构建了一个系统,抓取 API 说明书的相关部分,并将其粘贴到 AI 的提示词(prompt)中。
  • 结果: 效果褒贬不一。
    • 优点: 当 AI 不知道应该选哪扇“门”时,“小抄”能帮助它找到正确的门。它阻止了 AI 发明虚假的门。
    • 缺点: 当 AI 已经知道该选哪扇门时,“小抄”有时反而会干扰它。AI 看到小抄里列出了 20 个可能的“钥匙”,就会想:“我应该把它们都用上!”即便这项任务其实只需要其中一个。这导致代码变得混乱且错误。
    • 结论: 它有助于找到正确的路径,但会让 AI 变得“过度热衷”于使用它并不需要的额外选项。

工具 2:“铁轨”(约束解码 - Constrained Decoding)

类比: 想象 AI 是一列火车。通常情况下,火车可以去地图上的任何地方,甚至可以脱离轨道进入沼泽(幻觉)。约束解码(Constrained Decoding) 就像是铺设了钢轨,这些轨道通往有效的目的地。火车在物理层面上无法离开轨道。

  • 运作方式: 研究人员将说明书转化成了一套严格的规则(类似于迷宫)。当 AI 尝试输入下一个代码单词时,系统会进行检查:“这个单词是被规则允许的吗?”如果 AI 试图输入一个虚假的门或错误的钥匙,系统会拦截它,并强制 AI 选择一个有效的选项。
  • 结果: 这是明显的胜出者。
    • 零幻觉: AI 不可能发明任何虚假的 URL、方法或参数。从数学上讲,它不可能违反规则。
    • 更高的准确性: 因为它无法胡编乱造,它所写的代码更有可能实现正确。
    • 结论: 这是最可靠的工具。它强迫 AI 必须服从说明书。

组合拳:“小抄” + “铁轨”

研究人员尝试同时使用这两种工具。

  • 结果: 对于某些模型来说,这种做法效果非常好,并取得了最高分。然而,它并不一致。有时“小抄”会让 AI 试图使用过多的选项,尽管“铁轨”阻止了它做出非法动作,但它仍然会做出许多不必要的动作。
  • 结论: 它很强大,但单独使用“铁轨”更安全、更一致。

核心结论

论文得出结论:虽然 AI 擅长编写代码,但它在独自遵循复杂的外部规则手册方面表现得很差。

  • RAG(小抄) 就像是给 AI 一本参考书。它有帮助,但 AI 可能会被过多的信息分散注意力。
  • CD(铁轨) 就像是在 AI 周围建一个笼子,只允许合法的移动。这是防止 AI 胡编乱造规则最有效的方法。

研究人员表示,如果你希望 AI 编写连接 Web 服务的代码而不出错,你不应该仅仅依赖 AI 的记忆。你需要要么给它正确的说明书(RAG),或者更直接地,强迫它严格遵守规则(CD)。“铁轨”方法是确保代码真正运行起来的最可靠方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →