To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling
本文提出了一种基于决策理论的框架,通过分析模型感知需求与真实需求及效用之间的错位来评估和优化大语言模型的调用工具决策,最终证明基于隐藏状态训练轻量级估计器可显著提升任务性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明、博览群书的助手(人工智能),它正试图回答你的问题。有时,这位助手能脱口而出答案;而有时,它需要去图书馆(互联网)查阅资料,以确保事实准确。
这篇论文提出的核心问题是:这位助手如何知道何时停止思考并开始查阅资料?
研究人员发现,尽管这些人工智能助手正变得越来越聪明,但它们实际上非常不擅长决定何时使用“图书馆借书证”。它们经常在不必要时调用图书馆(浪费时间和金钱),或者在急需帮助时却未能调用。
以下是他们发现与解决方案的简要说明,并辅以简单的类比:
1. 良好决策的三条规则
作者建立了一个框架,用于评判人工智能“查阅资料”这一决定是否明智。他们将这三个因素称为:
- 必要性(我需要帮助吗?): 人工智能能否仅凭自身记忆解决问题?如果它已经知道答案,调用图书馆就是不必要的。
- 效用性(这会有帮助吗?): 如果人工智能确实查阅了资料,答案是否会真正变得更好?有时,查阅事实可能会让人工智能感到困惑或引入错误,导致最终答案比它仅仅依靠猜测时更差。
- 可负担性(我付得起吗?): 查阅资料需要花费金钱和时间。一个明智的决策者只有在收益值得付出成本时才会花钱。
2. 问题所在:人工智能“过度自信”或“信心不足”
研究人员在三种类型的任务(如回答常识问答或撰写特定主题的文章)上测试了六种不同的人工智能模型。他们比较了三种场景:
- 无图书馆: 人工智能仅凭记忆作答。
- 总是图书馆: 无论什么情况,人工智能总是查阅资料。
- 自主决策: 人工智能自行决定何时查阅资料。
令人惊讶的是: “自主决策”模式往往表现最差。
人工智能关于是否需要帮助的“直觉”经常出错。
- “误报”: 有时人工智能心想:“我不知道这个,我需要搜索!”但实际上它确实知道答案。它浪费了资源。
- “错失良机”: 有时人工智能心想:“我知道这个!”但实际上它是错的。它拒绝搜索,给出了错误的答案。
- “糟糕的搜索”: 即使人工智能进行了搜索,搜索结果有时也会让它感到困惑,导致答案比仅依靠记忆更差。
类比: 想象一位正在尝试烹饪菜肴的厨师。有时,这位厨师明明是一位精通食谱的大厨,却还是会拿起烹饪书(工具);而有时,厨师缺少关键食材,却拒绝检查储藏室,结果导致菜肴烧焦。这位厨师关于“何时检查储藏室”的“直觉”已经失灵了。
3. 解决方案:“隐藏信号”探测器
研究人员意识到,虽然人工智能的口头决定(即说出“我需要搜索”)并不可靠,但其内部脑波(即其隐藏的数学状态)实际上蕴含着真相。
这就像测谎仪测试。人工智能可能会说:“我很好,我不需要帮助”,但其内部信号(如心跳加速)却可能在尖叫:“我很困惑!我需要帮助!”
修正方案:
研究人员没有让人工智能自行决定,而是构建了一个微小、轻量级的“交通警察”(一个简单的计算机程序),用于监控人工智能的内部脑波。
- 这位“交通警察”观察人工智能的隐藏信号,以预测:“这个人工智能实际上需要帮助吗?”以及“查阅这个资料真的会让答案变得更好吗?”
- 基于这个“真实”的信号,“交通警察”会告诉人工智能:“是的,去查一下”或“不,坚持用你的记忆”。
4. 结果
当他们使用这位“交通警察”来引导人工智能时:
- 人工智能犯的错误更少。
- 它停止在不必要的搜索上浪费金钱。
- 它开始在最有用的时候进行搜索。
- 有趣的是,这种方法对较小、较弱的模型效果甚至更好,帮助它们达到了与更大模型相当的表现。
总结
该论文得出结论:目前的人工智能模型在判断自身知识储备和外部工具价值方面表现极差。它们往往不一致且效率低下。然而,通过构建一个简单的外部系统来读取人工智能的“隐藏思想”,而不是听从它的“口头言语”,我们可以纠正这些糟糕的决策,节省资金,并获得更好的答案。
该论文并未声称:
- 它没有说这适用于医疗诊断或法律建议。
- 它没有声称人工智能现在已“有意识”或“自我意识”。
- 它没有暗示人工智能最终会学会完美地自行完成这一过程;该论文建议我们需要这些外部“控制器”来帮助人工智能做出理性的选择。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。