← 最新论文
🤖 AI

Small Reasoning Models are Instruction Followers in Function Calling

本文介绍了指令遵循型函数调用(Instruction-Followed Function Calling, IFFC),该框架通过将函数调用逻辑委托给一个较小的指令遵循模型,从而在量化条件下实现比原生或基于提示的方法更高的准确性和鲁棒性,尤其适用于面向推理的大语言模型。

原作者: Yalda Taheri, Mohammad Hassan Heydari, Erfan Naaman, Afsaneh Fatemi

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yalda Taheri, Mohammad Hassan Heydari, Erfan Naaman, Afsaneh Fatemi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,正在发生一场从单纯生成文本的计算机向具备行动能力的系统转变。这些被称为“智能体”(agentic)的新型系统旨在通过接触外部世界来解决问题。它们通过选择工具(例如天气应用或计算器),并在回答问题之前利用这些工具来收集信息。长期以来,只有最强大且最昂贵的计算机模型才被信任执行这些任务。它们被构建了一种特定的、僵化的内部语言来与这些工具进行通信,这种方法被称为“原生函数调用”(native function calling)。然而,随着技术的成熟,研究人员开始关注更小、更高效的计算机模型。这些紧凑型模型更容易在智能手机和笔记本电脑等日常设备上运行,提供了更好的隐私保护和更低的成本,但历史上,它们在正确使用外部工具所需的严格、复杂的规则方面表现挣扎。

来自伊朗大学的一个研究小组挑战了这样一个假设:即这些较小的模型必须遵循与大型模型相同的僵化规则才能取得成功。在他们最近的工作中,他们发现,如果要求小模型通过简单的对话而非通过专门的技术指令结构来使用工具,它们的表现实际上会好得多。他们发现,当一个小模型被视为一个遵循清晰自然语言指令的得力助手时,它比被迫使用特定机器代码时犯错要少得多。这一洞察促使他们创建了一个将工作拆分给两个不同模型的新系统。一个小型、快速的模型充当决策者,倾听用户并判断是否需要使用工具。如果需要使用工具,这个小模型会使用自然语言指令来处理请求。随后,主要的、较大的模型会获取该信息并为用户制定最终答案。

研究人员使用各种小型模型测试了这种方法,其中一些模型的参数量仅为10亿(这是衡量模型规模和复杂性的指标)。他们将这种新方法与通常教导这些模型使用工具的标准方式进行了比较。结果令人震惊。他们命名为“指令遵循型函数调用”(Instruction-Followed Function Calling)的新系统,使得较大的紧凑型模型(如40亿参数的Qwen-3)能够超越像GPT-5.2和Claude 4.5 Sonnet这样通常被视为黄金标准的庞大专有基准模型。例如,使用他们这种新方法的Qwen-3 4B模型在一个困难的工具使用测试的非实时(Non-Live)评估子集上达到了94.1%的准确率,显著超过了使用传统方法的同类模型。虽然测试的最小模型(0.6B)在某些类别中仍落后于那些极其庞大的专有巨头,但该框架证明了,只要移除了刚性工具定义的架构负担,专门化的、具备推理能力的轻量级模型可以达到甚至超过大规模系统的性能。

他们发现的一个关键点在于理解这些模型是如何思考的。研究人员发现,设计为在回答之前先对问题进行“思考”的模型,比那些直接生成即时响应的模型要可靠得多。当这些推理模型被赋予决定使用哪个工具的任务时,它们可以纠正自己的错误并高精度地遵循复杂指令。这在模型被压缩以在更小的设备上运行时尤其明显。通常情况下,使模型变小或在性能较低的硬件上运行会导致其性能大幅下降。然而,研究人员发现,他们的新方法具有极强的鲁棒性。即使当模型被缩减到使用极少内存时,使用自然语言指令方法的小模型仍保持了高准确率。这表明,推理和遵循对话的能力,比记忆一种僵化的技术格式,是更稳定的工具使用基础。

这项研究还强调了当前许多系统构建方式中的一个缺陷。通常,一个大型模型被要求承担所有职责:理解用户、决定使用哪个工具以及撰写最终答案。研究人员展示了这种方法往往会让模型感到困惑,因为工具的复杂细节会与对话混淆在一起。通过分离任务,他们的新系统保持了对话的纯净。小型模型负责处理确定使用哪个工具的繁重工作,而主模型则专注于与用户交流。这种分离防止了系统因同时接收过多信息而变得不堪重负。研究人员证明,这种方法即使在对速度和隐私要求极高的现实场景中(如汽车仪表盘或家用助手,在这些场景下无法将数据发送到远程服务器)也表现良好。

最终,这项工作为日常设备上的人工智能指明了一条新路径。它表明,我们不需要依赖于执行复杂任务的庞大、耗能的计算机。相反,通过改变我们要求小型模型工作的方式——将其视为遵循指令的智能助手而非执行代码的机器——我们可以实现既高准确又高效的结果。研究结果表明,个人化、私密化且响应迅速的人工智能之未来,可能不在于构建更大的模型,而在于以更聪明的方式去使用我们现有的较小模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →