Small Reasoning Models are Instruction Followers in Function Calling
本論文は、指示に従う機能を持つ小規模なモデルにファンクションコーリングのロジックを委譲することで、ネイティブな手法やプロンプトベースの手法と比較して、特に推論指向のLLMにおいて量子化下での優れた精度と堅牢性を実現するフレームワークであるInstruction-Followed Function Calling (IFFC) を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能が急速に進化する世界において、単にテキストを生成するだけのコンピュータから、行動を起こすことが可能なシステムへと転換が起こっています。これらの新しいシステムは、しばしば「エージェンティック(agentic)」モデルと呼ばれ、外部の世界に働きかけることで問題を解決するように設計されています。これらは、天気のアプリや計算機といったツールを選択し、それらを使用して情報を収集してから質問に答えます。長い間、最も強力で高価なコンピュータモデルだけが、これらのタスクを実行できるものとして信頼されてきました。それらは、ツールと通信するために「ネイティブ・ファンクション・コーリング(native function calling)」として知られる、特定の硬直した内部言語を用いて構築されていました。しかし、技術が成熟するにつれ、研究者たちはより小さく、より効率的なコンピュータモデルに注目し始めています。これらのコンパクトなモデルは、スマートフォンやノートパソコンのような日常的なデバイスで実行しやすく、プライバシー保護やコスト削減の面で優れていますが、外部ツールを正しく使用するために必要な厳格で複雑なルールに従うことには、歴史的に苦戦してきました。
イランの大学の研究チームは、これらの小さなモデルが成功するためには、巨大なモデルと同じ硬直したルールに従わなければならないという仮定に異を唱えました。彼らの最近の研究では、小さなモデルは、専門的なテクニカルなコマンド構造を通じてツールを使用するように求められるよりも、単純な会話を通じてツールを使用するように求められた方が、実際にははるかに高いパフォーマンスを発揮することが発見されました。彼らは、小さなモデルを、平易な言葉による明確な指示に従う「助けになるアシスタント」として扱うと、機械コードとしての特定の形式を強制する場合よりもミスが大幅に少なくなることを発見しました。この洞察により、彼らは作業を2つの異なるモデル間で分割する新しいシステムを生み出しました。一つの小さく高速なモデルが意思決定者として機能し、ユーザーの声を聞き、ツールが必要かどうかを判断します。ツールが必要な場合、この小さなモデルは自然言語の指示を用いてリクエストを処理します。そして、メインとなるより大きなモデルがその情報を受け取り、ユーザーに対する最終的な回答を策定します。
研究者たちは、モデルのサイズと複雑さの尺度である「パラメータ数」がわずか10億個しかないものを含む、さまざまな小型モデルを用いてこのアプローチをテストしました。彼らは、彼らの新しい手法を、通常これらのモデルがツールを使用するように教えられる標準的な方法と比較しました。結果は驚くべきものでした。「Instruction-Followed Function Calling(指示に従うファンクション・コーリング)」と名付けられた彼らの新システムにより、より大きなコンパクトモデル(例えば40億パラメータのQwen-3など)が、通常ゴールドスタンダードと見なされているGPT-5.2やClaude 4.5 Sonnetのような大規模なプロプライエタリ・モデルを凌駕することができました。例えば、彼らの新手法を用いたQwen-3 4Bモデルは、困難なツール使用テストの非ライブ評価サブセットにおいて94.1%の精度を達成し、従来のメソッドを用いた同じモデルの性能を大幅に上回りました。テストされた最小のモデル(0.6B)は、特定のカテゴリーにおいて非常に大規模なプロプライエタリの巨人に依然として及びませんでしたが、このフレームワークは、硬直したツールの定義という建築的な負担を取り除けば、特化した推論能力を持つ小型モデルが大規模なシステムに匹ると、あるいはそれを超えることができることを実証しました。
彼らの発見の鍵は、これらのモデルがどのように「考える」のかを理解することにありました。研究者たちは、回答する前に問題について「考える」ように設計されたモデルは、即座に回答を生成するモデルよりもはるかに信頼性が高いことを発見しました。これらの推論モデルにどのツールを使うかを決定するタスクを与えると、彼らは自らの間違いを修正し、複雑な指示に高い精度で従うことができました。これは、モデルを圧縮してより小さなデバイスで動作させる場合に特に顕著でした。通常、モデルを小さくしたり、より低性能なハードウェアで実行したりすると、パフォーマンスは急激に低下します。しかし、研究者たちは、彼らの新しい手法が非常に堅牢であることを発見しました。モデルをメモリ消費が非常に少ないレベルまで縮小した場合でも、自然言語の指示メソッドを使用したモデルは高い精度を維持していました。これは、推論し会話に従う能力が、硬直したテクニカルなフォーマットを記憶することよりも、ツール使用のための安定した基盤であることを示唆しています。
また、この研究は現在の多くのシステムが構築されている方法における欠陥も浮き彫りにしました。多くの場合、単一の大きなモデルに対して、ユーザーを理解し、どのツールを使うかを決定し、最終的な回答を書くというすべてを行うよう求められます。研究者たちは、このアプローチがモデルを混乱させやすいことを示しました。なぜなら、ツールの複雑な詳細が会話と混ざり合ってしまうからです。作業を分離することで、彼らの新しいシステムは会話をクリーンに保ちます。小さなモデルがどのツールを使うかを判断するという重労働を担い、メインのモデルはユーザーとの会話だけに集中します。この分離により、システムが一度に多すぎる情報によって圧倒されるのを防ぎます。研究者たちは、この手法が、データの遠く離れたサーバーへの送信が選択肢に入らない、車のダッシュボードやホームアシスタントのような、スピードとプライバシーが極めて重要な現実世界のシナリオにおいても有効であることを実証しました。
結局のところ、この研究は、日常的なデバイスにおける人工知能への新しい道を提示しています。それは、複雑なタスクを実行するために、巨大でエネルギーを大量に消費するコンピュータに頼る必要はないということを示しています。代わりに、小さなモデルへの頼み方を変えること――つまり、コードを実行する機械としてではなく、指示に従う知的なアシスタントとして扱うこと――によって、非常に正確かつ効率的な結果を得ることができるのです。この知見は、パーソナルでプライベート、かつレスポンシブな人工知能の未来が、より大きなモデルを構築することにあるのではなく、私たちがすでに持っているより小さなモデルをより賢い方法で使用することにある可能性を示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。