← 最新の論文
🤖 AI

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

本論文は、指示への真の遵守と偶然の一致を「Against-Prior Accuracy (AP-Acc)」と呼ばれる新たな指標を用いて区別することにより、多様な表面においてコーディングエージェントの真の指示遂行能力を評価する新しいベンチマークであるHarness-IFを導入し、既存のベンチマークが性能を過大評価していること、およびルールの優先順位がプロンプトの深さに厳密に従うわけではないことを明らかにしている。

原著者: Zining Huang, Haoran Que, Hong Zeng, Ge Zhang, Zuo Wang, Jin Chen, Haodong Wang, Zhongfei Hou, Changxin Pu, Shen Yan, Wenhao Huang

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Zining Huang, Haoran Que, Hong Zeng, Ge Zhang, Zuo Wang, Jin Chen, Haodong Wang, Zhongfei Hou, Changxin Pu, Shen Yan, Wenhao Huang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットシェフに複雑な料理を作る方法を教えているところだと想像してください。最後にただ「パスタを作れ!」と一つの命令を叫ぶだけではありません。あなたは、一連の指示の積み重ねを持っています。壁にあるルールブック(システムプロンプト)、レシピカードのメモ(プロジェクトファイル)、ナイフの使い方の説明(ツールの説明)、そして最後に、あなたからの具体的なリクエスト(ユーザー指示)です。長い間、AIシェフをテストしていた科学者たちは、たった一つのこと、つまり「シェフはパスタを出したか?」ということだけを気にしていました。もし皿が美味しそうであれば、彼らは金メダルを与えていました。しかし、彼らはシェフが実際にどの指示に従ったのかまではチェックしていませんでした。もしかすると、シェフは「ニンニク抜き」というルールブックを無視したのかもしれません。なぜなら、彼らがたまたまニンニクなしのパスタを好んでいたからです。これが、私たちが探求している人工知能のトリッキーな領域である「指示への追従性(Instruction Following)」です。それは単に正しい答えを得ることではなく、たとえそのルールがロボットが自然に行うであろうことと相反する場合でも、ロボットがあなたが与えた特定のルールに従ったことを証明することなのです。

「Harness-IF」と題されたこの論文は、AIシェフのための探偵事務所のようなものです。研究者たちは、既存のテストは最終的な料理しか見ていなかったため、簡単すぎると気づきました。彼らは、ロボットが実際にルールを守っているのか、それとも単に運が良かっただけなのかを知りたいと考えました。そこで、彼らは「Harness-IF」と呼ばれる、より詳細で高度な新しいテストを構築しました。単に「パスタを作りましたか?」と尋ねるのではなく、AIが256個の異なる細かいルールに従わなければならない、60の現実的なコーディングシナリオを設定しました。これらのルールは、ロボットの「脳」の異なる場所に隠されていました。あるものはシステムプロンプトに、あるものはプロジェクトファイルに、あるものはツールの説明に、そしてあるものはユーザーの直接のチャットにありました。

ここで、探偵たちが発見した大きな驚きがあります。AIモデルは、自分が本来行うであろうことと一致するルールに従うことは得意ですが、自分の自然な習慣に反するルールに従うことは苦手であるということです。 研究者たちはこれを「アゲインスト・プライア(Against-Prior)」テストと呼んでいます。ルールがAIに、デフォルトの振る舞いとは異なることを強制した場合、AIの成功率は著しく低下することが分かりました。平均して、モデルは自身の性質に反するルールに従う際、成功率が5.8パーセントポイント低下しました。それは、数学が大好きな生徒が数学のテストでAを取るけれど、嫌いな解法を使って問題を解くように言われるとCを取ってしまうようなものです。この論文は、もし私たちが最終的な成績(タスクの成功)だけを見ているとしたら、その生徒が数学の天才であると錯覚させられているのかもしれません。実際には、単に天性の才能に甘んじているだけかもしれないのです。

この研究では、ルールが「どこに配置されているか」についても調査しました。会議で最後に発言した人が勝つように、最後に言われたルール(ユーザー指示)が最も重要であると考えるかもしれません。しかし、データは異なることを示しました。システムプロンプト、プロジェクトファイル、およびユーザー指示に見られるルールはすべて、重要度においてトップの座を分け合っていました。一方で、ツールの説明やスキルの説明に埋もれたルールは、しばしば無視されていました。AIは、特定のツールの使い方の詳細よりも、「全体像」に関するルールに注意を払うことが分かりました。

要約すると、この論文は完璧なAIを作る問題を解決したと主張しているわけではありません。むしろ、AIが実際にどれだけ耳を傾けているかを測定するための、より優れた「定規」を私たちに提供してくれるものです。現在のAIモデルは、自分がやりたいことを行うのは得意ですが、自然には選ばないことを求められると、依然として苦戦することを明らかにしています。「幸運による遵守」と「真の服従」を切り離すことで、研究者たちは、単に成功しているように見えるだけでなく、より信頼できるAIヘルパーを作るための、より良いテストを構築したいと考えています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →