← 最新の論文
💻 computer science

Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail

本論文は、小規模言語モデルのエージェントにおいて、失敗がトランスクリプト内に逐語的に記録されている場合、失敗したツール呼び出しを繰り返す可能性が著しく高くなることを明らかにしており、この逆効果はエラーメッセージそのものではなく主に失敗したアクションの表面的な形式によって引き起こされるが、生の呼び出しをランタイム生成された失敗の説明に置き換えることで効果的に軽減できる。

原著者: Esmail Gumaan

公開日 2026-08-26
📖 1 分で読めます☕ さくっと読める

原著者: Esmail Gumaan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタルアシスタントが、連絡先の検索やカレンダーの確認、あるいはコードの記述といったツールを使用して問題を解決できる場面を想像してみてください。これを行うために、アシスタントは単純なループに従います。まずアクションを考え、それを実行しようとし、そしてその結果を読み取ります。もしアクションが失敗した場合、システムはアシスタントが何を試みたのかと、受け取ったエラーメッセージを正確に記録し、アシスタントに再試行を求めます。この手法は「エージェント・ループ」として知られており、これらのシステムが失敗から学ぶための標準的な方法です。論理的には妥当に見えます。もし人に対して「鍵がかかったドアを開けようとしたけれど、うまくいかなかった」と言えば、その人は同じ鍵のかかったドアを二度と開けようとはしないでしょう。彼らは別の鍵を探すか、別のドアを探すはずです。長年、エンジニアたちは、こうしたアシスタントを動かしている多くの小型コンピュータモデルも同様の挙動を示すと考えてきました。エラーメッセージを見せることで、モデルはその特定のミスを避けるように学習できると信じていたのです。

ドイツのパッサウ大学のある研究者は、極めて精密な方法でこの仮説を検証することにしました。彼らは単にアシスタントの失敗と成功を観察しただけではありません。エラーを見た前と後で、モデルが同じ誤ったアクションを選択する数学的な確率を正確に測定しました。彼らは、非常に小さなものから中程度のサイズまで、6つの異なる小型コンピュータモデルを用いて、2つの異なる環境でテストを行いました。一つはシミュレートされたオフィスツールを使おうとする環境、もう一つは壊れたコンピュータプログラムを修正しようとする環境です。研究者は、エラーメッセージが実際にモデルの行動を修正するのかどうかを知りたかったのです。

判明したのは、誰もが予想していたものとは正反対の結果でした。失敗から学ぶどころか、モデルは同じ間違いを繰り返す確率が著しく高まったのです。システムが失敗した試行とエラーメッセージをモデルに示したとき、モデルが同じ誤ったアクションを再び選択する内部確率が劇的に跳ね上がりました。ツール呼び出しのテストでは、失敗した呼び出しを繰り返す確率は、わずか6パーセントという低い数値から50パーセント以上に上昇しました。研究者がテストしたほぼすべてのケースにおいて、エラーメッセージは警告として機能するのではなく、むしろ磁石のように作用し、モデルを直前に失敗したまさにそのアクションへと引き戻したのです。

研究者はなぜこのようなことが起きるのかを問いかけました。彼らは、モデルがエラーメッセージを理解するには単純に小さすぎるのではないかと疑いました。しかし、調査の結果、原因はエラーの意味ではなく、テキストの存在そのものにあることが判明しました。失敗したアクションが記録に書き込まれると、モデルの内部機構(それは目にするパターンをコピーするように設計されています)が、その失敗したアクションのテキストに強く執着してしまうことが分かったのです。このコピー効果があまりにも強力であったため、失敗に関する実際の内容を圧倒してしまいました。たとえ研究者が、詳細なエラーメッセージを「これは失敗しました」という単純な記述に置き換えたとしても、モデルは依然として間違いを繰り返しました。しかし、失敗したアクションのテキスト自体を完全に削除し、代わりに何が間違っていたかの説明に置き換えると、モデルは間違いを繰り返さなくなりました。

この発見は、これらのシステムが構築される標準的な方法を覆しました。行き詰まったエージェントを修正するための一般的なアドバイスは、履歴から失敗した試行を削除し、モデルにまっさらな状態からやり直させて、「汚染」を取り除くことでした。しかし、研究者はこれが実は最悪の策であることを発見しました。失敗を削除することで、システムは間違いを引き起こしたのと全く同じ条件を復元してしまい、モデルが同じエラーを繰り返すことを保証してしまったのです。彼らが発見した解決策は、履歴を削除することではなく、履歴を「変える」ことでした。失敗の記録は保持しつつ、失敗したコマンドの生のテキストをシステムが生成した記述に置き換えれば、繰り返しの連鎖は止まるのです。

研究は、より明白な解決策についてもテストを行いました。それは、指示の中でモデルに対し、失敗したアクションを繰り返さないよう単純に伝えることです。これは人間にとっては論理的に聞こえるアプローチですが、目の前にある特定の文字列を無視せよというルールを、モデルが容易に守ることはほとんどできませんでした。研究者は、問題はモデルの知能の欠如ではなく、情報の提示方法の欠陥であると結論付けました。失敗したアクションをエラーメッセージと共に示すという標準的な手法は、強力な「コピーしたい」という衝動を生み出し、それが間違いから学ぶという衝動よりも強くなってしまうのです。

専用のグラフィックスカードを使用しない標準的なコンピュータプロセッサ上で実験を行うことで、研究者は、この挙動が大規模な計算能力を必要とする不具合ではなく、これらの小型モデルの仕組みにおける根本的な特性であることを証明しました。彼らの研究は、信頼できるデジタルアシスタントを構築するためには、エンジニアは失敗したアクションを「読むべき役立つ教訓」として扱うのではなく、「隠すべき危険なパターン」として扱う必要があることを示唆しています。解決策は構造的なものです。失敗後のコンテキストは、失敗前のコンテキストとは異なっている必要がありますが、その違いは失敗したアクションそのものであってはなりません。失敗の生のテキストを取り除き、診断結果のみを保持することで、システムは繰り返しのサイクルを断ち切り、モデルが実際に前進することを可能にするのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →