Context Engineering for AI Agents in Open-Source Software
本論文は、AGENTS.mdファイルの採用、コンテンツ構造、および進化を調査するために466のオープンソースプロジェクトを対象とした予備研究を提示するものであり、開発者がAIエージェントにコンテキストを提供する手法における著しい差異を明らかにし、生成されるコードの品質を向上させるためのコンテキストエンジニアリングの最適化に関する将来の研究の可能性を強調している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、複雑な機械を組み立てるために、非常に優秀で仕事の早い新しいインターンを雇おうとしています。このインターンはAIエージェントです。もしあなたが単に「エンジンを直して」と言うだけだと、彼らはあなたの特定のルールや、好みのツール、あるいはチームが普段どのように動いているかを知らないため、間違った判断をしてしまうかもしれません。
この論文は、人間ではなく「ロボット」のために特別に書かれた「ユーザーマニュアル」を、そのインターンに与える新しい方法についての研究です。
以下に、この研究の内容を分かりやすく解説します。
問題点:インターンにはハンドブックが必要である
かつて、ソフトウェア開発者はコードを書くのを助けるためにGitHub Copilotのようなツールを使用してきました。現在では、バグを修正したり、機能全体を構築したりといった、より高度な作業を自律的にこなせる「AIエージェント」が登場しています。しかし、人間の従業員と同じように、AIも仕事をうまくこなすためには、会社の文化やルールを理解する必要があります。
ベンダー(AIを作っている企業)は、開発者がプロジェクトフォルダ内に特別なファイルを作成することを提案しました。このファイルを、**AIのためのデジタルな「従業員ハンドブック」**と考えてください。これによって、AIに次のようなことを伝えることができます。
- 「変数の命名規則は常にこの形式で行うこと」
- 「メインのファイルには直接触れないこと」
- 「コードのテスト方法は以下の通りであること」
最近では、すべてのAIツールが同じ種類のハンドブックを読み取れるよう、AGENTS.mdという標準的なフォーマットが作成されました。
研究内容:ハンドブックの調査
研究者たちは、実際のソフトウェアプロジェクトでこれらのハンドブックが実際に使われているのか、そして使われている場合、どのような内容になっているのかを調査しました。彼らは、1万件のオープンソース・ソフトウェア・プロジェクト(誰でも無料でコードを見たり利用したりできるプロジェクト)を対象に、デジタルな宝探しを行いました。
1. どれくらいの人が使っているのか?(普及度)
調査の結果、これらのAIハンドブックを作成していたプロジェクトは、わずか**466件(約5%)**でした。
- 比喩: これは、1万室ある巨大なオフィスビルの中を歩いて回り、ごく一部の部屋にだけ「新入社員へのルール」という看板が掲げられているのを見つけるようなものです。私たちはまだ、このトレンドの極めて初期段階にいます。
2. ハンドブックの中身はどうなっているのか?(内容とスタイル)
研究者たちは、見つかった155個のAGENTS.mdファイルを詳細に分析しました。そこで主に2つのことを発見しました。
標準的なレシピが存在しない: これらのファイルの書き方に「正解」となる唯一の方法はありません。短いものもあれば、長いものもあります。ルールを列挙しているものもあれば、仕組みを説明しているものもあります。
「声(トーン)」の違い: 開発者がAIに対して話しかける方法は多岐にわたります。研究者たちは、その文章スタイルを以下の5つのタイプに分類しました。
- 記述的 (Descriptive): 「これはこのように行われます」(事実を述べるだけ)
- 規範的 (Prescriptive): 「このように行いなさい」(直接的な命令を与える)
- 禁止的 (Prohibitive): 「これは絶対にしないでください」(境界線を設定する)
- 説明的 (Explanatory): 「〜なので、このように行います」(理由を添える)
- 条件的 (Conditional): 「もしXが起きたら、Yを行ってください」(状況に応じた論理を与える)
比喩: 155人の異なるマネージャーが、同じインターンのためにルールブックを書こうとしている場面を想像してください。あるマネージャーは「やってはいけないこと」の厳しいリストを書き、別のマネージャーはチームの働き方についての親しみやすい物語を書き、また別のマネージャーは複雑な「もし〜ならば」というフローチャートを作成しています。まだ統一性は存在しません。
3. ハンドブックは時間の経過とともに変化するのか?(進化)
研究者たちは、「コミット履歴(バージョン管理のログ)」を確認することで、これらのファイルが時間の経過とともにどのように変化したかを追跡しました。
- 安定性: ファイルの約半分は、最初に作成されてから一度も変更されませんでした。
- 微調整: 変更が行われたファイルについては、新しい指示を追加したり、既存の指示を微調整したりすることが最も一般的な更新内容でした。
- 比喩: マネージャーが一度ルールブックを書くと、そのまま放置されることが多いようです。しかし、更新を行う場合は、全体を書き直すのではなく、新しいルールを追加したり、古いルールを明確にしたりすることがほとんどです。
大きな教訓
この論文は、現在が**コンテキスト・エンジニアリング(文脈の設計)**における「ワイルド・ウエスト(無法地帯)」の段階であると結論付けています。開発者はAIエージェントへの話し方を実験していますが、まだ標準的な方法には至っていません。
研究者たちは、これらのファイルをユニークな「自然な実験場」であると考えています。これらのファイルは公開されており、バージョン管理されているため、人間がAIエージェントに対してどのように「言葉を学ぶか」をリアルタイムで観察することができるからです。目的は、現時点で開発者に何をすべきか指示することではなく、開発者がどのようにして現在その方法を見出そうとしているのかを理解し、将来的に彼らをより良く支援できるようにすることにあります。
要約すると: 開発者はAIヘルパーのためのルールブックを書き始めていますが、現時点ではすべてのルールブックが異なっており、どのスタイルが最適であるかはまだ誰も分かっていないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。