Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents
本論文は、自由形式のマークダウン形式のスキルライブラリを、決定論的検証を備えた型付き疑似コードに変換する自動手法「Skill-as-Pseudocode(SaP)」を提案し、明確な型付きシグネチャと具体的な呼び出しテンプレートを提供することで、ALFWorldベンチマークにおいて LLM エージェントの成功率を大幅に向上させ、トークン使用量を削減することを可能にする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢いけれど文字通りしか理解できないロボットに、家の掃除やキッチンの整理といった家事を教える状況を想像してください。あなたはロボットに、通常の英語(Markdown)で書かれた巨大で散らかった取扱説明書を与えます。
問題点:「混乱したループ」
ロボットが何かをするたびに、長い文章を読み通して以下の 2 点を特定しなければなりません。
- 何をするのか(例:「マグカップを移動させる」)。
- 家のコンピューターシステムに正確にどう伝えるか(例:システムは「マグカップを棚に置く」という命令ではなく、「マグカップを棚に移動させる」という命令のみを受け付ける)。
指示が段落の中に埋もれているため、ロボットは間違った推測をすることがよくあります。ロボットが「マグカップを置く」ことを試みると、家から「何も起こらない」と返答され、ロボットは混乱します。その後、ロボットは再び説明書を読み返し、また間違った推測をし、失敗のループに陥ってしまいます。これは時間を浪費し、ロボットがエネルギー(AI 用語では「トークン」)を使い果たす原因となります。
解決策:「スキルとしての疑似コード(SaP)」
この論文の著者たちは、**スキルとしての疑似コード(SaP)**と呼ばれるシステムを開発しました。これは、散らかった人間のマニュアルを取り、ロボット用のクリーンで構造化されたチートシートに書き換える「翻訳機」と考えてください。
この翻訳機がどのように機能するか、簡単な比喩を使って説明します。
1. 探偵(パターンの発見)
何百もの異なる取扱説明書を読み漁る図書館司書を想像してください。彼らは、多くのマニュアルが異なる表現で同じことを述べていることに気づきます。
- マニュアル A はこう言っています:「キッチンに行き、塩を取り出し、キャビネットに入れてください。」
- マニュアル B はこう言っています:「カウンターの塩を見つけ、食器棚へ移動させてください。」
図書館司書は、これらが実際には同じ根本的な動作であると気づきます。彼らはこれらの類似した指示を「クラスター」としてグループ化します。
2. 建築家(設計図の草案作成)
類似した指示の各グループに対して、システムは AI に**型付き契約(Typed Contract)**の草案作成を依頼します。
- 段落の代わりに、この契約はコンピューター関数のように見えます:
move_object(from: "counter", to: "cabinet")。 - 明確にリストアップされます:必要な入力は何ですか?その後何が起こりますか?ルールは何ですか?
3. 安全検査官(4 つのチェック)
システムがロボットにこの新しい設計図を使用させる前に、厳格な安全検査官が、翻訳が完璧であることを確認するために 4 つの特定のチェックを実行します。
- 網羅性(Coverage): 元のテキストから重要な詳細を見落としていませんか?
- 結合(Binding): 元の文から「塩」や「マグカップ」を正確にどこから取得するかを知っていますか?
- 置換(Replacement): 古い段落をこの新しい設計図に置き換えた場合、マニュアルの残りの部分は依然として意味をなしますか?
- リスク(Risk): この新しい指示は、ロボットに危険なことを(例えばファイルを削除したり窓を割ったりする)誤って指示していませんか?
設計図がすべての 4 つのチェックを合格すれば承認されます。1 つでも不合格であれば、ロボットが混乱するのを防ぐために廃棄されます。
4. 配送(「バンドル」)
ロボットがタスクを実行する必要があるとき、古い散らかったマニュアルを受け取るのではなく、完璧な順序で提示される 3 つの部分からなるバンドルを受け取ります。
- 「やり方」テンプレート: ロボットが家のコンピューターに入力しなければならない正確な言葉(例:
{object} を {target} に移動させる)。 - 「何」の署名: そのスキルが何を行うかの明確な要約。
- コンテキスト: 新しいテンプレートと矛盾しないように整理された、残りの指示。
結果
研究者たちは、AI エージェントが家事の謎解きを行うゲームALFWorldでこれをテストしました。
- 古い方法(スキル・グラフ): ロボットは散らかったマニュアルを読み、間違った推測をし、ループに陥り、頻繁に失敗しました。
- 新しい方法(SaP): ロボットはクリーンな「チートシート」を受け取りました。何をすべきか、それをどう伝えるべきかを即座に知っていました。
結果:
- ロボットは、新しい方法では 134 ゲーム中82 ゲームを解決しましたが、古い方法ではわずか47 ゲームでした。
- また、行き詰まった際にマニュアルを何度も読み直す必要がなかったため、メモリ使用量が 22% 削減され、AI ブレーンへの呼び出し回数が14% 減少しました。
要約:
この論文は、AI エージェントに長く散らかった段落を与えるのをやめ、代わりに構造化され検証済みの「コードのような」指示を与えることで、彼らが混乱しなくなり、ミスを減らし、はるかに迅速に仕事を完了できるようになることを示しています。このシステムは、人間の散文をロボット用の設計図に変える厳格な編集者のように機能します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。