← 最新の論文
💻 computer science

Predicting Performance of Symbolic and Prompt Programs with Examples

本論文は、検索された類似タスクとプロンプトプログラムを活用して近似事前分布を構築する性能予測フレームワーク「RAP」を提案し、シンボリックプログラムの「すべてか無か」の性質とLLMプロンプティングの拡散的な性能分布を区別することで、LLMプロンプティングの信頼性のなさを効果的に解決する。

原著者: Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

新入社員が大きな仕事をこなす準備ができているかどうかを判断する採用担当者を想像してください。あなたには2種類の候補者がいます。「ロボット」(Pythonコードのような記号プログラム)と**「クリエイティブなフリーランサー」**(AIにタスクを実行させるよう指示するプロンプトプログラム)です。

この論文が問いかけるのは、シンプルな疑問です:もし両方の候補者がいくつかの小さな練習テストに合格した場合、彼らを本番の仕事に任せても信頼できるでしょうか?

著者たちは答えます:ロボットについては「はい」ですが、フリーランサーについては「おそらくいいえ」です。 その理由を、論文独自の論理とアナロジーを用いて説明します。

1. 2種類の「プログラム」

  • ロボット(記号プログラム): これは厳格な電卓のようなものです。「2 + 2」と指示すれば、必ず「4」と答えます。厳格なルールに従います。テストに合格したなら、それはルールを完璧に守ったからです。
  • フリーランサー(プロンプトプログラム): これは、少し予測不能な賢い芸術家に「猫を描いて」と頼むようなものです。あなたは芸術家にプロンプト(指示)を与えます。芸術家は素晴らしい猫を描くかもしれませんが、奇妙な猫を描くかもしれませんし、犬を描くかもしれません。たとえいくつかの練習テストに合格したとしても、それは単に運が良かっただけか、あるいは指示が現実世界には少し合っていないだけかもしれません。

2. 「コイン投げ」モデル

著者たちは、プログラムがテストを実行するたびに、それはコインを投げるようなものだと想像します。

  • 表: プログラムが正解する。
  • 裏: プログラムが誤る。

目標は、そのコインがどの程度「偏っている」かを推測することです。公平なコイン(50/50)でしょうか?それとも常に表が出るトリックコイン(100% 成功)でしょうか?

3. 大きな発見:過去の「形状」

テスト結果を見る以前に、著者たちは数千ものこれらのプログラムの歴史を調べ、その「コインの偏り」が通常どのような形をしているかを確認しました。彼らは2つの非常に異なる形状を見つけました。

  • ロボットの歴史(全か無か):
    すべてのロボットプログラムのヒストグラムを想像してください。それは両端に2つの高いピークがあるように見えます。

    • ピーク1: ほとんどのロボットは完璧です(100% 成功)。
    • ピーク2: ほとんどのロボットは破損しています(0% 成功)。
    • 中間: ほとんど何もありません。ロボットは「まあまあ」なことはめったにありません。完璧か、完全に失敗かのどちらかです。
    • アナロジー: それは電気のスイッチのようです。ON か OFF のどちらかです。
  • フリーランサーの歴史(拡散した雲):
    すべてのフリーランサープログラムのヒストグラムを想像してください。それは中央に広がる、平らな雲のように見えます。

    • 「ほぼ正解」のプログラム(70%、80%、90%)が多数あります。
    • 完璧なものは非常に少なく、完全な失敗も非常に少ないです。
    • アナロジー: それは調光スイッチのようです。ほとんどのフリーランサーは中間 somewhere にあり、明るさが異なります。

4. なぜ数回のテストがあなたを欺くのか

この違いが、なぜ数回の合格テストがフリーランサーにとっては誤解を招く一方で、ロボットにとっては安心材料となるのかを説明します。

  • ロボットの場合: 3回のテストに合格するのを見れば、それは「完璧」なピークのいずれかである可能性が高いとわかります。「中間地帯」(単にまあまあである可能性)が存在しないため、数回のテストに合格することは、それが今後も機能し続けるという強力な保証となります。
  • フリーランサーの場合: 3回のテストに合格しても、それは単に「ほぼ正解」のプログラムの一つで、運が良かっただけかもしれません。「ほぼ正解」のプログラムの巨大な雲が存在するため、数回のテストに合格しても、それが後で完璧になることを証明するものではありません。次のテストでは簡単に失敗する可能性があります。

5. 解決策:RAP(「類似検索」ツール)

フリーランサーについては数回のテストを信頼できないため、著者たちはRAP(Retrieved Approximate Prior:取得近似事前分布)と呼ばれるツールを構築しました。

RAP を賢い図書館司書だと考えてください。

  1. 問題: あなたには新しいフリーランサー用プロンプトと、いくつかのテスト結果があります。それが良いものかどうかはわかりません。
  2. 図書館: RAP には、過去に試された他のプロンプトやタスクの膨大な図書館があります。
  3. 検索: RAP はあなたの新しいプロンプトを見て、「図書館の中で誰があなたに最も似ているか?」と尋ねます。それは類似した問題を解決した他のプロンプトを見つけ出します。
  4. 予測: 一般的なルールに基づいて推測するのではなく、RAP はそれらの類似したプロンプトが過去にどのようにパフォーマンスを発揮したかを見ています。それはあなたのプロンプトに特化したカスタム「推測マップ」(事前分布)を作成します。
  5. 更新: より多くのテストを実行するにつれて、RAP はその推測を更新します。

結果: RAP は、単に推測したり、一度に図書館全体を見たりするよりも、フリーランサーが成功するかどうかを予測する能力がはるかに優れています。それはあなたが行っている特定の種類のタスクに適応します。

まとめ

  • ロボット(コード) は二元的です:彼らは完璧か破損かのどちらかです。数回のテストは、彼らが完璧であることを証明します。
  • フリーランサー(プロンプト) は可変的です:彼らはしばしば「ほぼ良い」状態にあります。数回のテストは、彼らが信頼できることを証明しません。
  • RAP は、単に数回の幸運なテスト実行に頼るのではなく、新しいプロンプトがどの程度機能するかについてより賢い推測を行うために、過去の類似例を調べることでこれを修正します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →