← 最新の論文
🤖 machine learning

PPDL: LLM-Based Flows as Probabilistic Programs

本論文は、LLMベースのアプリケーションフロー全体にわたって不確実性を定量化および伝播することを可能にし、コアロジックを変更することなく推論スケーリング技術の実験を可能にする確率的プログラミング言語であるPPDLを紹介するものであり、これはRocq証明器のための定理証明エージェントを通じて実証されている。

原著者: Louis Mandel, Guillaume Baudart, Mandana Vaziri, Martin Hirzel

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Louis Mandel, Guillaume Baudart, Mandana Vaziri, Martin Hirzel

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、とても難しいパズルを解こうとしているところだと想像してください。ただし、一人で解くのではなく、あなたと話ができる、とても賢くてクリエイティブな友達がいるとします。この友達は、大規模言語モデル(LLM)と呼ばれる人工知能です。彼らは物語を書いたり、数学の問題を解いたり、さらにはコンピュータのコードを書いたりすることにも長けています。しかし、彼らは完璧ではありません。時として、間違った答えに対して自信満々になったり、事実のように聞こえるけれど実際には存在しない事実をでっち上げたりすることがあります。これは「不確実性」と呼ばれます。

次に、多くのステップを必要とする「本当に難しい問題」を解かなければならない場面を想像してください。あなたはAIの友人に計画を立てるよう頼み、次にその計画に基づいてコードを書くよう頼み、次にそのコードをチェックするよう頼む……といった具合です。あなたが質問をするたびに、AIは答えを出しますが、その答えは少し不安定かもしれません。もし、これら10個の不安定な答えを連鎖させると、最終的な結果はめちゃくちゃになってしまう可能性があります。それは、まるで、一つ一つのブロックが少しずつグラグラしているジェンガの塔を積み上げるようなものです。高く積み上げれば積み上げるほど、崩れてしまう可能性が高まります。開発者やユーザーは、ここで途方に暮れてしまいます。「この答えは正しいのだろうか? どれくらい確かなのだろうか? 信じてもいいのだろうか?」

これを解決するために、科学者たちはいくつかのトリックを試してきました。一つの人気のあるアイデアは「推論スケーリング(inference scaling)」です。これは、AIの友人に同じパズルを10回別々に挑戦させ、最も多く出てきた答えを確認するようなものです。これは、グループの友人たちに謎解きの答えを予想させ、多数決で決めるようなものです。しかし、ここには落とし穴があります。これを手動で行うのは非常に面倒です。10回の試行を実行し、どの結果が良さそうかを追跡し、悪いものを捨てるための特別なコンピュータコードを書かなければなりません。それは、クッキーの焼き加減を確認するために、バッチを作るたびに新しい工場を建設しなければならないようなものです。それは複雑で、コストがかかり、別の方法で焼きたいと思ったときに変更するのが困難です。

論文の核心となるアイデア:「魔法のスコアカード」

この論文では、PPDL(Probabilistic Prompt Declaration Language:確率的プロンプト宣言言語)と呼ばれる新しいツールを紹介しています。PPDLは、AIワークフローのための特別な「魔法のスコアカード」だと考えてください。単にAIに質問して一つの答えを得るのではなく、PPDLを使えば、AIが不確実である可能性を自然に理解するプログラムを書くことができます。

その仕組みは、平易な言葉で言えば以下の通りです:

  1. フロー(流れ): 通常通り、AIへの指示を書きます(例:「コードの計画を立てる」、次に「コードを書く」、次に「コードをチェックする」)。
  2. 魔法の要素: factor(ファクター)と呼ばれる特別な指示を追加します。これはスコアカードのようなもので、「もし計画が論理的であれば高いスコアを与え、もしコードにエラーがあれば低いスコグを与えてください」とAIに伝えるものです。
  3. 結果: プログラムを実行すると、コンピュータは単に一つの答えを出すだけではありません。プロセス全体を並列で何度も実行します(まるで、100通りの異なるバージョンのあなたが同時にパズルに挑戦しているような状態です)。そして、あなたの「スコアカード」を使って結果を重み付けします。もし一つの経路が非常に有望に見えるなら、コンピュータはその経路により多くのエネルギーを集中させます。もし一つの経路が悪そうであれば、それを切り捨てます。

最も素晴らしい点は、複雑な「10回実行する」ためのコードを自分で書く必要がないことです。PPDLがバックグラウンドですべての重労働を処理してくれます。あなたはロジックを一度書くだけで、システムがすべての可能性を探索する最善の方法を自動的に判断します。

研究の結果

著者らは、算数の学年レベルの問題の解決から、複雑なコンピュータコードの記述、さらには数学の定理の証明に至るまで、いくつかの課題を用いてこのアイデアをテストしました。

  • 精度の向上: テストにおいて、PPDLとこれらの「スコアカード」を使用することで、AIの精度が大幅に向上しました。例えば、GSM8kと呼ばれる算数のテストでは、標準的なAIは約83.8%の正解率でした。しかし、PPDLと「インポータンス・サンプリング(重要度サンプリング)」(これは、より良い推測を選ぶためのスマートな方法です)を組み合わせたところ、正解率は93.7%に跳ね上がりました。
  • 「スマートな方法」の勝利: 彼らは、スコアカードの使い方の違いを比較しました。時には、単なる「多数決」(最も一般的な答え)がうまくいくこともありました。しかし、多くの場合、よりスマートな方法(インポータンス・サンプリングや逐次モンテカルロ法など)の方がはるかに優れていました。これらの方法は、単に票を数えるだけでなく、なぜある答えが良いのか、あるいは悪いのかを実際に調査し、悪い経路を早期に破棄して良い経路に集中する探偵のようなものです。
  • 定理証明器のケーススタディ: システムを徹底的にテストするために、彼らはRocqというツールを使用して数学の定理を証明するAIエージェントを構築しました。これは、AIが証明を書き、それが間違っていないかチェックし、繰り返し修正を行うという、非常に難しいタスクです。彼らは、「スマートな方法」(逐次モンテカルロ法)が、単にランダムな推測を繰り返すよりも、正しい証明を見つける上ではるかに優れていることを発見しました。この方法は、多くの異なる経路を同時に探索し、行き詰まった経路を迅速に放棄することができました。

主張していないこと

著者らは、これがすべてを解決する「魔法の杖」であるとは主張していません。彼らは、「スコアカード」(ファクター)は、入力される情報の質に依存するという点を指摘しています。もしスコアカードが不適切なものであれば、システムが魔法のように修正してくれることはありません。また、この手法によってAIの信頼性は高まりますが、AIが突然完璧になるという意味ではありません。単に、私たちが答えに対してどれほど確信を持てるかを測定するための、より優れた方法を手に入れたということです。

なぜこれが重要なのか

この論文は、AIのワークフローを「確率的プログラム」(不確実性を理解するプログラム)として扱うことで、非常に複雑な構築を行うことなく、AIアプリケーションをより信頼できるものにできることを示唆しています。これは、開発者に「何度もやり直す」という面倒な処理を自動的に処理する新しいツールセットを提供することで、開発者が最高の答えを見つける方法をコンピュータに任せながら、面白いものを作ることに集中できるようにするようなものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →