← 最新の論文
🤖 AI

Empirical Computation: Prompting versus Programming

本ビジョンペーパーは、大規模言語モデルが従来のプログラミングではなくプロンプティングを通じて計算問題を解決するという新しいパラダイムとして「経験的計算(empirical computation)」を提案し、その独自の能力と限界には、正当性や根本的な境界を分析するための新しい基礎理論および技術をソフトウェア工学コミュニティが開発することが必要であると主張するものである。

原著者: Eric Tang, Jing Liu, Marcel Böhme

公開日 2026-07-08
📖 1 分で読めます☕ さくっと読める

原著者: Eric Tang, Jing Liu, Marcel Böhme

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、仕事を成し遂げるための2つの方法を想像してみてください。それはプログラミングプロンプティングです。

旧来のやり方:プログラミング(厳格な建築家)

従来のプログラミングは、厳格でルールに忠実な建築家を雇うようなものだと考えてください。あなたは彼に、正確な寸法、特定の材料、そしてステップ・バイ・ステップの計画が含まれた設計図を与えます。

  • 仕組み: あなたはコンピュータに対し、数値のリストをソートする方法など、問題を解決するための「正確な手順」を伝えます。「この特定のアルゴリズム(マージソート)を使用し、これらの入力を取り込み、これらのルールに従え」と指示するのです。
  • 結果: もし建築家がミスをしたとしても、あなたは設計図の中のどのレンガが壊れているのかを特定でき、それを修正すれば、次回はその建物が正しく建つことを確信できます。
  • 限界: 構築にかかる時間は、数学的な複雑さに依存します。膨大なリストをソートする場合、かかる時間はリストのサイズに基づいて予測可能な一定の量になります(具体的には O(nlogn)O(n \log n) です)。

新しいやり方:プロンプティング(直感的な芸術家)

次に、あなたは天才的で直感的な芸術家を雇ったと想像してください。あなたは設計図を与えるのではなく、ただこう言います。「ねえ、ここにバラバラな数字の山があるんだけど、これを並べ替えておいてくれる?」

  • 仕組み: あなたは自然言語(プロンプト)を使って問題を説明します。「コンピュータ」(大規模言語モデル、またはLLM)は、厳格なルールに従うわけではありません。代わりに、インターネット上でこれまでに読んだあらゆる事柄に基づき、最も可能性の高い答えを「推測」します。それは、レシピに従うのではなく、スープを味見して材料を推測するシェフのようなものです。
  • 結果: 答えはすぐに返ってきますが、それは保証された正解ではなく、あくまで**「推測」**です。それは「最も可能性の高い」答えであって、「証明された正しい」答えではありません。

この論文が発見したこと: 「経験的」な驚き

著者たちは、この「直感的な芸術家」が、数値のソートやリスト内のアイテム検索といった古典的な数学の問題に対して、どの程度うまく機能するかを検証するために実験を行いました。そこで彼らが発見したことは以下の通りです。

1. 時間の仕組みが異なる

  • プログラミング: 数値をソートする対象の数を2倍にすると、かかる時間は数学的な法則に従って増加します。
  • プロンプティング: LLMが数値をソートするのにかかる時間は、リストが大きくなるにつれて線形的(単なる直線状)に増加します。なぜなら、数学が難しくなったからではなく、LLMが長いリストを扱うために、より多くの単語(トークン)を読み書きしなければならないからです。これは、物語が複雑になったからではなく、単に本が長くなったので読むのに時間がかかるのと似ています。

2. 規模が大きくなると精度が低下する

  • プログラミング: 正しいプログラムは、常に100%正確です。
  • プロンプティング: LLMは小さなタスクには非常に優れていますが、リストが大きくなると混乱が生じます。
    • 50個の数値のリストでは、LLMは約90%の確率で正解しました。
    • 150個の数値のリストでは、正解率はわずか58%にまで落ち込みました。
    • 短い文字列の中から特定のパターンを見つけ出すよう頼んだ場合、文字列が少し長くなるだけで失敗することがあります。
    • 「思考」モード: LLMが回答する前に「ステップ・バイ・ステップで考える(推論する)」ことが許されている場合、非常に高い精度を維持しますが、その分、時間は大幅に増えます。

3. 言語のゲーム

  • プログラミング: コードを英語で書いてもドイツ語で書いても、コンピュータは同じ記号として読み取ります。
  • プロンプティング: LLMは、インターネット上で読んできた内容による「偏り(バイアス)」を持っています。
    • 数字を英語の単語(one, two, three)でソートするよう頼むと、LLMは素晴らしい仕事を見せます。
    • しかし、ドイツ語(eins, zwei, drei)でソートするよう頼むと、ほぼ完全に失敗します。
    • なぜか? LLMはインターネット上で膨大な数の英語の例を見てきましたが、ドイツ語の例ははるかに少ないからです。これは、見たこともない料理を作ろうとするシェフに頼むようなものです。彼らは間違った推測をする可能性があります。

4. 「壊れたレンガ」の問題

  • プログラミング: プログラムが失敗した場合、バグを見つけてコードを修正すれば、問題は永遠に解決します。
  • プロンプティング: LLMが間違った答えを出した場合、簡単に「バグ」を見つけることはできません。修正すべき特定の行を指し示すことはできないのです。プロンプトを変えたり、「もっと深く考えて」と頼んだりすることもできますが、それが次回必ず成功するという保証はありません。それは、夢の内容を変えるために、夢を見ている人の気分を変えようとするようなものです。

大きな教訓

この論文は、私たちが**「経験的計算(Empirical Computation)」**と呼ばれる新しい時代に突入していると主張しています。

旧世界では、コンピュータが厳格なルールに従うことを信頼していました(合理主義的な枠組み)。この新しい世界では、コンピュータがデータに基づいた「教育を受けた推測」を行うことを信頼しています(経験主義的な枠組み)。

著者たちは、ソフトウェアエンジニアに対し、これらのAIシステムを旧来のプログラムのように分析しようとするのをやめるよう呼びかけています。私たちは、これらの「推測マシン」がどのように機能しているかを測定し、テストし、理解するための新しいツールを必要としています。なぜなら、古い数学や論理のルールは、もはやこれらには完全には適用できないからです。私たちは、「おそらく正しい」結果を、どうすれば「確実に正しい」ものと同様に信頼できるのか、その方法を見つけ出さなければなりません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →