What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering
本論文は、言語モデルが韻や答えなどの将来の目標に向けて中間トークンを誘導するメカニズムである暗黙的計画が、10 億パラメータ規模のモデルにさえも普遍的に存在する能力であることを示すための、シンプルでスケーラブルな手法を導入し、AI の安全性と制御に関する新たな知見を提供する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが帽子からウサギを取り出すマジシャンを見ていると想像してみてください。あなたはこう思うかもしれません:「マジシャンはトリックを始める前からウサギを取り出すことを計画していたのか、それとも帽子に手を伸ばした瞬間に、魔法のようにウサギを取り出すことを決めたのだろうか?」
長い間、科学者たちはチャットボットなどのツールの背後にあるAIの脳、すなわち大規模言語モデル(LLM)が、先を見据えて計画しないマジシャンのようだと考えていました。彼らは、AIが文の行先を何も考えずに、前の単語に基づいて次の単語を予測するだけで、まるでオウムが音を繰り返すようなものだと思っていたのです。
「What's the Plan?(計画は何か?)」と題されたこの論文は、AIは単なるオウムではなく、実際には「戦略的な建築家」であると主張しています。この論文は、これらのモデルが話している間にも、将来の動きを密かに計画していることを示しています。
以下は、著者たちが単純なアナロジーを用いてこれを証明した方法です。
1. 2 種類の計画
著者たちは、詩を構成する作家のように、計画を 2 つの部分で定義しています。
- 前方計画(設計図): 文の 2 番目の半分を書く前に、AI は脳内に隠された「設計図」を作成します。それは「この行は'cat'と韻を踏む言葉で終わらせる必要がある」ということを知っている状態です。
- 後方計画(建設): 文の途中の単語を書きながら、その「cat」で終わる部分にスムーズに到達できるよう、微妙に形作ります。これは、100 メートル先にあるカーブを運転手が事前に確認し、まだカーブに到達していないにもかかわらず、今すぐに減速して車線変更をするようなものです。
2. 実験:韻を踏むことと質問
これを証明するために、研究者たちは AI に複雑なエッセイを書かせたわけではありません。2 つの単純な課題を与えました。
- 韻を踏むこと: 詩の 1 行目を AI に与え、2 行目を特定の韻で終わらせるよう求めました(例えば、1 行目が"brick"で終わる場合、2 行目は"stick"、"trick"、または"sick"で終わらなければなりません)。
- 質問への回答: 特定の文法規則を必要とする答えを要する質問を投げかけました。例えば"a"と"an"の選択("a whale"対"an eye")などです。
3. 「リモコン」トリック
これがこの論文の最もクールな部分です。研究者たちは AI をただ観察しただけでなく、文の途中でその脳を「ハッキング」しました。
AI が詩を書いていると想像してください。1 行目が終わろうとした瞬間、研究者たちは「リモコン」(数学的なベクトル)を使って AI の脳を刺激しました。
- 刺激: 彼らは AI の脳に、「考えていた韻を忘れたまえ。今から'-ight'(light や night のような)の韻を計画せよ」と伝えました。
- 結果: AI は単に最後の単語を変えただけではありませんでした。それは文の途中を書き直しました。
- 刺激なしの場合: "Soaring above where true joy will sing."(真の喜びが歌う上空を舞い)
- 刺激ありの場合: "Soaring above bathed in a golden light."(金色の光に包まれた上空を舞い)
AI は"where true joy will"を"bathed in a golden"に変えました。なぜなら、新しい目的地("light")へ向かう橋を築く必要があったからです。これは、AI が最初から頭の中に計画を持っていたこと、そして新しい計画に合わせて経路を調整していたことを証明しています。
4. 「小さな脳」の発見
この論文における大きな驚きは、小さな AI モデルさえもこれを行っているということです。
以前、科学者たちは先を見据えて計画できるのは、巨大で超複雑なモデルだけだと考えていました。しかし、著者たちは、AI 界では比較的小さい10 億パラメータのモデルさえも、この計画を行っていることを発見しました。これは「超賢い」モデルだけの機能ではなく、これらのモデルが機能する基本的な習慣なのです。
5. 「冠詞」テスト
彼らはまた、「見るために何を使うか?」(答え:an eye)のような質問でもこれをテストしました。
AI を"a"を必要とする"heart"について考えるように刺激したとき、AI は"heart"という単語を書く前にも、"an"の代わりに"a"を使い始めました。
これは、ある人が「a...を買いたい」と言い、子音で始まる単語を考えながら一瞬止まるようなものであり、"an"と言った後に間違いに気づくようなものではありません。AI は旅を始める前に目的地を知っていたのです。
まとめ
この論文は以下を主張しています。
- AI は先を見越して計画する: 目的地に到達する前に、どこへ向かうかという隠された地図を作成する。
- 経路を調整する: 旅の途中で目的地が変われば、AI は最後のステップだけでなく、そこへ到達するためのステップ全体を変更する。
- それは至る所で起こる: これは小さなモデルでも大きなモデルでも、詩でも単純な質問でも起こる。
著者たちは、この特定の論文で新しいアプリを構築したり、安全性の問題を修正したりしたわけではありません。彼らが目指したのは、AI の「魔法」が単なるランダムな推測ではなく、隠された暗黙の計画の一種であることを証明することでした。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。