A distilled value head breaks search, but search remains an effective teacher, not a move selector: a case study in 19x19 Go
本研究は、強力な囲碁AIからバリューヘッドを蒸留すると、較正(キャリブレーション)はされているものの非識別的な評価器となり、MCTS探索の性能を低下させる一方で、探索プロセス自体は極めて効果的な教師であり続け、探索が推論時に優れた手を提示できなくなっているにもかかわらず、MCTSの訪問回数を模倣するように方策を学習させることで大幅な強さの向上が得られることを実証している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、チェスや囲碁のような複雑な戦略ゲームを教えている、非常に優秀だが頑固な生徒を想像してみてください。そこには、盤面を見て誰が勝っているかを正確に教えてくれる、超スマートな教師(「オラクル」と呼びましょう)がいます。通常、生徒に教えるときは、教師と対局させて練習させたり、数手先を読み、何が起こるかを確認させたりします。人工知能の世界では、この「先を読むこと」は**モンテカルロ木探索(MCTS)**と呼ばれます。これは、一瞬の間に何千もの小さな空想上のゲームを実行するシミュレーターのようなものです。
現代のAIにおける大きなアイデアは、スマートな「脳」(ニューラルネットワーク)と、この「シミュレーター」(MCTS)を組み合わせれば、無敵の結果が得られるというものです。脳が次の一手を推測し、シミュレーターがそれを再確認します。しかし、もしシミュレーターが脳を逆に「弱く」させてしまったらどうなるでしょうか? あなたを助けるための道具であるはずの「思考」が、実はあなたを混乱させているとしたら? これは、研究者の太樹 幸輝氏が取り組んだ奇妙なパズルです。彼は世界チャンピオンを目指すロボットを作ろうとしたのではなく、「考える」部分が「プレイする」部分を壊してしまうという、ある種の不具合を理解しようとしていました。たとえその「考える」部分が、教えるための道具としては依然として極めて有用であったとしても、です。これは、悪いコンパスが、教師にとっては優れた地図になり得るという物語です。
不完全なコンパス
コンピュータ囲いの世界では、通常、AIは非常に強力な教師から学ぶことで訓練されます。この研究において、教師は有名なAIであるKataGoでした。研究者は、より小さくシンプルなAIを取り上げ、「知識蒸留」と呼ばれる手法を用いて、その教師の脳をコピーしようと試みました。これは、生徒が先生の宿題の答えを暗記しようとする様子に似ています。
通常、一度生徒が答えを学習すれば、自分の「思考エンジン」(MCTS)を使って、手を打つ前に自分の作業をダブルチェックさせます。こうすることで、生徒はさらに強くなることが期待されます。しかし、ここで展開が急変します。研究者が、生徒に手を決めるために「思考エンジン」を使用させたところ、生徒の勝率は実際に低下したのです。
思考エンジンなしでプレイする場合、生徒は自分自身との対局で約32%の勝率を記録していました。しかし、手を決めるために「思考エンジン」をオンにした途端、その勝率は急落しました。まるで、数学の問題を完璧に解ける生徒が、電卓の使用を許可された途端にテストで落第し始めたかのようでした。
壊れたバリューヘッド
研究者は、なぜ「電卓」が壊れているのかを突き止めなければなりませんでした。電卓自体(探索アルゴリズム)に欠陥があるのでしょうか? それとも、生徒の脳(ニューラルネットワーク)が電卓に誤った情報を与えているのでしょうか?
これをテストするために、研究者は計算の最終ステップにおいてのみ、生徒の脳を教師の脳と入れ替えました。すると突然、勝率は**98.3%**へと急上昇しました。これは、「電卓」(MCTS)自体は完璧に機能していたことを証明しています。問題は完全に、生徒の脳の中にありました。
具体的には、問題は**バリューヘッド(価値関数)**にありました。AIの用語で、バリューヘッドとは「この局面は良いか悪いか」を判断する脳の部分です。生徒のバリューヘッドは、絶対的なスコア(局面全体として勝ちか負けか)を判断することに関してはかなり優秀でした。しかし、似たような二つの手を並べて比較することに関しては、非常に稚拙でした。隣り合う二つの手のうち、どちらがわずかに優れているかを判別できなかったのです。
例えば、絵画を見て「良い」か「悪い」かは判断できるが、二つの「良い」絵を見せられたときに、どちらがより「優れている」かを判断できない審判を想像してみてください。AIはこの混乱した審判を使って最善手を決めようとした結果、ミスを重ね続けました。探索エンジンが深く掘り下げれば掘り下げるほど、より混乱した比較が行われ、AIの決定はどんどん悪化していきました。
解決策:コンパスを使うのをやめ、地図を使いなさい
研究者は、その壊れた審判を修正するために、脳のその部分だけを再学習させる試みを行いました。審判は手を比較する能力が少し向上しましたが、それでもAIは探索エンジンを使ってプレイすることができませんでした。探索エンジンは、依然として「手を選ぶ者」としては壊れたままでした。
そこで研究者は、全く異なるアプローチを試みました。AIに探索エンジンを使って「手を選ぶ」能力を直させるのではなく、探索エンジンを**「教師」**としてのみ使うことにしたのです。
ここにある魔法のトリックがあります:
- AIは探索エンジンを使用して、「訪問分布(visit distribution)」を生成してゲームをプレイしました。これは、探索エンジンが異なる手にどれだけの時間を費やしたかの記録です。たとえ探索エンジンが最終的な一手として間違った手を選んでいたとしても、正しい手に対して多くの時間を費やしていた可能性があります。
- 研究者は、単に最終的な手をコピーするのではなく、この「思考パターン」(訪問分布)をコピーするようにAIの脳を訓練しました。
- そして、AIが変化しすぎるのを防ぐための「安全のアンカー」を取り除きました。
結果は衝撃的でした。探索エンジンを使って「手を決める」能力を改善しようとするのではなく、探索エンジンを「教師」としてのみ利用することで、AIは劇的に向上しました。
- 第2世代(旧手法を使用):AIは以前のバージョンよりも改善しませんでした。
- 第3世代(探索エンジンを教師として使用):AIはオリジナル版のベースラインに対して94.1%、前バージョンに対して**82.4%**の勝率を記録しました。
これは、以前の世代が使用した半分以下の練習データ(自己対局ゲーム)を使用して達成されました。探索エンジンは、プレイヤーとしてはひどいものでした(選んだ手が正解である確率がわずか27%でした)が、教師としては驚くべき存在だったのです。
なぜこれが重要なのか
この論文は、AIの「意思決定を行う能力」と「レッスンを教える能力」の間には大きな違いがあるという結論を下しています。
これは、スポーツのプレー自体は下手なコーチを想像してみてください。もしそのコーチに試合に出るよう頼めば、彼らは負けるでしょう。しかし、もし彼に試合を観戦させ、「選手がどこに注意を向けるべきか」を教えるよう頼めば、彼らは極めて優秀かもしれません。この研究における探索エンジンは、まさにそのようなコーチでした。それは勝者を決めることはできませんでしたが、その「注意のマップ(attention map)」は、生徒が学習するためにどこを見るべきかを正確に示していたのです。
また、この研究はAIを構築するすべての人への警告も示しています。標準的な指標(例えば、テストにおいてAIがどれだけ手をランク付けできたか)は、そのAIが実際にゲームで上手くなるかどうかを予測できないことが多いという事実です。時には、テストのスコアが悪化したにもかかわらず、AIが実際には強くなっていることもあります。
結局のところ、これは囲いだけの話ではありません。同じ問題は、言語モデルの訓練など、他のAI分野でも発生します。答えを生成するためのツールが、直接使うにはあまりにも不完全な場合でも、その答えを生成する「プロセス」の中に、AIを賢くするための秘密が隠されていることがあるのです。教訓はこうです。たとえ教師がゲームをプレイできなくても、その教師を切り捨ててはいけません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。