Position: We Need Practical AI Alignment Methods to Mirror Human Reasoning
本ポジションペーパーは、AIシステムが人間のユーザーと同様に推論し、コミュニケーションを行う「認知的一致(cognitive alignment)」の達成が、信頼に足る高リスクな意思決定ツールの構築に不可欠であることを論じ、現在の手法とこの極めて重要な目標との間の溝を埋めるための研究アジェンダを概説するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに意思決定の方法を教えようとしている場面を想像してみてください。コンピュータサイエンスの世界では、これは「AIアライメント(AIの整合性)」と呼ばれます。これは、機械の目標や行動を、人間が実際に望んでいることと一致させる技術です。非常に賢く、非常に速い犬を訓練することに似ています。あなたは、その犬にボールを取ってきてほしいのであって、リスを追いかけさせたいのではないはずですし、なぜボールを取ってくるように言ったのかという「理由」まで理解してほしいはずです。しかし、ここが難しいところです。ロボットが正しい答え(ボールを取ってくる)を出したとしても、全く異なる奇妙なロジックを使ってそこに到達していることがあります(例えば、ボールのことをリスだと思い込んでいるなど)。これを「認知的な不整合(cognitive misalignment)」と呼びます。
ほとんどの人は、ロボットが正確である限り、私たちは満足するはずだと考えています。しかし、もしロボットの考え方が私たちにとって完全に異質なものだとしたらどうでしょう? もし、ロボットが数学の問題を、人間には魔法のように見える手法で解いたとしたらどうでしょう? たとえ答えが正しかったとしてもです。この論文は大きな問いを投げかけています。命や大きな価値観が懸かっている状況において、私たちは本当にロボットの「考え方」を気にするのでしょうか、それとも単にその「決定」だけを気にするのでしょうか? 著者たちは、多くの人々にとって、「どのように」というプロセスも「何を」と同じくらい重要であると示唆しています。私たちは、AIに単なる超高速の計算機ではなく、思慮深い人間のように考えてほしいと考えているのです。
論文の核心:私たちは「人間のように考えるロボット」を求めている
この論文は、AIを構築している科学者たちへの行動喚起です。著者らは、私たちは「認知的に整合した(cognitively-aligned)」AIを構築する必要があると主張しています。これは、単にAIが正しい答えを出すことだけを意味するのではありません。AIが問題に対して、人間に馴染みがあり理解可能な方法で推論し、そのステップを明確に説明できることを意味します。
このアイデアを検証するため、研究者たちは150人を対象とした調査を実施しました。参加者には、以下の3種類のAIを想像してもらいました。
- プロセス非公開型AI: ブラックボックスです。答えは出しますが、どのようにしてそこに到達したのかは全く分かりません。
- 機械的推論型AI: 答えを説明はしますが、そのロジックは奇妙で、異質で、人間には理解しにくいものです(例えば、知らない言語で書かれた数学の証明のようなものです)。
- 人間的推論型型AI: 思慮深く、知識のある人間が考える方法を模倣したロジックを用いて、答えを説明します。
研究者たちは、これら3つのAIがすべて等しく正確であることを全員に伝えました。そして、「もしこれらがすべて正しい答えを出すとしたら、あなたはどれを信頼しますか?」と尋ねました。
彼らが発見したこと:私たちは「人間のロジック」を切望している
結果は非常に明確でした。特に事態が深刻な場合ほど顕著でした。天気の予測や会議のスケジューリングといった低リスクのタスクでは、人々はどのAIを使うかをあまり気にしませんでした。しかし、患者の腎臓移植の優先順位、保釈の可否、あるいは軍事ミサイルの照準先を決めるような、高リスクの状況においては、人々は強く「人間的推論型AI」を好みました。
実際、テストされた16のシナリオのうち5つにおいて、統計的に有意な多数派が、人間のように考えるAIを選択しました。著者らは、25%以上の人々が「十分な時間と情報があれば、あなたが行うであろう決定と同様の決定を行う」という品質を「不可欠である」と評価したことを明らかにしました。また、25%がそれを「非常に望ましい」と評価しました。
この論文は、命が懸かっているとき、私たちは単に正しい答えを求めているのではなく、「なぜ」を知りたいのだと示唆しています。私たちは、AIが共感、公平性、あるいは特定の医学的詳細といった、私たちが考慮するであろう要素を検討していることを知りたいのです。もしAIが「異質な」ロジックを使用しているならば、たとえそれが正しかったとしても、それはリスクが高く、信頼できないと感じられます。それは、あなたの命を救ってはくれるものの、一度も見たことがない、説明もできない手術技法を用いる外科医のようなものです。あなたは生き延びることはできても、おそらく恐怖を感じるでしょう。
現在のAIの問題点
著者らは、現在のAIの多くが「ボトムアップ」の手法で構築されていることを指摘しています。科学者たちは、何百万もの人間の選択の例をAIに与え、その結果をコピーするように教えています。それは、オウムに「愛してる」というフレーズを何千回も繰り返させることで、その言葉を言わせるようなものです。オウムは正しい言葉を口にしますが、その背後にある感情を実際に理解しているわけではありません。
現在のAIのアライメント手法は、AIの「推論」が人間の推論と一致しているかどうかをチェックすることに失敗することがよくあります。彼らは単に最終的な答えが正しいかどうかをチェックしているだけなのです。論文は、これが問題である理由として以下を挙げています:
- 検証不可能な説明: 現代の多くのAIモデル(深層ニューラルネットワークなど)は「ブラックボックス」です。たとえAIが自らを説明しようとしても、それが実際にどのように決定を下したかについて、真実を語っているかどうかを確認することはできません。
- 認知的な不整合: AIの思考プロセスが見えている場合であっても、そのロジックはしばしば人間に全く異質なものになります。例えば、AIは人間が実生活では使わない複雑な数式に基づいて決定を下すかもしれません。
次に何をすべきか
この論文は、私たちがまだこの問題を解決したと主張しているわけではありません。代わりに、これを修正するための研究アジェンダを提示しています。著者らは、以下のようなことが必要であると提案しています:
- アライメントの測定: AIの思考プロセスが実際に人間の思考プロセスと一致しているかどうかをテストするための、新しい方法を開発すること。これには、人々が自身の選択をどのように説明するかを尋ねたり、視線計測(アイトラッキング)を用いて、人々が何を重視しているかを見守ったりすることが含まれるかもしれません。
- より優れたツールの構築: 特定の個人やグループのように考えるように「調整(チューニング)」できるAIを作ること。例えば、医師の特定の診断方法や、裁判官の証拠の重み付けの方法に合わせて調整できるAIを想像してみてください。
- 葛藤の処理: 時として、人々は何か(例えば公平性)を望んでいると言いつつ、その選択行動は別のこと(例えばスピード)を望んでいることを示す場合があります。論文は、過去の選択に基づいて単に推測するのではなく、人間がAIに「本当に」何をさせたいのかを理解するための対話型ツールが必要であると示唆しています。
結論
この論文は、AIが医療、法律、軍事判断のような高リスクの状況において真に信頼できるパートナーとなるためには、単に賢いだけでは不十分であることを示唆しています。AIは「認知的に整合」していなければなりません。人間のように感じられる方法で推論し、私たちが理解できる方法でステップを説明し、そのロジックが私たちの価値観と一致していることを検証できるようにしなければなりません。著者らは、これなしでは、たとえAIがいかに正確であると主張しても、多くの人々はAIに困難な決断を任せるほど信頼することはないだろうと主張しています。それは単に正しい答えを得ることではなく、私たちにとって意味のある形で、機械との対話を成立させることなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。