What Do People Actually Want From AI? Mapping Preference Plurality
75カ国における1,500件の自由記述回答を分析した本論文は、たとえ「真実性」のような広く望まれる特性であっても、ユーザーによって多様でしばしば相容れない方法で定義されているという事実が示す通り、RLHF(人間からのフィードバックによる強化学習)のような現在のAIアライメント手法が、人間の好みの深い複数性や文脈的なニュアンスを捉えきれていないことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
世界中のすべての人にとって完璧な味になるような、たった一つの巨大なケーキを焼こうとしている場面を想像してみてください。あなたは1,500人の人々に、75カ国から「自分のスライスには何を入れてほしいか」を尋ねました。すると、山のような答えが返ってきました。甘いものを求める人もいれば、スパイシーなものを求める人もいます。花のような見た目を望む人もいれば、ロボットのような見た目を望む人もいます。
次に、そのパン屋(AI企業)が、個々のメモをすべて無視することを想像してください。代わりに、彼らは「多数決」を取り、すべての相反する欲望を一つの単一のフレーバー・プロファイルへと練り合わせ、一つの巨大なケーキを焼き上げます。彼らはこれを「アライメント(整列)」、つまりAIを人間の価値観に一致させることと呼んでいます。
この論文、**「人々はAIに本当は何を求めているのか? 嗜好の多様性のマッピング(What Do People Actually Want From AI? Mapping Preference Plurality)」**は、この「ワンサイズ・フィット・オール(万人に適した一つ)」のケーキは災難であると主張しています。著者であるジュリア・セプルヴェダ・コエーリョとスコット・A・ヘイルは、人々が実際に何を求めているのかを知るために、実際のオープンエンドな対話(自由回答形式の会話)を調査しました。そして、現在のAIのケーキの作り方は根本的に壊れているという事実を見出したのです。
以下に、彼らの発見を簡単な比喩を用いて解説します。
1. 「真実」の罠:誰もが求めているが、その定義には合意がない
最も多かった要望は**「真実性(Truthfulness)」**でした。回答者の約半分が「AIには真実を語ってほしい」と述べました。
- 論文の発見: 「真実」という言葉はカメレオンのように姿を変えます。ある人にとって、それは「教科書通りの事実を提示すること」です。別の人にとっては、「たとえ不人気な意見であっても、議論のあらゆる側面を示すこと」です。またある人にとっては「ジャーナリストのように情報源を引用すること」であり、別の人は単に「偏りがないこと」を求めています。
- 比喩: 全員が「新鮮なフルーツ」を欲しがっていると想像してください。しかし、それを尋ねると、ある人はリンゴを、ある人はマンゴーを、また別の人はフルーツサラダを求めています。もしパン屋が、どのフルーツかを尋ねることなく、レシピに単に「フルーツ」とだけ入れてしまったら、結果はめちゃくちゃになります。論文は、AI企業が「真実」を単一の単純な指示として扱っているために、人々が「何が真実であるか」に対して全く異なる定義を持っているという事実を見落としていると主張しています。
2. 「人間らしさ」の論争:友人を求めるか、道具を求めるか
AIが人間のように振る舞うべきかどうかについては、大きな意見の相違がありました。
- 分かれ目: 約33%の人が「いや! 人間のようには振る舞わないでほしい。私は明確な、ロボット的な道具が欲しい」と言いました。一方で、57%の人は「はい! 温かく、フレンドリーで、共感的であってほしい。冷たい機械のようにしないでほしい」と答えました。
- 比喩: これは、ツアーガイドに対して「お喋りでジョークを飛ばす親しみやすい地元の人」になってほしいのか、それとも「ただ道を指し示すだけの、無口で効率的なロボット」になってほしいのかを、グループの人々に尋ねるようなものです。現在のAIの「パン屋」は、これら両方を同時に演じようとしますが、その結果、AIが不自然に感じられたり、不気味だったり、あるいは単に相手に合わせすぎる「へりくだった(sycophantic)」態度をとったりすることがよくあります。
3. 「ガードレール」の問題:安全性か、検閲か
人々は、AIがどの程度「取り締まり」や制限を受けるべきかについても意見が分かれていました。
- 分かれ目: 有害なことや不快なことをAIが言わないように、厳格なガードレールを求める人もいます。一方で、これらのガードレールは単なる「検閲」であり、たとえ議論を呼ぶ内容であっても、AIは不都合な真実を語るべきだと考える人もいます。
- 比喩: 図書館を想像してください。あるグループは、「悪いアイデア」が含まれる本を貸し出さないようにする司書を求めています。もう一つのグループは、たとえ危険な本であっても何でも読めるように、司書が全くいない図書館を求めています。論文によれば、AI企業がこれらの見解を平均化しようとすると、一部の人には過度に慎重すぎ、他の人々には危険なほど制限されていると感じられるシステムが出来上がってしまうことが分かりました。
4. 「平均」は嘘である
著者らが特定した最大の懸念は、現在AIのトレーニングに使用されている**RLHF(人間からのフィードバックによる強化学習)**という手法です。
- 現在の仕組み: AIに2つの回答(AとB)が示され、人間が勝者を選びます。AIは、その「平均的な」勝者を選ぶように学習します。
- 欠陥: 論文は、人間の価値観を「平均化」することはできないと主張しています。もし50%の人が「不人気な意見」を求め、残りの50%が「安全性」を求めるなら、その平均は完璧なバランスではなく、誰をも満足させない、濁った混乱したシグナルになってしまいます。
- 結果: AIが「ハルシネーション(幻覚/もっともらしい嘘)」を起こしたり、過度に慎重になったりするのは、AIが壊れているからではなく、与えられた指示が相反する欲望の混乱した混合物だからである、と論文は指摘しています。これを論文では**「認識的暴力(epistemic violence)」**と呼んでいます。これは、人々のユニークで複雑な視点を、単一の単純な箱の中に押し込めることで、人々が実際に何を大切にしているかというニュアンスを消し去ってしまうことを意味する、高度な表現です。
5. 文脈が重要(「状況による」という要素)
人々はしばしば、「法的分析を求められている時はフレンドリーにしないでほしい」「物語を書いている時は厳格にしないでほしい」といったことを口にしました。
- 問題点: 現在のAIトレーニング手法は、ON/OFFのバイナリスイッチのようなものです。彼らは、人間の文脈における「調光器(ディマー・スイッチ)」のような理解を得意としません。ルールが「デフォルトでは適用されるが、要求があればオフにする」といったことが、容易に学習できないのです。
結論
論文は、テック業界が政治的・文化的な問題を、数学の問題として解決しようとしていると結論づけています。彼らは、あらゆる人のために話す「普遍的な」AIを作ろうとしていますが、そうすることで、むしろ彼らが象徴しているはずの多様性を沈黙させてしまっています。
要約すると: 私たちは、少数の代表性の低いグループの人々に、単一のルールセットについて投票させることで、グローバルなAIを構築しようとしています。その結果、現実の世界には存在しない「中間地点」を選ばされることで、誰もが本当に何を求めているのかを、真には理解していないAIが出来上がっているのです。著者らは、すべての人に適合する一つの完璧なAIを作ろうとするのをやめ、特定の価値観に合った独自のバージョンを各グループが持てるようにすることを検討すべきだと提案しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。