← 最新の論文
💻 computer science

Identifying Harm in Personalized, Generative AI Systems Requires User-Centered Auditing at the Interaction Level

本ポジションペーパーは、従来の静的な監査手法ではパーソナライズされた生成AIシステムから生じる創発的かつ進化する危害を捉えることができず、危害を適応的かつ多元的なプロセスとして認識する、ユーザー中心のインタラクション・レベルのアプローチへの転換が必要であることを論じるものである。

原著者: Hannah Cha

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Hannah Cha

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがこれまでに語ったすべてのことを記憶し、あなたの好みを学習し、あなたに完璧に適合するように自らの人格を徐々に作り変えていく機械との会話を想像してみてください。これは、パーソナライズされた生成AIが提示する約束です。この技術は、過去のやり取りに基づいてトーンやスタイル、アドバイスを適応させるチャットボットやライティング・アシスタントとして現在登場しています。決められた回答リストから単に選択するだけの従来のコンピュータプログラムとは異なり、これらの新しいシステムは、ユーザーとの関係が深まるにつれて行動を変えながら、全く新しい応答をその場で作り出します。この適応性は、やり取りをより関連性の高いものに感じさせる一方で、隠れた危険をもたらします。ある人にとって非常に役立つと感じられるものが、別の人にとっては傷つけられたり疎外感を感じたりするものになる可能性があり、こうした害は一度のテストではなく、数週間あるいは数ヶ月にわたる対話の後に初めて明らかになることが多いのです。

研究者たちは、コンピュータに同じ質問を繰り返し行い、偏った回答や不適切な回答を生成するかどうかを確認するシミュレーションを行うことで、人工知能の問題点を見つけ出し、修正しようと長く試みてきました。この手法は、特定の都市を常に間違える地図のように、静的なエラーを見つけるには適しています。しかし、マイクロソフト・リサーチとスタンフォード大学のハンナ・チャーによる新しい論文は、このアプローチがパーソナライズされたシステムで起きている真の害を捉えることに失敗していると論じています。研究によれば、これらの機械はユーザーとともに進化するため、「何が有害であるか」という定義は時間の経過とともに変化し、同じ背景を持つ人々之間であっても大きく異なるというのです。研究者たちは、パーソナライゼーションをさらに深化させることで問題を解決しようとすることは、実際には事態を悪化させる可能性があることを見出しました。それは、周辺化されたグループの人々に対し、機械を安全に動作させるために、自らの痛みについて説明したり、あまりにプライベートな情報を開示したりするという追加の作業を強いることになるからです。

問題の核心は、私たちが現在どのように「害」を測定しているかにあります。既存のテストの多くは、有害な出力とは、車が道路を走り出す前に特定できる「車の壊れた部品」のような固定された物体であると想定しています。パーソナライズされたAIの世界において、研究者たちは、害とは「うまくいかない会話」のようなものであると主張しています。研究者がラボで行うテストでは無害に見える応答も、システムとの特定の履歴があるユーザーにとっては、深く不快に感じられることがあります。例えば、機械はある時点では役に立つように見える食事の推奨を開始しますが、数ヶ月間のやり取りの末に、ユーザーはその提案が自分の文化に対するステレオタイプに基づいていることに気づき、助けとなるはずのジェスチャーがマイクロアグレッション(無意識の差別)へと変わってしまうのです。こうした害は、単一のミスから生じるのではなく、関係性の流れから立ち現れるものであり、機械を孤立した状態で検証する従来のテストでは、その危険性を完全に見逃してしまうのです。

さらに、この論文は、現在の手法がしばしば人々を、あたかも全員が同じように感じるかのように扱う点を指摘しています。監査では、「女性」や「黒人」といったグループ全体を一つの塊として公平に扱っているかをチェックすることがよくあります。しかし、研究者たちは、いかなる単一のグループ内においても、人々は異なる人生、異なるトラウマ、そして異なる境界線を持っていることを示しています。あるコミュニティの一人が不快だと感じることを、別の人は受け入れ可能と感じ、また第三者は全く気づかないこともあります。システムがグループの平均的な行動から学習しようとするとき、それは複雑な差異を単一の簡略化されたバージョンのグループへと押しつぶしてしまうことがよくあります。これは、機械がコミュニティ内の最も支配的な声の好みを学習し、残りの声を無視することで、結果として、そのコミュニティに属する人々のユニークな経験を消し去ってしまう状況を招く可能性があります。

研究者たちは、魅力的な解決策についても検討しました。「もし機械が、個々のユーザーが何を有害だと感じるかを正確に学習したらどうだろうか?」という問いです。これは理想的に聞こえますが、論文はこれが不公平な負担を生むと論じています。機械に何が痛みを伴うかを教えるためには、ユーザーは間違いを指摘し続けなければならず、それは絶え間ない感情的労働を必要とします。自身の経験が機械のデフォルト設定と異なる人々にとって、これは、システムを修正するために重い役割を担わなければならないことを意味します。一方で、デフォルトに適合する人々は、努力することなくスムーズな体験を得ることができます。さらに、機械に教えるために、ユーザーは自身のアイデンティティや過去の傷つきに関する機密性の高い詳細を明かさなければならない可能性があり、これは「苦痛に耐えるか、それとも個人のデータを差し出すか」という選択を迫られるプライバシーの罠を生み出します。このダイナミクスは、最も脆弱なユーザーをテクノロジーから遠ざけるリスクがあります。

機械がユーザーの望むことを推測する能力を完璧にすることを目指す代わりに、論文はこれらのシステムを設計する方法の転換を提案しています。著者は、ユーザーが事後ではなく、害が発生しているその瞬間に声を上げられるようなインフラストラクチャを構築することを提案しています。これには、ユーザーが応答を問題としてフラグ立てし、なぜそれが問題なのかを説明できるツールが含まれますが、その際、システムが「一人の不満が全員にとっての最終的な真実である」と仮定しないようにする必要があります。決定的なのは、このシステムが、コミュニティ内の他の人々が同様の状況をどのように解釈してきたかを見ることができるようにし、それによってユーザーが共有された説明が自身の経験と共鳴するかどうかを判断できるようにすることです。目標は、機械が沈黙して学習し、ユーザーが受動的に受け取るモデルから、ユーザーが機械の適応方法に対してコントロールを保持するパートナーシップへと移行することです。

研究者たちは、このアプローチが単純な解決策ではないことも認めています。それは、しばしば不透明なシステムに対する信頼を築く必要があり、コミュニティ内での意見の対立をどのように扱うかという難しい問いを提起します。もしある人が「ある発言は有害だ」と言い、別の人が「それは問題ない」と言った場合、システムは単一の答えを強制することなく、両方の真実を保持できなければなりません。この論文は、技術的な課題を解決したと主張しているのではなく、現在の静的なテストと深いパーソナライゼーションの道筋は不十分であることを強調しています。害とは、ユーザーの歴史と文脈によって形作られる流動的で進化し続けるプロセスであることを認識することで、私たちは人間の経験の複雑さを簡略化して排除するのではなく、その複雑さを尊重するAIを設計し始めることができるのです。究極の結論は、パーソナライズされた世界でユーザーを保護するには、機械が自ら正しい教訓を学ぶことを期待するのではなく、会話の中にユーザーの声を反映させることが必要であるということです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →