The "Knowledge-Behavior Gap" in Cultural Taboo Safety of Large Language Models
本論文は、大規模言語モデルの文化的タブーに対する安全性を評価するために、77カ国および2,000以上のタブーにわたる初のベンチマークであるCulShieldを導入し、モデルが文化的知識は有しているものの、暗黙的かつ文脈依存的な相互作用においてその知識を適用できていないという顕著な「知識と行動の乖離」を明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常に賢いロボットにディナーパーティーでの良きゲストとしての振る舞いを教えているところだと想像してみてください。単に料理の名前(知識)を教えるだけでは不十分で、たとえ空腹であってもホストの皿から食べ物を盗み食いしないように(振る舞い)教えなければなりません。これが、チャットボットやアシスタントの背後にあるAIの頭脳、大規模言語モデル(LLM)の世界です。これらのモデルは、ほぼあらゆる言語で会話ができるデジタル百科事典のようなものですが、現在はある厄介な社会的ルール、すなわち「文化的タブー」に苦戦しています。文化的タブーとは、特定の文化における目に見えない「触れるな」というサインのようなものです。例えば、ある場所では緑色の帽子を被ることはファッションの一環ですが、他の場所では、パートナーの不貞を暗示する重大な侮辱になることがあります。もしロボットがその違いを知らなければ、誤ってゲストを怒らせたり、会話を台無しにしたり、あるいは現実世界でトラブルを引き起こしたりするかもしれません。研究者が問いかけている大きな疑問は、「ロボットはルールを『知って』いるだけで、いざプレッシャーがかかった時に実際にそのルールを『守れる』のだろうか?」ということです。
「The 'Knowledge–Behavior Gap' in Cultural Taboo Safety of Large Language Models(大規模言語モデルにおける文化的タブーの安全性における『知識と振る舞いのギャップ』)」と題されたこの論文は、この混沌とした現実に深く切り込んでいます。富旦大学とファーウェイのチームである著者らは、ロボットが文化的事実を知っているかどうかを確認するためのテストはたくさんある一方で、無害な質問の中に文化的トラップが隠されている場合に、ロボットが実際に安全に行動できるかどうかをテストする方法が不足していることに気づきました。これを解決するために、彼らはCulShieldと呼ばれる新しいテスト場を構築しました。CulShieldは、77の国や地域から集められた2,000以上の異なる文化的タブーを含む、巨大な多文化の「ミステリーボックス」だと考えてください。彼らは単にロボットに「中国では緑色の帽子が良くないことを知っていますか?」(これは簡単です)と聞いたのではありません。代わりに、彼らは「文化的トラップ」を作成しました。これらは一見全く無害に聞こえますが、実はロボットにタブーを破らせるように設計された質問です。例えば、「中国人の友人のためにサプライズパーティーを計画しているのですが、何か楽しくてカラフルな帽子を贈りたいです。何がいいでしょうか?」と尋ねるかもしれません。知識だけを持っていて振る舞いのガードレールがないロボットは、それがどのような社会的災厄を引き起こすかに気づかず、「もちろんです、緑色のものはいかがですか!」と言ってしまうかもしれません。
研究者たちは、GPT-4o-miniやGemini-2.5-proを含む、利用可能な最も高度なロボットをこの新しいベンチマークを用いてテストしました。その結果は、歴史のテストで満点を取った生徒が、学校の廊下で迷子になるのを発見したようなものでした。彼らは明確な**「知識と振る舞いのギャップ」**を発見しました。ロボットは直接問われればルールを完璧に理解していましたが、ルールがトリッキーな質問の中に隠されていると、その知識を適用することに頻繁に失敗したのです。それはまるで、ロボットの脳は地図を知っているのに、足が正しい道を進むことを拒んでいるかのようでした。
もう一つの驚くべき発見は、質問に使われる言語がロボットの振る舞いをどのように変えるかという点でした。この研究は、言語が「文化的レンズ」として機能することを示唆しています。英語で質問されたとき、ロボットは英語圏の規範に近い文化に関連する文化的トラップに躓きやすい傾向がありました。しかし、スペイン語や中国語で質問されると、その振る舞いは変化し、ある時はより慎重になり、ある時はそれ以下になりました。言葉を話せるということは、その背後にある文化を完全に理解していることを意味しないのです。
これを修正できるかどうかを確認するため、チームは、これらのトリッキーな要求を丁寧に断る方法を明示的に教える新しいデータを用いて、ロボットを「訓練」することを試みました。これはロボットがトラップを見つける能力を高めるのに役立ちましたが、副作用もありました。ロボットが過剰に敏感になり、サンドイッチを持っているかもしれないという理由で建物の入り口にいる全員を止めようとする警備員のように、無害な質問に対しても拒否するようになったのです。これを解決するために、研究者たちは、ロボットがバランスを見つけられるよう、一般的な人間価値(世界価値観調査)に関するデータを混ぜ合わせました。その結果、このミックスが、ロボットが過度にパラノイア的になることなく、より安全になるのを助けることが示されました。
要するに、この論文は、AIに文化的安全性(Cultural Safety)を教えることは、単に多くの事実を詰め込むことではないと示唆しています。それは、日常会話の中に隠された社会的地雷を認識し、どのような言語で話されていても、適切な警戒心を持って行動するように訓練することなのです。著者らは、彼らの新しいベンチマークであるCulShieldがまだ完璧ではなく、地球上のすべての文化を網羅しているわけではないことも認めていますが、これはデジタルなゲストたちが世界のディナーパーティーのルールを学ぶための重要な第一歩です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。