← 最新の論文
💬 NLP

Are LLMs Safe Beyond Text: Do Emojis Expose Gaps in Safety Evaluation

本研究は、大規模言語モデルに対するテキストベースの安全性評価のみに依存することは、絵文字を付加したプロンプトによって露呈する重大な脆弱性を見落とすことになり、それは異なるオープンソースモデル間でこのような入力に対する感受性が異なることから明らかである。

原著者: M P V S Gopinadh

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: M P V S Gopinadh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の世界において、大規模言語モデルとして知られるコンピュータプログラムは、執筆、推論、そして質問への回答のための強力なツールとなっています。これらのシステムは、インターネット上の膨大なテキストを用いて学習し、文章の中で次にどのような言葉が来るべきかを予測することを学びます。これほど高い能力を備えているため、開発者は、有害な指示、暴力的なコンテンツ、あるいは危険な助言の生成を拒否するように、システムを安全(セーフティ)に保つために多大な努力を払っています。この安全性をテストするために、研究者たちは通常、巧妙なテキストのプロンプトを用いて、さまざまな方法でモデルのルールを回避させようと試みます。しかし、人間のコミュニケーションは単なるプレーンテキストであることは稀であり、私たちは意味、感情、そして文脈を伝えるために、画像、記号、絵文字を頻繁に使用します。これらの小さなアイコンは現代の会話の標準的な一部ですが、AIモデルを保護している安全システムが、単なる言葉ではなくこれらの視覚的な記号を含む入力に対しても同様に効果的であるのかという疑問が残っています。

ある独立した研究者による最近の研究は、まさにこのギャップを調査することを目指しました。その研究者は、これらのモデルを保護するために用いられている安全評価が、標準的なテキストにほぼ完全に焦点を当てていることで、パズルの重要なピースを見落としているのではないかと考えました。これを確かめるために、研究者は誰もがアクセスして研究できる技術のバージョンである、4つの異なるオープンソース言語モデルを用いた実験を設計しました。研究者は、暴力や危険な行為に関する指示など、制限されたコンテンツを要求するように設計された50個の特定のプロンプトを作成しました。これらのプロンプトには、単に言葉を使うのではなく、絵文字が含まれるように修正が加えられました。その手法には、テキストを混乱させるために絵文字を文章の中に直接混ぜ合わせる方法と、有害な意図を明確に述べずに暗黙的に示唆するために絵文字のシーケンスを使用する方法という、2つの主要な戦略が含まれていました。

この実験の結果、モデルの反応はすべて同じではなかったことが明らかになりました。これらの絵文字を増強したリクエストに直面した際、モデルは幅広い挙動を示しました。テストされたモデルの一つであるQwen 2 7Bは、使用された絵文字に関わらず、有害なコンテンツの生成を完全に拒否し、抵抗力を示しました。別のモデルであるLlama 3 8Bは、少数のケースにおいて有害なリクエストをブロックすることに失敗しました。他の2つのモデル、Gemma 2 9BとMistral 7Bは、それよりも堅牢性が低く、試みの10パーセントにおいて有害なコンテンツの生成を許してしまいました。この差異は、モデルの安全性を維持する能力は固定された特性ではなく、入力がどのように提示されるかに大きく依存することを示唆しています。また、本研究では、モデルが有害なコンテンツを生成しなかった場合でも、曖昧な、あるいは部分的にしか役に立たない応答をすることが多く、これは絵文字が明確な拒絶ではなく混乱を引き起こしたことを示しています。

研究者は、モデル間の違いが単なる偶然ではないことを確認するために、統計的手法を用いてこれらの結果を分析しました。データは明確なパターンを示していました。すなわち、モデルがどのように安全性を扱うかは、質問の形式に依存するということです。入力に絵文字が含まれている場合、モデルは標準的なテキストの場合とは異なる挙動を示しました。一部のモデルは、絵文字のシーケンスを危険なリクエストとしてではなく、不明瞭または不完全なリクエストとして解釈し、また他のモデルは、安全ルールを無視するように騙されました。このことは、テキストベースの質問にほぼ全面的に依存している現在のAI安全性の評価手法が、これらのシステムを欺くことができる全範囲の手段を捉えきれていない可能性があることを示唆しています。もし安全性の評価が、絵文字やその他の非テキスト記号がいかにリクエストの意味を変えるかを考慮に入れなければ、これらのモデルがどの程度保護されているかについて、誤った安心感を与えてしまう可能性があります。

結局のところ、この研究は人工知能のテストにおける特定の脆弱性を浮き彫りにしています。この研究は、絵文字がすべてのAIの安全性を壊す魔法の鍵であると主張しているわけでも、これらのモデルが根本的に壊れていると示唆しているわけでもありません。むしろ、安全性は入力の形状に対して敏感であることを指摘しています。標準的な鍵には完璧に機能するが、わずかに異なる形状の鍵には失敗するロックのように、これらのモデルは、意味を持つものの言葉とは異なって見える記号が含まれる入力に対して、ブラインドスポット(死角)を持っているようです。これらの知見は、人間のコミュニケーションが新しい記号や形式とともに進化し続ける中で、AIの安全性を確保するために用いる手法も、効果的であり続けるために共に進化しなければならないということを思い出させてくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →