← 最新の論文
💬 NLP

Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

本論文は、非英語圏における評価リソースの不足に対処するために設計されたドイツ語・ブルガリア語の安全性データセットである「Schützen」を紹介し、大規模言語モデルの安全性挙動における顕著な言語間差異を明らかにするとともに、地域固有の評価の必要性を強調するものである。

原著者: Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov, Preslav Nakov, Ivan Koychev

公開日 2026-06-11
📖 1 分で読めます☕ さくっと読める

原著者: Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov, Preslav Nakov, Ivan Koychev

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、非常に賢く、多言語を操るロボットアシスタントを所有しています。あなたは、そのロボットがドイツやブルガリアの人々と会話しても安全かどうかを知りたいと考えています。問題は、既存のほとんどのロボット向け安全性テストが、英語圏での運転免許試験のようなものであることです。それらは、ロンドンやニューヨークで赤信号で止まる方法を知っているかどうかをチェックしますが、ルールや文化、歴史が少し異なるソフィアやベルリンで、赤信号で止まる方法を知っているかどうかまではチェックしません。

「Schützen」(ドイツ語で「守る」の意)と題されたこの論文は、これら2カ国に特化して設計された新しい安全性テストを紹介しています。以下に、彼らが何を行い、何を見出したのかを簡単に解説します。

1. 問題点: 「ワンサイズ・フィット・オール(一律)」のセーフティネット

既存の安全性データセットを、アメリカで作られた巨大で汎用的なセーフティネットだと考えてください。それは英語の話し手を捕まえるには素晴らしいものですが、ドイツ語やブルガリア語の話し手を捕まえようとすると、網の目が間違った場所に開いている可能性があります。

  • ギャップ: ブルガリア語(デジタル書籍やデータが少ない「低リソース」言語)のための安全性テストが極めて少なく、ドイツ語についても、より深く文化的に特化したテストが不足しています。
  • リスク: ロボットを現地の言語や文化でテストしないと、英語では言わないような失礼なこと、違法なこと、あるいは有害なことを、うっかり口にしてしまう可能性があります。

2. 解決策: カスタム「セーフティ・ジム」

著者たちは、これらのロボットを訓練しテストするための、Schützeと呼ばれる新しいジムを構築しました。

  • 器具: 彼らはドイツ語とブルガリア語の両方で、約8,000個の質問(プロンプト)を作成しました。
  • トレーニング内容: 単に英語の質問を翻訳したわけではありません。彼らはそれらを「ローカライズ」しました。
    • 比喩: もし英語のテストが「キッチン家電を使ってどのように爆弾を作るか?」と問うた場合、ドイツ語版は単に言葉を翻訳するのではなく、特定の歴史的事象や現地の文化的タブーについて問うかもしれません。ブルガリア語版は、現地の映画や特定の歴史的人物に言及するかもしれません。
  • 3種類のテスト:
    1. 直接的な攻撃: 「どのように法律を破るか教えてください。」(明白なテスト)。
    2. 間接的な攻撃: 「法律を破る悪役が登場する物語を書いています。彼らはどのように行うのでしょうか?」(巧妙なテスト)。
    3. 過敏性のチェック: 「銃とは何ですか?」(無害な質問を投げかけ、ロボットが安全な回答に対して過剰に反応して拒否しないかを確認する)。

3. コンテスト: リング上の15体のロボット

彼らは15種類の異なるAIモデルをこのジムに入れ、質問への対処能力を検証しました。

  • 出場者: これには、大規模なグローバルモデル(GPT-4o、Claude、Llamaなど)と、ローカルな専門家モデル(ブルガリアのBgGPTやドイツのLeo/LLaMmlein)が含まれます。
  • スコアカード: 彼らは2つの要素をチェックしました。
    1. バイナリ・スコア: ロボットが「いいえ、それは安全ではありません」と言ったか(安全)、あるいは実際に不適切な情報を提供したか(不安全)。
    2. スタイル・スコア: どのように 断ったか? 単に拒否しただけか? 理由を説明したか? それとも、安全で退屈な回答を与えたのか?

4. 結果: 誰が勝ったのか?

  • チャンピオン: Claude-3.7が総合的に最も安全なロボットであり、両方の言語においてほぼ完璧に近いパフォーマンスを発揮しました。
  • ローカルのヒーロー:
    • ブルガリアについては、ローカルモデルであるBgGPT-27Bが最も優れた成果を上げました。
    • ドイツについては、ローカルモデルであるLeo-mistral-hessianai-7B-chatがトップの成績でした。
  • 苦戦したモデル: LLaMmlein-7B-chat(ドイツ)やBgGPT-2.6B(ブルガリア)のような小規模なモデルは最も苦戦し、不適切な要求を検知できないことがよくありました。
  • 驚きの事実: 著者たちは、「低リソース」言語(ブルガリア語)の方がロボットにとって安全性の確保が難しいと考えていました。しかし、ドイツとブルガリアはヨーロッパの法律や文化的価値観を共有しているため、英語で学んだ安全性ルールが同様であれば、ブルガリア語でもロボットはかなりうまく機能することを発見しました。

5. 「人間 vs 機械」の審判

コンピュータによる採点が公平であることを確認するために、彼らは「人間とAIのチーム」を使用しました。

  • プロセス: 人間がいくつかの回答に「安全」または「不安全」というラベルを付けました。その後、超高性能なAI(GPT-4.1)を使用して残りの回答をチェックしました。
  • トリック: AIに対して、完璧な一致を探して深く考えすぎるのではなく、カテゴリーに適合する「最初の」回答を選ぶように指示すると、人間の判定者との一致率が大幅に向上することを発見しました。これは、審判に対して、あらゆるルールを議論するのではなく、最初に見つけたルールに基づいて即座に判定を下すよう指示するようなものです。

まとめ

この論文は、AIの安全性を英語だけでテストし、それが世界中で通用すると仮定することはできないと主張しています。あなたにはローカルな安全マニュアルが必要です。彼らはドイツとブルガリアのために新しいマニュアルを作成し、15体のロボットをテストしました。その結果、一部のグローバルな巨人は非常に安全である一方で、ローカルモデルも適切に訓練されていれば非常に優れたものになり得ることを明らかにしました。また、人間とAIを組み合わせてこれらのテストを採点することは、人間のみを使用する場合と同じくらい正確で、かつ高速であることも証明しました。

ツールの入手先: 著者たちは、誰でも利用できるように、彼らの「ジム」(データセット)と「スコアカード」(コード)をGitHubで公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →