← 最新の論文
💬 NLP

HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

HaloGuard 1.0は、より大規模なベースラインと比較して大幅に小さいモデルサイズ(0.8B〜4Bパラメータ)でありながら、構造化された46項目のポリシーからなる憲法と合成反事実データを活用することで、偽陽性と偽陰性の両方を最小限に抑え、最先端の多言語AI安全性性能を実現するオープンウェイトの憲法に基づく分類器です。

原著者: Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

公開日 2026-07-03
📖 1 分で読めます☕ さくっと読める

原著者: Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢く、非常に役に立つロボットアシスタントを構築していると想像してください。そのロボットには、質問に答えたり、コードを書いたり、人々を助けたりしてほしいと考えています。しかし同時に、人々がロボットを騙して、爆弾を作らせたり、銀行をハッキングさせたりといった危険なことをさせようとする可能性があることも分かっています。

通常、あなたはロボットの前に「セキュリティガード(警備員)」を配置し、メッセージが通過する前にすべてチェックさせます。しかし問題は、これらのガードはしばしば不器用すぎるという点です。彼らは「爆弾」という言葉を見つけると、それに関連するすべてをブロックしてしまいます。たとえそれが、爆発物に関する歴史の授業であったり、悪役が登場する物語であったとしてもです。これは「過剰拒絶(over-refusal)」と呼ばれます。ガードが危険を恐れるあまり、役に立つ人々まで止めてしまう現象です。

HaloGuard 1.0 は、まさにこの問題を解決するために設計された、よりスマートなセキュリティガードです。以下に、その仕組みを簡単な比喩を用いて説明します。

1. 「憲法」はルールブックである

ほとんどのセキュリティガードは、単に「悪い言葉(例:爆弾、殺す、盗む)」のリストを持っています。それらの言葉を使うと、ブロックされます。
HaloGuardは異なります。それは**「憲法」**に基づいて構築されました。これは、平易な英語で書かれた詳細な46ページのルールブックのようなものです。単に悪い言葉を列挙するのではなく、その背後にある「意図」を説明します。

  • 従来の方法: 「『塩素ガス』と言ったら禁止」
  • HaloGuardの方法: 「人を傷つけるために『塩素ガスの作り方』を聞くのは禁止。しかし、『歴史の中で塩素ガスがどのように使われたか』や『安全に検知する方法』を聞くのは許可」

このルールブックには、3,000近い非常に細かい副則があります。これにより、ガードは単に「どの言葉を使ったか」ではなく、「なぜそれを聞いているのか」を見るように学習します。

2. 「鏡」のトレーニング(対照的なペアによる学習)

このニュアンスを教えるために、開発者は単に悪い例を見せただけではありません。彼らは**「対照的なペア(Paired Counterfactuals)」**という巧妙なトレーニング手法を用いました。

ガードが、2つのメッセージを並べて見るトレーニングを想像してください。

  • メッセージA(悪い例): 「お金を盗むための偽造IDの作り方は?」
  • メッセージB(良い例): 「映画の小道具用の偽造IDの作り方は?」

両方のメッセージは、全く同じ恐ろしい言葉(「偽造ID」「盗む」)を使用しています。唯一の違いは、**「意図」**です。
HaloGuardは、これら何百万もの「鏡合わせのペア」を用いて学習しました。言葉自体が問題なのではなく、目的が問題であることを学んだのです。これにより、ガードが近道をして特定の語彙を使うすべての人をブロックしてしまうことを防いでいます。

3. バイアスなく46の言語を話す

古いガードは、よく知らない言語に対して混乱することがよくあります。アラビア語やヒンディー語のような、認識できないスクリプトを見ると、「これは怪しい、ブロックしろ!」と即座に判断してしまうことがあります。これは、スーツを着ている人だけを通し、カジュアルな服装の人を(たとえその人々が全く問題なくても)追い出してしまうクラブの用心棒のようなものです。

HaloGuardは、サポートしている46の言語すべてを平等に扱います。ヒンディー語における「悪い」リクエストは、英語における「悪い」リクエストと同じように悪質であり、ヒンディー語における「良い」リクエストは、英語における「良い」リクエストと同じくらい安全であることを学習しました。言語で判断するのではなく、メッセージの内容で判断するのです。

4. 2つの仕事のための2つのサイズ

チームは、セキュリティチームに2種類の警備員がいるように、2つのバージョンのガードをリリースしました。

  • 0.8B バージョン(スピード重視の門番): これは非常に小さく、超高速なモデルです。あらゆるアプリの「正面玄関」で動作します。誰の邪魔もすることなく、明らかな悪い内容を即座にチェックします。小型ですが驚くほど強力で、より大きな競合モデルを打ち負かしています。
  • 4B バージョン(専門の探偵): これは少し大きく、より思慮深いモデルです。もし「スピード重視の門番」がトリッキーなメッセージに対して確信が持てない場合、このモデルにパスすることができます。このバージョンは、より巧妙で隠れたトリックを見抜くことに長けており、高リスクな状況で使用されます。

5. 結果:大きいことよりも、賢いこと

論文は、HaloGuardがゲームチェンジャーである理由として、それが**「小さいが、より賢い」**からだと主張しています。

  • 既存の優れたガード(巨大で低速なもの)よりも30倍小さいです。
  • その小ささにもかかわらず、より大きなモデルよりも多くの悪いリクエストを検知し、より多くの良いリクエストを許可します。
  • 「境界線」、つまり危険なリクエストと安全な教育的リクエストの間のトリッキーな線を、見事に通り抜けます。

これが「行わない」こと(限界事項)

論文は、HaloGuardが**「何ではないか」**についても明確に述べています。

  • レスポンス(回答)のチェッカーではない: これはユーザーが入力した内容のみをチェックします。ユーザーが安全な質問をし、それに対してロボットが誤って危険な回答をしたとしても、HaloGuardはそれを検知できません。
  • ロボットのボディガードではない: 会話が始まった後に、ロボットがツール(銀行口座へのアクセスなど)を使用することを阻止するものではありません。あくまで第一防衛線です。
  • 完璧ではない: 論文では、特定の言語(インドや東南アジアの言語など)において、依然としてガードが慎重すぎて、安全なメッセージをブロックしすぎることがあると認めています。現在、これらを修正するために取り組んでいます。

まとめ

HaloGuard 1.0は、単なる「キーワードブロッカー」から「文脈の読解者」へと進化した、新しいタイプのAIセーフティフィルターです。詳細なルールブックと、完璧な「良 vs 悪」のペアを用いたトレーニングにより、悪党が武器について尋ねているのか、教師が武器について教えているのかを、極めて小さく、高速かつ正確に見分けることができます。これは、正当なユーザーにとっての利便性を損なうことなく、AIをより安全にするためのステップです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →