← 最新の論文
🤖 machine learning

DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance

本論文は、動的なリクエスト固有の禁止事項を遵守しつつ一般的な有用性を維持するようにモデルを訓練するために、同一の重みを持つ2つの教師(一方は禁止コンテキストあり、もう一方はなし)間のトークンごとの不一致を活用してクリーンな監督信号を生成する、トークン選択型のオンポリシー蒸留手法であるDUETを提案している。

原著者: Zihan Li, Feifei Li, Wenhui Que

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Zihan Li, Feifei Li, Wenhui Que

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、人間のようなテキストを生成し、問題を解決し、質問に答えることができる、多くの現代的なデジタルアシスタントのエンジンとなっています。しかし、現実世界において、これらのモデルは多くの場合、脳にハードコードされているのではなく、使用される瞬間に指示として注入される、厳格で変化するルールに基づいて動作しています。ある企業はモデルに対して内部ツールを絶対に明かさないよう指示するかもしれませんし、ある病院は患者の名前を決して出さないよう要求するかもしれません。これらのルールは、誰が問いかけているか、そしてどのような状況かによって変化します。開発者の課題は、無害な質問への回答を拒否してしまうほど慎重になりすぎたり、あるいはルールをうっかり破ってしまうほど自信過剰になったりすることなく、これらの特定の、一時的な禁止事項に従うようモデルに教えることです。もしモデルがこれらの指示に従えなかった場合、データの流出やブランドの安全性に関する問題につながる可能性があります。一方で、話すことを恐れすぎてしまえば、そのモデルは役に立たないものになってしまいます。

テンセントの研究者たちは、モデルに実行時のルールに従うよう教えるというこの特定の問題を解決するために、「DUET」と呼ばれる新しい手法を開発しました。モデルを一から再学習させたり、単に良質な回答と不適切な回答の例を見せたりする代わりに、彼らは「一対の同一の双子」のように機能するシステムを作り上げました。一方の双子は指示の中に禁止されたルールを見ていますが、もう一方の双子は、全く同じ知識と能力を持ちながら、そのルールを見ていません。これら二人の「教師」はそれ以外は同一であるため、彼らの発言の差は、その特定のルールの有無のみによって引き起こされるはずです。研究者たちは、この意見の相違を利用して、モデルがどこで間違いを犯す可能性が高いかを正確に特定します。

このプロセスは、学生モデルが回答を生成する間、両方の教師の双子がそれを見守ることで機能します。二人の教師が次に続くべき単語について一致した場合、システムはその部分を安全で重要ではないと判断し、無視します。しかし、教師たちが意見を異にする場合、つまり一方が秘密を漏らす単語を提案し、もう一方が安全な代替案を提案する場合、システムはその瞬間を重要な学習機会としてフラグを立てます。これにより、学生モデルは、ルールが実際に重要となるわずかな単語だけに注意を集中させることができ、何千もの全く問題のない単語に対して努力を浪費することがなくなります。そして、学生モデルは、ルールを無視する方の教師から優しく遠ざけられ、ルールを遵守する方の教師へと引き寄せられることで、実用性と遵守の境界線をナビゲートする方法を効果的に学習していきます。

このアプローチは、会話全体を用いてモデルを訓練していた古い手法の欠点を解消しています。それらの古いシステムでは、長い回答の中にたった一つの間違いがあったとしても、回答全体が悪かったとみなされることが多く、どの単語が問題であったのかについてモデルを混乱させていました。違反が発生した正確なトークン(単語の単位)に相違を分離することで、この新手法はより明確なシグナルを提供します。研究者たちは、個人情報の保護、安全ガイドラインの遵守、ビジネスツールの定義への適応など、さまざまなタスクでこれをテストしました。その結果、このデュアルティーチャー(二人の教師)方式で訓練されたモデルは、ルールを破る要求を拒絶しつつ、正当な質問に対しては依然として有用であり続けるという点で、大幅に優れた性能を示すことがわかりました。

結果として、この新手法は、15億パラメータの小型モデルから80億パラメータの大型モデルに至るまで、異なるサイズのモデルにおいて既存の技術を凌駕しました。テストにおいて、モデルは違反要求に対して72%から85%以上の遵守率を達成し、つまりルールを破ることをうまく拒否できた一方で、通常の質問に対する有用性も88%から93%の間を維持し、高いレベルで回答能力を保ちました。決定的なことに、モデルは一般的な知能を失うことはなく、数学や論理パズルの問題においても以前と同様に優れた能力を維持していました。この研究は、二つの同一のモデルを使用してルールが重要となる正確な箇所を見つけ出すことで、開発者は膨大な量の新しいデータを必要としたり核となる能力を失ったりすることなく、安全かつ有用なAIアシスタントを作成できることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →