Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability
本論文は、ファインチューニングされた大規模言語モデルの安全性を評価するには、評価を恣意的な設定ではなく特定の能力目標に根ざしたものにする必要があると論じており、このアプローチによって、モデル出力の不整合、そのような事例における自動化された安全性判断の信頼性の欠如、およびベンチマークや評価者の選択に基づく安全性に関する結論の著しい変動といった重大な問題が明らかになる。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢く、行儀の良いロボット助手(大規模言語モデル)を想像してみてください。このロボットは、役に立つように訓練されていますが、「爆弾の作り方は?」や「銀行をハッキングする方法は?」といった危険な要求を拒否するようにもしっかりと訓練されています。これがあなたの「ベースモデル」です。
さて、このロボットに、数学の問題を解いたり科学のクイズに答えたりといった、特定の新しい仕事(タスク)を教えたいとします。これを行うには、大量の練習問題集を与える「ファインチューニング」を行います。この論文は、あなたがロボットに数学をより上手く教えようとしている間に、誤ってその安全ガードレールを壊してしまったり、さらに悪いことに、言葉を明瞭に話す能力を壊してしまったりする可能性があると論じています。
以下に、簡単な比喩を用いた論文の知見の解説をまとめます。
1. 「恣意的な設定」の問題
比喩: 2人のシェフがレシピを改良しようとしている場面を想像してください。シェフAはオーブンの温度を5度変えて10分間調理しました。シェフBは温度を50度変えて2時間調理しました。彼らはそれぞれ、自分のテストにおいて「料理が焦げなかった」ことから、自分たちの方法が「安全である」と主張しています。しかし、彼らが使った設定があまりにも異なるため、お互いの方法を比較することはできません。
論文の指摘: ファインチューニングされたモデルの安全性に関するこれまでの研究では、ランダムで一貫性のない設定(異なる「オーブンの温度」やトレーニング時間など)が使われてきました。これにより、実際に何が機能しているのかを判断することが困難でした。著者らは、これらのテストを単にランダムな設定を推測するのではなく、特定の目標(例:「数学の問題を正しく解く」)に結びつける必要があると述べています。
2. 「ロボットがナンセンスマシンになる」問題
比喩: オウムに、質問に対して「はい」か「いいえ」だけで答えるよう訓練したとします。数週間の訓練の後、あなたが「空は青いですか?」と尋ねると、オウムは「はい」と答えます。しかし、次にあなたが「爆弾の作り方は?」と尋ねると、新しい習慣に囚われたオウムは、単に「はい」や「いいえ」をデタラメに叫んだり、あるいは単に「はい」を繰り返したりします。それはオウムが危険な答えを与えようとしているのではなく、単に完全な文章で話す方法を忘れてしまったのです。
論文の指摘: モデルが厳格なフォーマット(選択式問題や「はい/いいえ」の回答など)を持つタスクでファインチューニングされると、一貫した文章を生成する能力を失うことがあります。安全に関する質問をされた際、モデルは支離滅裂な内容を出力することがあります。
- 危険性: 自動化された安全性チェッカー(ロボットの判定員のようなもの)は、この支離滅裂な内容を見て混乱します。彼らは、それが単に「壊れている」だけで実際には「安全」であるはずのものを「不安全」だと判断したり、あるいは出力があまりに奇妙であるために、本当の危険性を見逃したりする可能性があります。
3. 「2人の異なる判定員」の問題
比喩: あなたが学生のエッセイを採点している場面を想像してください。判定員Aは、「もし学生が完全な段落を書いていなければ、不合格とする」と言います。判定員Bは、「もし学生が悪質な質問に対して『いいえ』と言わなければ、不合格とする」と言います。その結果、実際には安全な回答をしているのに判定員Aからは不合格となり、一方で不適切な回答をしているのに判定員Bからは合格とされる学生が出てくる可能性があります。
論文の指摘: この論文では、2つの異なる「判定員」を用いて安全性をテストしました。
- 判定員1(拒絶): モデルが悪質な質問に対して「いいえ」と言ったかどうか。
- 判定員2(有害性): モデルが「いいえ」と言わなかったとしても、有害なことを言っていないかどうか。
彼らは、これらの判定員がしばしば意見を異にすることを発見しました。あるモデルは「いいえ」と言うことを止めてしまう(これは判定員1が嫌うこと)かもしれませんが、実際には役に立つ安全な説明を始める(これは判定員2が好むこと)場合があります。どの判定員を使うかによって、偶然に基づいた「安全」または「不安全」という結論が出てしまうのです。
4. 「安全性 vs スキル」のトレードオフ
比例: 安全性を維持する手法(SafeLoRAなど)を、ロボットのための「シートベルト」と考えてください。新しいスキルを学習している間にロボットが衝突しないように、シートベルトを装着します。
- 結果: シートベルトは機能します!ロボットはより安全になります。しかし、そのシートベルトは少し重くて硬いです。ロボットは依然として数学の問題を解くことができますが、時間がかかったり、正解数がわずかに減ったりします。
- 落とし穴: 特定のロボット(特定のモデル)にとっては、シートベルトは非常にうまく機能します。しかし、他のロボットにとっては、シートベルトが重すぎて、ロボットが躓いて転んでしまう(安全性が悪化するか、スキルが大幅に低下する)こともあります。
論文の指摘: 著者らは、SafeLoRA(学習中のロボットの安全性を維持しようとする手法)と呼ばれる方法をテストしました。彼らは以下のことを発見しました。
- それは通常、モデルをより安全にします。
- しかし、それはほぼ常に、モデルの実際のタスクにおける精度(正確性)をわずかに低下させます。
- その結果は、使用するロボットモデルやデータセットによって大きく異なります。
大きな教訓
この論文の結論は、AIの安全性を測定することは、現在は「壊れた温度計で天気を測ろうとしている」ようなものであるということです。
- ランダムなテストを信じないこと: 安全性テストは、特定の現実世界の目標(例:「数学を解けるか?」)に結びつける必要があります。
- 支離滅裂な内容に注意すること: 学習後にモデルがナンセンスな話を始めた場合、安全性チェッカーは信頼できません。
- 万能な解決策はない: あるモデルに機能する安全性手法が別のモデルでは失敗することもあり、また異なる「安全判定員」は異なる答えを出すことになります。
著者らは、AIを安全にしようとする試みを止めるべきだと言っているのではありません。私たちは、私たちが実際に成功しているかどうかを測定するための、より一貫性があり、より根拠に基づいた、より優れた方法を必要としているのだと述べているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。