Domain Agnostic Text Redaction from Natural Language Rules using Instruction Tuning
本論文は、指示チューニングされた言語モデルを活用し、ユーザー定義の自然言語ルールに基づいて機密情報を特定および秘匿するとともに、法的文書や医療文書のような極めて重要な用途における監査可能性と高精度を確保するために各アクションに対して透明性のある根拠を提示する、説明可能でドメインに依存しないテキスト編集フレームワークを提案するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代社会において、膨大な量の個人情報や企業情報が、医療記録から法的契約書、財務報告書に至るまで、単純なテキストとして存在しています。データがますますデジタル化されるにつれ、ある重大な課題が生じています。それは、機密情報をさらすことなく、いかにしてこれらの文書を共有または分析するかという点です。一般データ保護規則(GDPR)や医療保険の相互運用性と責任に関する法律(HIPAA)といった法律は、氏名、住所、あるいは特定の病状といった特定の詳細を、文書が安全な環境を離れる前に隠すことを求めています。従来、この「サニタイズ(無害化)」という作業は、電話番号や社会保障番号のような予測可能なパターンを探し出す、硬直的なコンピュータプログラムに依存してきました。これらの標準的な形式に対しては効果的ですが、こうしたツールは、契約書内の特定の条項や微妙な医学的診断のように、複雑で非構造的な文章の中に機密情報が現れた場合には、しばしば失敗します。さらに、これらの自動化ツールがテキストを隠す決定を下したとしても、その理由を説明することはほとんどなく、人間の監査人はその伏せ字(リダクション)の背後にある論理を推測するしかありません。
これを解決するために、Mphasis Limitedの研究チームは、テキストの伏せ字処理を単なる検索・置換タスクとしてではなく、一つの「推論問題」として扱う新しいアプローチを開発しました。あらゆる種類の機密データのルールをハードコーディングする代わりに、彼らは、人間が「何を隠すべきか」を自然な英語で記述できるシステムを作り上げました。例えば、ユーザーは単に「この財務報告書における特定のクライアント手数料に関する記述をすべて隠してください」や、「この法的合意書における土地区画の所在地に関する詳細をすべて削除してください」と述べることができます。その後、システムは大規模言語モデルを使用して、これらの自然言語による指示を一連の論理的なルールへと翻訳します。これらのルールは、文書を読み取り、文脈を理解し、どの単語やフレーズがユーザーの定義する機密事項に該当するかを正確に判断できる、より小さく効率的な言語モデルを訓練するために使用されます。極めて重要なのは、このシステムは単にテキストを黒塗りするだけではなく、削除されたすべての情報の箇所について、そのアクションをトリガーした特定のルールを引用しながら、書面による説明を生成するという点です。
研究者たちは、財務開示、クライアントエンゲージメントの詳細、医療記録を含む様々な種類の文書を用いて、この手法のテストを行いました。その結果、このシステムは、従来のツールが見逃してしまうような複雑な法的用語や特定のビジネス戦略などを正確に特定して伏せ字にする一方で、機密ではない情報はそのまま残すことができることが分かりました。システムの真の安全性を確保するため、彼らは強力な人工知能を用いて、周囲のテキストから隠された情報を推測しようとする厳格なテストを、伏せ字にされた文書に対して実施しました。システムは非常に高い耐性を示しました。AIは伏せ字にされた詳細を再構成することができず、これは機密情報が単に覆い隠されただけでなく、効果的に除去されていることを示しています。テストにおいて、モデルは要求された機密事例の95パーセント以上を正常に特定し、伏せ字にすることに成功しました。
この研究における主要な革新は、システムの訓練に合成データを使用している点です。研究者たちは、モデルに実際のプライベートな文書を読み込ませるのではなく、大規模言語モデルを使用して、現実世界のシナリオを模倣した数千の偽の文書を生成しました。これらの合成文書には、機密の内容と非機密の内容の両方が含まれており、さらに正しい伏せ字とその説明も付随していました。これにより、小さなモデルは、学習中に実在する個人のプライベートなデータに触れることなく、プライバシー・ルールについて推論する方法を学ぶことができました。その結果、柔軟性と透明性を兼ね備えたツールが誕生しました。このツールは、人間の指示に従うだけで、新しい種類の文書や新しい機密性の定義に即座に適応できます。すべての伏せ字に対して明確な自然言語による正当性を提示することで、このシステムは自動化された効率性と人間の説明責任の間の溝を埋め、理解しやすく、かつ効果的なプライバシー保護の方法を提供しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。