Better Call Graphs: A New Dataset of Function Call Graphs for Malware Classification
本論文では、既存の古く冗長なデータセットの限界を克服し、より信頼性が高く多様なマルウェア分類を可能にするために設計された、最新のAndroidアプリケーションから抽出された一意かつ大規模な関数コールグラフの包括的かつ公開されたデータセットである「Better Call Graphs (BCG)」を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
デジタル世界において、モバイルアプリケーションは単なるコードの集まりではありません。それらは、スマートフォンに何をすべきかを指示する、複雑な命令のネットワークなのです。アプリがどのように振る舞うかを理解するために、セキュリティ研究者はしばしば、その「関数呼び出しグラフ(function call graph)」に着目します。これを、ある都市の地図に例えてみましょう。そこでは、すべての建物がアプリが実行できる特定のタスクであり、それらを結ぶ道路は、どのタスクが他のタスクを誘発するかを示しています。この地図はアプリの真の構造と振る舞いを明らかにするものであり、アプリの名前を見たり、表面的な詳細をいくつか確認したりすることよりも、問題の兆候を察知する上で遥かに信頼性が高いものです。このアプローチが極めて重要である理由は、悪意のあるソフトウェア、すなわちマルウェアを作成する悪意ある主体が、コードに微細で表面的な変更を加えることで、自らの工作を隠蔽しようとすることが多いからです。これらの変更は、特定のテキストパターンを探す単純なスキャナーを欺くことができますが、アプリが実際にどのように機能するかという根本的な地図を書き換えることは滅多にありません。長年、モバイルセキュリティの分野はこれらの地図を用いて脅威を捕らえてきましたが、地図自体の品質が大きなボトルネックとなってきました。
長い間、より優れた検知システムを構築しようとする研究者たちは、時代遅れであったり欠陥があったりする地図を用いてきました。既存のこれら多くのアプリの地図コレクションの多くは、モバイルアプリがもっと単純だった時代を反映した、数十年も前のソフトウェアから構築されていました。さらに、これらの古いコレクションには、名前をわずかに変えただけで内部構造は全く同じである、同一のアプリのコピーが多数含まれていました。これは偽りの安心感を生み出しました。これらの反復的な地図で学習した機械学習モデルは、テストにおいて非常に高いスコアを記録しましたが、それはモデルが賢かったからではなく、単に重複したデータを暗記していたためでした。新しい現代的なアプリに直面したとき、これらのモデルはしばло完全に失敗しました。モバイルエコシステムの急速な進化により、今日の脅威は過去のものとは構造的に異なっており、それらを研究するためのツールにも深刻なアップデートが必要でした。
この問題を解決するために、バッファロー大学の研究チームは、「Better Call Graphs」と呼ばれる、より包括的なアプリの地図の新しいコレクションを作成しました。このデータセットは、単に以前のものを大型化したものではありません。これは、最新のソフトウェアを使用してゼロから構築された、根本的に異なるリソースです。チームは主要な公開リポジトリから12万5,000件以上のアプリケーションファイルを収集し、最終的に約1万件のユニークな例へと絞り込みました。彼らは品質に対して厳格でした。複雑な振る舞いを含むには小さすぎるアプリは排除し、現代的な妥当性を確保するために2017年以前にコンパイルされたソフトウェアはすべて取り除き、重複を厳格にチェックしました。また、ラベルが正確で信頼できるものであることを確実にするため、マルチエンジン検証システムを使用して、どのアプリが悪意のあるものであるかを確定させました。その結果、このデータセットは、無害なアプリと、トロイの木馬、アドウェア、ランサムウェアを含む様々な種類のマルウェアを含む、現代のモバイルソフトウェアの真の複雑さを捉えるものとなりました。
研究者がこの新しいデータセットを用いて標準的な検知手法をテストしたところ、結果は極めて鮮明かつ啓示的なものでした。古く馴染みのあるデータセットでは、最高の機械学習モデルが90パーセント近い精度を達成し、マルウェアの特定という課題がほぼ解決されたかのように見えました。しかし、これらと同じモデルを新しい「Better Call Graphs」データセットに適用したところ、その性能は急落しました。精度は約77パーセントに低下し、より重要な成功指標であるマクロF1スコアは、90パーセント近くからわずか18パーセントへと落ち込みました。この劇的な低下は、モデルの失敗ではなく、むしろ古いデータセットが誤解を招くものであったことの証明でした。モデルは過去の反復的なパターンに過学習(オーバーフィッティング)しており、現代のアプリの真の複雑さに直面したとき、汎化することが困難になったのです。この新しいデータセットは、現在のテクノロジーと現代のモバイル脅威の現実との間にある、深刻なギャップを露呈させました。
この研究では、検知の難易度が時間の経過とともにどのように変化するかについても調査が行われました。研究者が古いアプリでモデルを学習させ、新しいアプリでテストしたところ、性能はさらに低下しました。これは、モバイルマルウェアの景観が急速に変化していることを裏付けています。「コンセプトドリフト(概念漂流)」として知られるこの現象は、5年前のデータで学習したモデルは今日では効果的ではない可能性が高いことを意味します。新しいデータセットには、アプリのサイズ、要求される権限、使用される特定のライブラリなど、アプリに関する詳細な情報も含まれており、ソフトウェアをより包括的な視点から捉えることを可能にしています。これらの豊かな詳細情報があるにもかかわらず、最も高度なグラフベースのモデルでさえ、新しいデータセット内の異なる種類のマルウェアファミリーを区別することに苦戦しました。これは、現代の異なる種類の脅威間の構造的な類似性が、これまで考えられていたよりもはるかに強いことを示唆しています。
結局のところ、この研究はモバイルセキュリティ分野に対する必要な「現実への引き戻し」として機能します。クリーンで、現代的で、冗長性のないアプリの地図のコレクションを提供することで、研究者たちは、検知システムを評価するための新しい基準を確立しました。これまでの研究で報告されていた高い成功率は、多くの場合、時代遅れで反復的なデータによって作り出された錯覚であったことを、今回の知見は示唆しています。今後の進むべき道は、簡略化された歴史的なバージョンの問題に対してのみ機能する手法に頼るのではなく、現代のアプリケーションの真の複雑さを扱うことができる新しい技術を開発することです。このデータセットは現在、一般に公開されており、将来の研究のための厳格なテストベッドを提供するとともに、次世代のセキュリティツールが、反復ではなく真実に基づいた基盤の上に築かれることを保証しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。