← 最新の論文
🤖 AI

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

本論文は、バイナリコードにおけるエージェンティックなリバースエンジニアリング能力を評価するための、初の実用的かつコンタミネーションのないベンチマークであるSRE-Benchを紹介するものであり、未見の保護されたバイナリを解析するという特有の課題により、最強の最先端LLMであっても人間レベルの性能に達することに苦慮していることを明らかにしている。

原著者: Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、謎を解こうとしている探偵だと想像してください。通常、あなたが犯罪を捜査する際、容疑者の日記や手書きのメモ、あるいはメールを読むことができます。これは、コンピュータに何をすべきかを伝える、人間が読めるオリジナルの指示書である「ソースコード」を見ているようなものです。しかし、現実世界のサイバーセキュリティの世界では、悪党たちは日記を公開された場所に置いていくことはありません。彼らは、外側に指示書が一切付いていない、鍵のかかった封印された箱をあなたに手渡してきます。これが「バイナリ」です。バイナリとは、人間には意味不明な文字列に見える、生のコンピュータバイトで作られたファイルのことです。その中に何が入っているのかを知るためには、「リバースエンジニアリング」を行う必要があります。つまり、箱を一つずつ分解して、鍵の仕組みや中身がどうなっているのかを推測しなければならないのです。

さて、ここで、私たちは非常に賢いAI探偵(「AIエージェント」と呼ばれます)を構築したと想像してください。彼らは日記を読むことに長けており、テキストの中から嘘を見つけたり、手がかりを見つけ出したりするのが人間よりも速いです。しかし、このAI探偵たちは、あの鍵のかかった箱を解読できるのでしょうか? これが大きな疑問です。もしAIが日記を読むことはできても、箱を開けることができないのであれば、それは真のサイバーセキュリティのヒーローとは言えません。私たちは、これらのデジタル探偵が、実際にリバースエンジニアリングという困難な作業を行えるのか、それとも単に学習データで見たパターンに頼っているだけなのかを知る必要があります。

この論文は、その真相を突き止めるための、全く新しい、極めて困難なテストである「SRE-Bench」を紹介します。研究者たちは、AIが一度も見たことがない19個の独自の、複雑なビデオゲームやセキュリティシステムを作るかのように、19個の完全に新しい、秘密のプログラムを一から作り上げました。そして、それらのプログラムを44種類の高度なセキュリティガード(難読化技術)で封印し、解読を極めて困難にしました。彼らは、2026年の評価におけるGPT-5.6-solやClaude-Opus-5といった将来のバージョンを含む、世界で最もスマートな5つのAIモデルを、これらの鍵のかかった箱に対してテストしました。

結果は、警鐘を鳴らすものでした。この研究における最強のAIであるGPT-5.6-solでさえ、ケースの約31.5%(262インスタンスのうち80個で満点を獲得)を完全に解決できたに過ぎませんでした。他のAIはさらに成績が悪く、一つも解決できなかったものもありました。この研究により、AIエージェントは人間のエキスパートとは大きく異なる挙動を示すことが判明しました。人間はコードの最適化(コードを効率的だが乱雑にするもの)のような課題に苦戦しますが、AIはそれらの障害にはほとんど気づきませんでした。代わりに、AIはコード内の名前やラベルを見ることに大きく依存していました。研究者がそれらの名前を剥ぎ取ると、AIのパフォーマンスは崩壊しました。最も重要なことは、ソースコードを読むのが得意であることが、バイナリを解読するのが得意であることを意味しない、ということをこの研究が証明している点です。「鍵のかかった箱」は依然として巨大で未解決の課題であり、SRE-Benchは、私たちが解決に向けて実際にどの程度まで到達しているかを測定するための、最初の現実的で公平なテストなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →