← 최신 논문
🤖 AI

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

이 논문은 바이너리 코드에 대한 에이전트 기반 역공학 능력을 평가하기 위한 최초의 현실적이고 오염 없는 벤치마크인 SRE-Bench를 소개하며, 가장 강력한 최첨단 LLM들조차 미지의 보호된 바이너리를 분석하는 독특한 과제들로 인해 인간 수준의 성능을 따라잡는 데 어려움을 겪고 있음을 밝힌다.

원저자: Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

게시일 2026-08-13
📖 2 분 읽기☕ 가벼운 읽기

원저자: Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀려는 탐정이라고 상상해 보십시오. 보통 범죄를 조사할 때, 당신은 용의자의 일기, 손으로 쓴 메모, 그리고 이메일을 읽을 수 있습니다. 이것은 컴퓨터에게 무엇을 할지 알려주는 인간이 읽을 수 있는 원래의 지침인 소스 코드를 보는 것과 같습니다. 하지만 실제 사이버 보안의 세계에서 악당들은 그들의 일기를 공개된 장소에 남겨두지 않습니다. 그들은 대신 설명서가 붙어 있지 않은, 잠겨 있고 봉인된 상자를 당신에게 건넵니다. 이것이 바로 바이너리입니다. 인간에게는 외계어처럼 보이는 가공되지 않은 컴퓨터 바이트로 이루어진 파일이죠. 그 안에 무엇이 들어 있는지 알아내기 위해, 당신은 **역공학(리버스 엔지니어링)**을 수행해야 합니다. 즉, 상자를 조각조각 분해하여 자물쇠가 어떻게 작동하는지, 그리고 내용물이 무엇인지 추측해야 하는 것입니다.

이제, 우리는 일기를 읽는 데 탁월한 능력을 가진 초지능형 AI 탐정(AI 에이전트)들을 만들었다고 상상해 봅시다. 이들은 텍스트 속에서 거짓말을 찾아내고 단서를 찾는 데 인간보다 빠릅니다. 하지만 이 AI 탐정들이 잠긴 상자를 깨뜨릴 수 있을까요? 이것이 바로 핵심적인 질문입니다. 만약 AI가 일기는 읽을 수 있지만 상자는 열지 못한다면, 그것은 진정한 사이버 보안 영웅라고 할 수 없습니다. 우리는 이 디지털 탐정들이 실제로 역공학이라는 힘든 작업을 수행할 수 있는지, 아니면 단순히 훈련 데이터에서 본 패턴에 의존하고 있는 것인지를 알아내야 합니다.

이 논문은 이를 알아내기 위해 완전히 새롭고 매우 까다로운 테스트인 SRE-Bench를 소개합니다. 연구진은 AI가 한 번도 본 적 없는 19개의 독특하고 복잡한 비디오 게임 및 보안 시스템을 직접 제작하듯, 처음부터 완전히 새로운 19개의 비밀 프로그램을 만들어냈습니다. 그런 다음, 이 프로그램들을 파헤치기 매우 어렵도록 44가지 유형의 첨단 보안 요원(난독화 기술)으로 잠가버렸습니다. 연구진은 2026년 평가를 가정한 GPT-5.6-solClaude-Opus-5와 같은 미래 버전 모델을 포함하여, 세계에서 가장 똑똑한 5개의 AI 모델을 이 잠긴 상자들에 투입해 테스트했습니다.

결과는 경종을 울리는 것이었습니다. 이 연구에서 가장 강력했던 AI인 GPT-5.6-sol조차 전체 사례의 약 **31.5%**만을 완전히 해결하는 데 성공했습니다(262개 사례 중 80개에서 완벽한 점수를 획득). 다른 AI들은 훨씬 더 저조한 성적을 냈으며, 일부는 단 하나도 해결하지 못했습니다. 연구 결과, 이 AI 에이전트들은 인간 전문가와 매우 다르게 행동한다는 사실이 밝혀졌습니다. 인간은 코드 최적화(코드를 효율적이지만 지저분하게 만드는 작업)와 같은 문제로 고전하는 반면, AI는 이러한 장애물을 거의 인지하지 못했습니다. 대신, AI는 코드 내의 이름과 레이블을 보는 것에 크게 의존했습니다. 연구진이 이러한 이름들을 제거하자 AI의 성능은 폭락했습니다. 무엇보다도, 이 연구는 소스 코드를 잘 읽는 능력이 바이너리를 해독하는 능력과 같지 않다는 것을 증명합니다. "잠긴 상자"는 여전히 거대하고 해결되지 않은 과제로 남아 있으며, SRE-Bench는 우리가 이 문제를 해결하기까지 실제로 얼마나 떨어져 있는지를 측정하는 최초의 현실적이고 공정한 테스트입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →