← 최신 논문
💻 computer science

From Runnable to Verifiable: An Independent Reproducibility Study of LLM/Agent-Driven Vulnerability Validation Artifacts

이 사전 등록된 재현성 연구는 LLM/에이전트 주도 취약점 아티팩트의 절반 이상이 공개적으로 이용 가능함에도 불구하고, 대부분이 안정적으로 실행되지 않거나 의미론적으로 확인된 결과를 생성하지 못하며, 이는 일관되지 않은 식별자와 신뢰할 수 없는 자동화된 오라클로 인해 실행 가능한 코드와 검증 가능한 보안 증거 사이에 존재하는 결정적인 격차를 강조한다.

원저자: Bo Chen

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bo Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 거대한, 북적이는 도시라고 상상해 보세요. 여기서 소프트웨어 프로그램은 건물입니다. 때때로 이 건물들의 기초에는 숨겨진 균열이 있는데, 이를 "취약점(vulnerabilities)" 또는 "버그(bugs)"라고 부릅니다. 오랫동안 보안 연구원들(도시의 검사관들)은 이러한 균열을 찾아내고 어떻게 침입하고 고칠 수 있는지에 대한 상세한 보고서를 작성해 왔습니다. 하지만 최근, 새로운 종류의 검사관이 도착했습니다. 바로 인공지능, 구체적으로는 "대규모 언어 모델(LLMs)" 또는 "에이전트(Agents)"입니다. 이들은 매우 똑똑한 컴퓨터 프로그램으로, 코드를 읽고, 균열을 찾아내며, 심지어 자신만의 "개념 증명(PoC)" 스크립트—즉, 자물쇠가 고장 났음을 증명하는 작은 디지털 열쇠—를 직접 작성할 수도 있습니다.

모두가 던지는 큰 질문은 이것입니다. 우리는 이 AI 검사관들을 신뢰할 수 있을까요? AI가 "균열을 찾았고 여기 열쇠가 있습니다"라고 말할 때, 그것은 정말 사실일까요, 아니면 AI가 그저 추측하고 있는 것일까요? 과학의 세계에는 어떤 것이 사용 가능하다(파일을 다운로드할 수 있음), 실행 가능하다(실제로 시작됨), 그리고 검증되었다(주장하는 바를 실제로 수행함)라는 차이가 있습니다. 이 연구는 연구자들이 단순히 AI의 말을 믿는 것에 그치지 않고, 직접 실험실로 들어가 생성된 모든 열쇠를 실행해 보고 실제로 문이 열리는지 확인한, 거대하고 계획적인 감사와 같습니다. 그들은 AI가 숙련된 열쇠 기술자인지, 아니면 그저 자신만만한 위조꾼인지 확인하고 싶었습니다.


위대한 AI 열쇠 감사: 현실 점검

이 연구에서 연구자들은 회의적인 탐정 팀 역할을 했습니다. 그들은 저자들이 AI를 사용하여 소프트웨어 취약점을 찾고 검증했다고 주장하는 2023년부터 2026년 사이의 104개 연구 논문 컬렉션을 수집했습니다. 이것을 거대한 "AI 탐정 보고서" 도서관이라고 생각하면 됩니다. 연구팀은 이 보고서들 중 얼마나 많은 것이 실제 이야기이고, 얼마나 많은 것이 허풍인지 알고 싶었습니다.

가용성의 미스터리
먼저, 그들은 "열쇠"(코드 파일)가 도서관에 존재하기는 하는지 확인했습니다. 104개의 논문 중 단 59개(약 57%)만이 실제로 작동하는 링크를 가지고 있었습니다. 나머지는 페이지가 누락된 책이나, 연결이 끊긴 링크, 혹은 디지털 에테르 속으로 사라져 버린 파일들과 같았습니다. 단지 논문에 "코드가 여기 있다"라고 적혀 있다고 해서 실제로 그 코드를 찾을 수 있다는 뜻은 아닙니다.

"실행 여부" 테스트
다음으로, 그들은 깨끗하고 새로운 컴퓨터에서 59개의 작동하는 열쇠들을 실행해 보았습니다. 이것은 새 엔진을 가진 자동차를 시동 거는 것과 같습니다. 충격적이게도, 테스트한 18개의 논문 중 단 10개(56%)만이 도움 없이 엔진을 걸 수 있었습니다. 실행 중에 문제가 생겼을 때, 그들은 누락된 도구를 설치하거나 사소한 설정을 수정하는 "환경 복구"를 시도했지만, 실제 "자물쇠 따기" 코드는 변경하지 않았습니다. 이러한 도움에도 불구하고, 18개 중 11개(61%)만이 임무를 완수할 수 있었습니다. 대부분의 실패는 지침이 누락되었거나 실행 중인 컴퓨터와 일치하지 않는 도구들 때문이었습니다.

"가짜 경보" 문제
여기서 정말 흥elle 흥미로운 부분이 나옵니다. 연구자들은 많은 AI 생성 스크립트들이 실제로는 버그를 찾지 못했음에도 불구하고 "버그를 찾았다!"라고 소리치고 있다는 것을 발견했습니다. 그들은 이를 "신호 생성(signal-producing)" 실패라고 부릅니다.

  • 불일치: 102개 사례 중 58개(57%)에서 스크립트 내부의 비밀 라벨이 폴더의 라벨과 일치하지 않는 현상이 발견되었습니다. 이는 마치 탐정이 "은행 강도"에 대한 보고서를 쓰고 있지만, 실제로는 "장난감 가게"를 털고 있는 것과 같습니다. AI가 완전히 엉뚱한 것을 테스트하고 있었던 것입니다.
  • 고장 난 경보: 실제로 스크ende를 실행했을 때, "경보"(버그를 찾았다고 알리는 신호)는 종종 신뢰할 수 없었습니다. 연구자들은 소프트웨어가 패치된(수정된) 버전에서도 경보가 울리는지 확인함으로써 이를 테스트했습니다. 만약 수정된 버전에서도 경보가 울린다면 그것은 가짜 경보였습니다.
    • 그들은 30개 사례 중 20개(67%)가 버그가 수정된 후에도 여전히 경보를 발생시킨다는 것을 발견했습니다.
    • "민감도"(실제 버그를 잡아내는 능력)는 60%였고, "특이도"(가짜 버그를 무시하는 능력)는 형편없는 45%였습니다. 이는 AI의 내장된 경보 시스템이 기본적으로 추측하고 있으며, 거의 절반의 경우에 틀리고 있음을 의미합니다.

"골드 스탠다드(Gold Standard)" 체크
버그가 진짜임을 진정으로 확신하려면 세 가지가 필요합니다:

  1. 스크립트가 실행되어야 한다.
  2. 스크립트가 주장하는 특정 충돌이나 오류를 일으켜야 한다.
  3. 소프트웨어가 수정된 버전에서는 동일한 오류를 일으키지 않아야 한다.

연구자들이 이 엄격한 "골드 스탠다드"(그들이 E1 증거라고 부르는 것)를 적용했을 때, 결과는 극명했습니다. 신호를 생성한 모든 사례 중에서 이 세 가지 기준을 모두 충족한 것은 전체 그룹 중 단 2개뿐이었습니다. 나머지는 실행이 불가능하거나, 엉뚱한 것을 테스트하고 있거나, 혹은 아무 이유 없이 경보를 울리고 있었습니다.

결론

이 연구는 마법의 탄환을 찾아낸 것이 아니라, 많은 고장 난 손전등을 찾아냈습니다. 주요 시사점은 AI가 스크립트를 생성하여 "실행되고" "무서운 메시지를 출력한다"고 해서, 그것이 실제로 진짜 취약점을 찾아냈다는 의미는 아니라는 것입니다.

연구자들은 "실행되고 무서워 보인다"는 것과 "실제로 버그를 재현한다"는 것 사이에 거대한 간극이 있음을 발견했습니다. 그들은 다음과 같은 사실을 발견했습니다:

  • 절반 이상의 스크립트가 완전히 다른 취약점을 테스트하고 있었습니다.
  • 대부분의 스크립트는 도움 없이 실행되는 데 실패했습니다.
  • 버그를 찾는다고 주장한 스크립트의 3분의 2는 수정된 컴퓨터에서도 경보가 울렸을 가짜 경보였습니다.

저자는 AI가 이 일을 할 수 없다고 말하는 것이 아니라, 보안 커뮤니티에 경고하고 있습니다: AI의 자체 경보 시스템을 믿지 마십시오. 버그가 진짜인지 알고 싶다면, 특히 소프트웨어가 수정되었을 때 버그가 사라지는지 테스트함으로써 당신 스스로 작업을 확인해야 합니다. 그때까지, 이러한 많은 "AI 발견"은 그저 디지털 연기와 거울(속임수)일 뿐일지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →