← 최신 논문
💻 computer science

CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability

본 논문은 희소한 CVE 메타데이터를 고품질의 실행 가능한 보안 작업으로 자동 변환하여 LiveCVEBench 벤치마크와 대규모 학습 데이터셋을 생성함으로써 코드 에이전트의 취약점 탐지 능력을 획기적으로 향상시키는 멀티 에이전트 프레임워크인 CVE-Factory 를 소개한다.

원저자: Xianzhen Luo, Jingyuan Zhang, Shiqi Zhou, Rain Huang, Chuan Xiao, Qingfu Zhu, Zhiyuan Ma, Xing Yue, Yang Yue, Wencong Zeng, Wanxiang Che

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xianzhen Luo, Jingyuan Zhang, Shiqi Zhou, Rain Huang, Chuan Xiao, Qingfu Zhu, Zhiyuan Ma, Xing Yue, Yang Yue, Wencong Zeng, Wanxiang Che

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수백만 개의 서로 다른 문에 고장 난 자물쇠를 수리하는 법을 새 로봇에게 가르치려는 보안 경비원이라고 상상해 보세요. 문제는 당신이 가진 유일한 지침이 "문 404 번이 고장 났다"라고만 적힌 작고 모호한 스티커 노트뿐이라는 점입니다. 자물쇠가 어떻게 고장 났는지, 문이 어떤 모습인지, 수리에 필요한 도구가 무엇인지에 대해서는 알려주지 않습니다.

이것이 현재 AI 보안 연구의 현실입니다. 우리는 취약점 목록 (CVE 라고 함) 을 가지고 있지만, 이는 그저 희박한 데이터 포인트일 뿐입니다. AI 에이전트들이 이를 수리하도록 훈련시키기 위해서는 완전한 "훈련 키트"가 필요합니다. 고장 난 문의 작동 모델, 고장을 증명하는 테스트, 그리고 검증된 해결책이 포함되어야 합니다.

CVE-Factory는 초효율적인 자동화 건설 팀과 같은 새로운 시스템입니다. 이 시스템은 그 작고 모호한 스티커 노트를 받아 로봇을 위한 완전하고 작동하는 훈련 키트를 즉시 구축합니다.

다음은 간단한 비유를 통해 작동 방식을 설명한 것입니다:

1. 문제: "모호한 스티커 노트"

현재 보안 전문가들은 이러한 훈련 키트를 수동으로 구축해야 합니다. 그들은 취약점 보고서를 읽고, 해당 소프트웨어를 찾아내며, 가짜 컴퓨터 환경을 설정하고, 고의로 고장 나게 만든 뒤, 그 고장을 포착하는 테스트를 작성하고, 마지막으로 수리 방법을 작성합니다.

  • 현실: 이는 전문가에게 문 하나당 10 시간 이상의 시간이 소요됩니다. 수천 개의 문을 위해 이를 수행하는 것은 너무 느리고 비용이 많이 듭니다.
  • 결과: AI 로봇들은 충분한 연습 자료가 부족하여 보안 분야에서 여전히 미숙합니다.

2. 해결책: "조립 라인" (CVE-Factory)

저자들은 CVE-Factory를 구축했는데, 이는 컨베이어 벨트가 있는 전문 공장과 같습니다. 한 사람이 전체 작업을 수행하는 대신, 이 시스템은 과정을 여섯 개의 명확한 스테이션으로 나누고, 각 스테이션은 전문화된 AI 에이전트가 운영합니다.

한 명의 정비사가 모든 것을 한 번에 하려고 하지 않는 하이테크 자동차 수리점이라고 생각하세요:

  • 스테이션 1: 탐정 (분석가)
    AI 는 모호한 스티커 노트를 읽고 웹 검색을 통해 설계도, 특정 자동차 모델, 그리고 고장 난 정확한 부품을 찾습니다. 그리고 명확한 "사건 파일"을 작성합니다.
  • 스테이션 2: 건축가 (생성기)
    이 사건 파일을 바탕으로 이 AI 는 로봇에게 지시를 작성합니다. "여기가 고장 난 문입니다. 여기가 고장을 증명하는 테스트입니다. 여기가 완벽한 수리 방법입니다."
  • 스테이션 3: 건설자 (빌더)
    이 AI 는 실제 환경을 구축합니다. 실제 소프트웨어와 정확히 일치하도록 "가짜 컴퓨터" (Docker 컨테이너 사용) 를 설정합니다. 중요한 점은 이 AI 가 해결책이나 테스트를 보지 않은 채로 이를 구축한다는 것입니다. 그래야 속임수를 쓸 수 없기 때문입니다. 이 AI 는 단지 장면을 구축할 뿐입니다.
  • 스테이션 4: 검사관 (검증자)
    아무도 수리를 시도하기 전에 이 에이전트가 확인합니다. "이 가짜 방에서 문이 실제로 고장 났는가? 테스트가 작동하는가?" 만약 방이 제대로 설정되지 않았다면, 이를 건설자에게 보내 다시 고치게 합니다.
  • 스테이션 5: 정비사 (해결사)
    이 에이전트는 지시를 사용하여 문을 수리해 봅니다. 패치를 적용하고 테스트를 실행합니다.
  • 스테이션 6: 품질 관리 책임자 (체커)
    최종 보스입니다. 이는 전체 종단 간 검사를 실행합니다. 수리가 실제로 작동했는가? 로봇이 실수로 다른 것을 고장 내지 않았는가? 테스트는 진짜인가, 아니면 로봇이 단순히 결과를 조작한 것인가?

비밀 재료: 어떤 스테이션에서든 문제가 발생하면 시스템은 그냥 포기하지 않습니다. "피드백 루프"가 있습니다. 검사관이 "문이 고장 나지 않았다"고 말하면, 이 시스템은 새로운 사람에게가 아니라 건설자에게 다시 보내 문 재건을 요청합니다. 이는 최종 산물의 품질이 높음을 보장합니다.

3. 결과: 전문가 수준의 속도

이 팀은 이미 215 개의 훈련 키트를 구축한 인간 전문가들을 상대로 이 공장을 테스트했습니다.

  • 정확도: 공장의 키트는 인간 전문가의 키트보다 95% 수준으로 뛰어났습니다.
  • 속도: 인간은 키트 하나당 5~24 시간이 소요됩니다. 공장은 약 48 분이 걸립니다.
  • 규모: 20 명의 작업자가 동시에 가동할 때, 공장은 215 개의 키트를 5 시간 이내에 모두 구축했습니다. 인간 팀이라면 몇 주가 걸렸을 것입니다.

4. 새로운 놀이터: LiveCVEBench

공장이 매우 빠르기 때문에, 저자들은 215 개에서 멈추지 않았습니다. 그들은 LiveCVEBench라는 새로운, 지속적으로 업데이트되는 놀이터를 구축했습니다.

  • 이는 190 개의 실제 세계 보안 작업을 포함합니다.
  • 14 가지 다른 프로그래밍 언어 (Python 뿐만이 아님) 를 다룹니다.
  • AI 도구 자체의 취약점과 같은 신흥 위협을 포함합니다.
  • 과거의 벤치마크가 고정된 시점에 머무는 것과 달리, 새로운 취약점이 발견됨에 따라 자동으로 업데이트됩니다.

5. 로봇 훈련

마지막으로, 그들은 이 공장을 사용하여 AI 모델 (Qwen3-32B) 을 가르치기 위한 1,000 개 이상의 훈련 작업을 생성했습니다.

  • 훈련 전: AI 는 보안 작업의 **5.3%**만 해결할 수 있었습니다.
  • 훈련 후: 이는 **35.8%**로 급증하여 훨씬 더 크고 비싼 모델들을 능가했습니다.
  • 보너스: 학습한 기술은 보안뿐만이 아니었습니다. 일반적인 코딩 작업에서도 더 나아졌습니다.

요약

CVE-Factory는 고품질 보안 훈련 데이터의 생성을 자동화하는 다중 에이전트 시스템입니다. 희박하고 지루한 취약점 보고서를 AI 에이전트를 위한 완전한 상호작용형 "탈출 게임" 스타일의 도전 과제로 변환합니다. 이는 복잡한 작업을 더 작고 전문화된 단계로 나누고 AI 에이전트들이 협력하게 함으로써, 인간이 결코 따라잡을 수 없는 규모와 속도로 전문가 수준의 훈련 데이터를 생성할 수 있음을 입증합니다. 이를 통해 우리는 이전보다 훨씬 빠르게 더 똑똑하고 안전한 AI 에이전트를 훈련시킬 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →