← 최신 논문
🤖 machine learning

Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents

Co-RedTeam은 실행 기반 추론, 구조화된 상호작용, 그리고 장기 기억을 갖춘 LLM을 활용하여 실제 레드팀 워크플로우를 모방함으로써 자동화된 취약점 발견 및 공격 탐지에서 기존 베이스라인을 크게 능가하는 보안 인지형 멀티 에이전트 프레임워크입니다.

원저자: Pengfei He, Ash Fox, Lesly Miculicich, Stefan Friedli, Daniel Fabian, Burak Gokturk, Jiliang Tang, Chen-Yu Lee, Tomas Pfister, Long T. Le

게시일 2026-02-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pengfei He, Ash Fox, Lesly Miculicich, Stefan Friedli, Daniel Fabian, Burak Gokturk, Jiliang Tang, Chen-Yu Lee, Tomas Pfister, Long T. Le

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 복잡한 집(소프트웨어 코드베이스)을 상상해 보세요. 당신은 도둑이 어떻게 침입할 수 있는지 모든 가능한 방법을 찾아내고 싶습니다. 전통적인 방식이라면 보안 전문가 팀을 고용하여 모든 방을 돌아다니고, 모든 창문을 점검하며, 모든 자물쇠를 따보는 데 많은 시간과 비용을 들여야 합니다. 이는 규모를 키우기도 어렵고 매우 번거로운 일입니다.

이 논문은 Co-RedTeam이라는 새로운 시스템을 소개합니다. 이 시스템은 인공지능(특히 거대 언어 모델, LLM)을 활용하여 자동화된, 매우 똑똑한 보안 전문가 팀 역할을 수행합니다. 단순히 하나의 AI가 무엇이 잘못되었는지 추측하는 것이 아니라, 실제 인간 레드팀(Red Teaming)처럼 협력하는 특화된 AI 에이전트 그룹을 조직합니다.

작동 원리는 다음과 같습니다. 이해를 돕기 위해 쉬운 비유를 사용했습니다.

기존 AI 보안 도구의 문제점

이전의 AI 해킹 시도들은 마치 로봇 한 대에게 지도 하나를 쥐여주며 "약점을 찾아봐"라고 말하는 것과 같았습니다.

  • 문제점: 로봇은 종종 잘못된 추측을 하거나, 막히거나, 자신의 계획이 실제로 작동하는지 확인하지 않은 채 무작정 침입을 시도하곤 했습니다. 즉, "그라운딩(Grounding, 실재 기반 검증)"이 부족했습니다. 자신의 아이디어가 실제 세계에서 작동하는지 확인할 수 없었던 것입니다. 또한 이전 시도에서 배운 내용을 잊어버리기도 했습니다.

Co-RedTeam 솔루션: 특화된 SWAT 팀

Co-RedTeam은 외로운 늑대가 아닌, 조율된 SWAT 팀처럼 행동함으로써 이 문제를 해결합니다. 이 시스템은 "팀 리더(Orchestrator)"가 관리하는 두 가지 주요 단계로 나뉩니다.

1단계: 탐정 업무 (취약점 발견)

침입을 시도하기 전에, 팀은 어디를 살펴봐야 할지 알아야 합니다.

  • 분석가 에이전트 (Analyst Agent): 이 에이전트는 돋보기를 든 탐정과 같습니다. 단순히 코드를 읽는 것에 그치지 않고, 특수 도구를 사용하여 전체 "집"(코드베이스)을 탐색하며 설계도(파일 구조)를 살피고 보안 규칙(CWE 및 OWASP와 같은 보안 문서)을 확인합니다. 자물쇠가 약해 보일 수 있는 단서들을 찾아냅니다.
  • 비판가 에이전트 (Critic Agent): 이 에이전트는 회의적인 편집자와 같습니다. 분석가가 잠재적인 약점을 찾아내면, 비판가는 "확실합니까? 증거를 보여주세요"라고 말합니다. 만약 증거가 빈약하다면, 비판가는 분석가에게 다시 가서 더 열심히 조사하라고 돌려보냅니다. 이러한 상호 작용은 가짜 알람(오탐)에 시간을 낭비하지 않도록 보장합니다.

2단계: 침입 (반복적 익스플로잇/공격 실행)

잠재적인 약점이 발견되면, 팀은 그것이 실제로 존재하는지 증명하기 위해 직접 침입을 시도합니다.

  • 설계자 에이전트 (Planner Agent): 이 에이전트는 전략가입니다. 벽에 무작정 돌을 던지는 대신, 단계별 계획을 작성합니다: "1단계: 창문을 연다. 2단계: 사다리를 타고 올라간다."
  • 실행 에이전트 (Execution Agent): 이 에이전트는 계획을 실제로 실행하는 "근육" 역할을 하며, 안전하고 격리된 샌드박스(대상 시스템의 디지털 시뮬레이션) 안에서 움직입니다. 코드를 실행하거나 명령어를 입력하여 침입이 성공하는지 확인합니다.
  • 평가 에이전트 (Evaluation Agent): 이 에이전트는 결과를 관찰합니다. 창문이 열렸나요? 경보가 울렸나요? 이 에이전트는 설계자에게 "창문이 안쪽에서 잠겨 있어서 실패했습니다"라고 피드백을 줍니다.
  • 루프 (The Loop): 설계자는 이 피드백을 듣고 계획을 수정합니다 ("알겠습니다, 뒷문을 시도해 봅시다"). 그리고 팀은 다시 시도합니다. 그들은 침입에 성공하거나 불가능함을 증명할 때까지 계획을 계속 정교하게 다듬습니다.

비밀 병기: "경험 노트" (장기 기억)

Co-RedTeam의 가장 큰 혁신 중 하나는 **장기 기억(Long-Term Memory)**입니다.

  • 비유: 인간 전문가가 사건을 해결한 후 일지에 다음과 같이 적는 것을 상상해 보세요. "기억하라, 문이 잠겨 있을 때는 손잡이가 아니라 우편함의 열쇠 구멍을 시도하라."
  • 작동 방식: Co-RedTeam은 세 가지 유형의 노트를 저장합니다:
    1. 패턴: "이런 유형의 코드는 보통 이런 특정 약점을 가지고 있다."
    2. 전략: "이런 종류의 시스템을 상대할 때는 설정 파일을 먼저 확인하라."
    3. 기술적 트릭: "이 특정 명령어가 저 방화벽을 우회하는 데 효과적이었다."
  • 결과: 시스템은 더 많은 작업을 수행할수록 더 똑똑해집니다. 매번 처음부터 시작하는 것이 아니라, 과거의 성공과 실패로부터 배웁니다. 이를 통해 더 빠르고 효과적으로 새로운 취약점을 찾아냅니다.

연구 결과 (The Results)

연구진은 CyBench 및 BountyBench와 같은 여러 까다로운 사이버 보안 챌린지에 Co-RedTeam을 테스트했습니다.

  • 성공률: 이 시스템은 테스트된 사례 중 60% 이상에서 취약점을 발견하고 성공적으로 공격(exploit)했습니다.
  • 개선 사항: 이는 다른 AI 방법들(성공률이 10% 미만인 경우도 있음)보다 현저히 뛰어난 성과였습니다.
  • 성공 요인: 논문은 비판가, 설계자, 혹은 메모리 중 어느 하나라도 제거하면 시스템의 성능이 크게 떨어진다는 것을 보여주었습니다. 마법은 이 모든 구성 요소가 계획, 테스트, 학습의 루프 속에서 함께 작동할 때 일어납니다.

요약

Co-RedTeam은 시스템을 해킹하려고 애쓰는 혼란스러운 로봇 한 대에서, 고도로 조직화되고 스스로 진화하는 보안 팀으로 업그레이드한 것과 같습니다. 이 시스템은 전문 분야를 조율하는 팀 리더를 사용하고, 자신의 작업을 스스로 검증하며, 모든 시도로부터 배우고, 실제 테스트를 통해 발견한 내용을 증명함으로써, 기존 AI 도구들보다 훨씬 효과적으로 소프트웨어의 약점을 찾아냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →