← 최신 논문
🤖 AI

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

이 논문은 "Code-as-Policy" RLVR 아키텍처를 활용하여 적응형 공격 전략을 생성하는 에이전트 기반 LLM 레드팀 프레임워크인 Trident를 소개하며, 기존의 심층 강화 학습 사이버 방어 체계가 정적 휴리스틱 베이스라인에 비해 동적 위협에 의해 매우 쉽게 성능이 뒤처지며 근본적으로 취약하다는 점을 밝혀낸다.

원저자: Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

게시일 2026-08-06
📖 2 분 읽기☕ 가벼운 읽기

원저자: Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 체스라는 고도의 긴장감이 흐르는 게임을 상상해 보십시오. 하지만 체스판 위에서 말을 움직이는 대신, 두 팀이 거대하고 보이지 않는 컴퓨터 네트워크를 차지하기 위해 싸우고 있습니다. 한 팀인 '블루 팀(Blue Team)'은 침입자를 찾아내고 고장 난 컴퓨터를 실시간으로 수리하는 법을 배우는 AI 방어자를 구축합니다. 다른 한 팀인 '레드 팀(Red Team)'은 침입을 시도합니다. 수년간 과학자들은 이 블루 팀의 방어자들을, 마치 정해진 규칙대로만 움직이는 태엽 장난감처럼 엄격하고 변하지 않는 스크립트를 따르는 로봇 같은 레드 팀과 대결시키며 테스트해 왔습니다. 문제는 실제 해커들은 태엽 장난감이 아니라는 점입니다. 그들은 영리하고 적응력이 뛰어나며, 방어책을 발견하는 즉시 전술을 바꿉니다. 한편, 거대 언어 모델(LLM)로 알려진 새로운 종류의 초지능형 AI는 퍼즐을 풀고 코드를 작성하는 데 놀라울 정도로 능숙해졌습니다. 과학자들이 던지는 핵심적인 질문은 이것입니다. 만약 이 초지능형 AI에게 레드 팀이 되는 법을 가르친다면, 기존의 정적인 로봇들이 결코 할 수 없었던 방식으로 블루 팀의 방어 체계를 마침내 무너뜨릴 수 있을 것인가?

이것이 바로 연구진들이 **트라이던트(Trident)**라고 불리는 프로젝트를 통해 밝혀내고자 했던 내용입니다. 그들은 스마트한 AI 공격자가 단순히 미리 작성된 스크립트를 따르는 것이 아니라, 실행하며 배울 수 있는 새로운 동적 테스트 환경을 구축했습니다. 그들은 AI를 훈련시키기 위해 13,000개 이상의 시뮬레이션된 전투 라이브러리를 만들었습니다. AI가 한 번에 하나의 동작만을 선택하게 하는 대신, 그들은 AI가 자신만의 '공격 전략'을 컴퓨터 코드 형태로 직접 작성하여 방어자를 상대로 실행하도록 가르쳤습니다.

결과는 놀라웠습니다. 단 하나의 70억 파라미터 모델(현대 AI 기준으로는 비교적 작은 크기)로 훈련된 트라이던트 AI는 단순히 방어자를 이긴 것에 그치지 않고, 방어자의 효율성을 대폭 떨어뜨렸습니다. 기존의 정적인 공격자들은 거의 타격을 주지 못했던 반면, 트라이던트는 블루 팀의 방어 성능을 기준치 대비 평균 **522%**나 감소시켰습니다. 이는 오늘의 '스마트한' 사이버 방어 체계 중 상당수가 우리가 생각했던 것보다 훨씬 더 취약하다는 것을 시사하며, 왜냐하면 그들은 오직 멍청하고 예측 가능한 적들만을 대상으로 테스트되었기 때문입니다. 트라이던트는 단순히 규칙을 따르는 것이 아니라, 방어자가 가짜 목표(미끼)로 자신을 속이려 할 때 이를 알아차리고 무시하는 법을 깨닫거나, 어떤 컴퓨터를 가장 먼저 해킹하는 것이 가장 가치 있는지 파악하는 등 스스로 영리하고 새로운 기술을 발견해 냈습니다. 이 논문은 진정으로 안전한 시스템을 구축하기 위해서는 정적인 로봇을 상대로 테스트하는 것을 멈추고, 트라이던트와 같이 적응하고 학습하는 AI를 상대로 테스트를 시작해야 한다고 제언합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →