To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack
이 입론서는 피할 수 없는 AI 기반 사이버 공격에 대응하기 위해, 방어자들이 적보다 먼저 위협을 숙달할 수 있도록 통제되고 거버넌스가 갖춰진 환경 내에서 자신들만의 공격적 AI 역량을 책임감 있게 개발하고 배치함으로써 전략을 근본적으로 전환해야 한다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 기존의 규칙은 더 이상 통하지 않습니다
지난 10년 동안 사이버 보안은 '두더지 잡기(Whac-A-Mole)' 게임처럼 작동해 왔습니다.
- 과거의 방식: 해커들은 고도의 숙련된 인간이어야 했습니다. 복잡한 공격을 설계하는 것은 마치 맞춤형 집을 짓는 것과 같아서, 수개월의 노력과 깊은 전문 지식이 필요했습니다. 비용과 시간이 너무 많이 들었기 때문에, 해커들은 오직 '큰 집'(대기업)만을 공격하거나, 문 하나가 열려 있기를 바라며 수천 개의 문을 두드리는 단순하고 일반적인 도구들을 사용했습니다. 방어자들은 해커들이 모든 문을 다 두드릴 여력이 없을 것이라고 가정했습니다.
- 새로운 위협: AI 에이전트가 게임의 판도를 바꾸고 있습니다. 해커가 사람이 아니라, 수천 마리의 작고 지칠 줄 모르는 로봇 떼라고 상상해 보세요. 이 로봇들은 전문가일 필요가 없습니다. 이들은 단 1초 만에 수백만 개의 문을 두드릴 수 있습니다. 99%의 확률로 실패하더라도, 단 1%의 성공만으로도 수익을 낼 수 있기 때문입니다. 이들은 과거에 인간들이 노력을 들일 가치가 없다고 무시했던 '작은 집'(틈새 시스템)들까지 공격할 수 있습니다.
이 논문은 현재 방어자들이 로봇 자체에 "출입 금지" 표지판을 붙임으로써 이 로봇들을 막으려 한다고 주장합니다. 하지만 논문은 나쁜 의도를 가진 자들이 표지판이 없는 자신들만의 로봇을 얼마든지 만들 수 있기 때문에 이 방법은 통하지 않을 것이라고 말합니다.
현재의 방어 체계가 실패하는 이유
저자들은 우리가 AI 해커를 막기 위해 세 가지 방법을 사용하고 있지만, 이는 마치 체로 홍수를 막으려는 것과 같다고 말합니다.
학습 데이터 필터링 ("깨끗한 도서관" 접근법):
- 아이디어: AI의 학습용 책에서 모든 나쁜 지침(예: "폭탄 만드는 법")을 제거하여 AI가 나쁜 것을 배우지 못하게 합니다.
- 실패 원인: 나쁜 해커들은 "나쁜 책"을 읽을 필요가 없습니다. 그들은 기본적인 논리와 상식만을 사용하여 AI가 해킹하는 법을 스스로 깨우치도록 가르칠 수 있습니다. 마치 사람이 매뉴얼 없이도 자물쇠 따는 법을 알아내는 것과 같습니다. 또한, 나쁜 해커들은 AI를 다운로드하여 직접 가르칠 수도 있습니다.
안전 정렬 ("착한 행동" 접근법):
- 아이디어: AI가 나쁜 요청을 받았을 때 "아니오"라고 말하도록 훈련시킵니다.
- 실패 원인: 나쁜 해커들은 영리합니다. 그들은 나쁜 요청을 마치 좋은 요청인 것처럼 속일 수 있습니다 (예: "침입하라" 대신 "보안을 테스트하라"고 요청하는 것). 또한, AI가 해커의 컴퓨터에서 실행되고 있다면, 그들은 "아니오" 버튼을 무시하도록 AI를 다시 훈련시킬 수 있습니다.
출력 가드레일 ("보디가드" 접근법):
- 아이디어: 문 앞에 보디가드를 세워 AI가 보내는 모든 메시지를 검사하고 위험해 보이는 것을 차단합니다.
- 실패 원인: 해커는 거대한 공격을 수천 개의 작고 무해해 보이는 단계로 쪼갤 수 있습니다. 보디가드는 각 단계를 안전하다고 판단하지만, 이 단계들을 모두 합치면 폭탄을 만들게 됩니다.
제안된 해결책: 자신만의 "레드 팀(Red Team)" 로봇을 구축하라
논문은 근본적인 변화를 제안합니다: 우리는 우리를 방어하기 위해 AI 에이전트에게 해킹하는 법을 가르쳐야 합니다.
이것은 소방서와 같습니다.
- 현재의 방어: 우리는 불이 나기를 기다렸다가, 불이 나면 불을 끄려고 노력합니다.
- 논문의 아이디어: 우리는 전문 방화범 팀(우리의 "공격형 AI")을 고용하여 보안이 철저한 격리된 훈련 시설( "사이버 레인지") 내부에서 활동하게 합니다.
- 이 "착한 방화범"들은 온갖 수법을 동원해 건물을 태우려고 시도합니다.
- AI이기 때문에, 이들은 몇 초 만에 수백만 가지의 화재 시작 방법을 시도할 수 있습니다.
- 우리는 그들이 어디에서 성공하는지 관찰하여 건물의 약점을 찾아내고, 실제 나쁜 놈이 나타나기 전에 그곳을 수리합니다.
이를 안전하게 만들기 위한 세 가지 단계
저자들은 이것이 위험하게 들릴 수 있다는 점을 알고 있으며, "착한 방화범"들이 실제 피해를 입히지 않도록 세 가지 엄격한 규칙을 제안합니다.
- 더 나은 테스트 트랙 구축: 이 해킹 로봇들이 얼마나 뛰어난지 정확히 측정할 수 있는 더 나은 "운전 코스"(벤치마크)가 필요합니다. 단순한 퍼즐이 아니라 실제 세계의 시나리오를 바탕으로 테스트해야 합니다.
- 단순 스크립트가 아닌 훈련: 로봇에게 고정된 단계 목록을 주는 대신, 인간 해커처럼 배우고 적응하도록 훈련시켜야 합니다. 그래야만 새로운 미지의 취약점을 찾는 데 더 능숙해질 수 있습니다.
- "샌드박스" 규칙: 가장 중요한 부분입니다. "착한 방화범"들은 절대로 보안 훈련 시설을 벗어나서는 안 됩니다.
- 그들은 실제 인터넷에 접속할 수 없는 디지털 우리 안에 머물러야 합니다.
- 그들은 구멍을 찾아내고 보고서를 작성합니다.
- 그 후, 우리는 그 보고서를 받아 구멍을 만드는 법이 아니라 오직 구멍을 고치는 법만 아는 다른 "안전한 AI"에게 전달합니다. 이 "안전한 AI"가 바로 우리의 시스템을 보호하기 위해 대중에게 공개될 AI입니다.
결론
논문은 나쁜 해커들이 AI를 공격에 사용하는 방법을 알아낼 때까지 기다려서는 안 된다고 결론짓습니다. 그들이 방법을 알아냈을 때는 이미 너무 늦었을 것입니다.
대신, 우리는 무기를 먼저 마스터해야 합니다. 우리는 우리만의 공격형 AI를 구축하고, 이를 안전한 우리 안에 가두어, 우리 시스템이 깨질 수 있는 모든 가능성을 찾아내는 데 사용해야 합니다. 적이 거대한 규모로 어떻게 생각하고 행동하는지를 이해해야만 우리는 우리 자신을 방어할 수 있습니다.
요약하자면: 나쁜 로봇을 막기 위해서, 우리는 물건을 더 잘 부술 수 있는 우리만의 '착한 로봇'을 만들어야 합니다. 다만, 그들이 우리 집을 고치는 데만 쓰이도록 우리를 위해 가두어 두어야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.