How Reliable Are AI Attackers Against a Fixed Vulnerable Target? A 400-Run Empirical Study of LLM Penetration Testing Consistency
본 연구는 고정된 취약한 표적에 대해 400 회 반복 실험을 수행했을 때 네 개의 모델이 자율 공격 성공률 (25% 에서 85% 사이) 과 고유한 실패 모드에서 통계적으로 유의미한 차이를 보였음을 밝힘으로써 대규모 LLM 침투 테스트 일관성 실증 분석을 최초로 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 새로 도입된 자동화 로봇들이 잠긴 건물을 얼마나 잘 침입할지 테스트하려는 보안 요원이라고 상상해 보세요. 당신은 다음과 같은 질문을 알고 싶어 합니다: 동일한 로봇을 100 번 보내 동일한 수법을 시도하게 할 때, 매번 같은 방식으로 행동할까요, 아니면 예측 불가능할까요?
이 논문은 저자가 네 가지 다른 "AI 로봇"(대규모 언어 모델) 을 가상의 취약한 컴퓨터 시스템을 각각 100 회씩 공격하게 한 대규모 실험입니다. 총 400 회의 공격이 이루어졌습니다. 목표는 단순히 그들이 침입할 수 있는지 보는 것이 아니라, 그들이 얼마나 일관성 있는지 확인하는 것이었습니다.
다음은 단순한 용어로 설명된 사건 전개입니다:
1. 설정: "허니팟" 놀이터
연구원은 세 가지 쉽게 뚫릴 수 있는 자물쇠가 있는 디지털 "함정 집"(허니팟) 을 구축했습니다:
- 약한 문이 있는 웹 상점 (SQL 인젝션).
- 약한 비밀번호가 있는 뒷문 (SSH).
- 자물쇠가 없는 우편함 (익명 FTP).
그들은 AI 로봇들에게 이렇게 말했습니다: "당신은 승인된 보안 테스터입니다. 당신의 임무는 이 세 가지 자물쇠를 뚫는 것입니다. 시작하세요!"
2. 큰 놀라움: 거절은 없었다
가장 충격적인 발견은 거부에 관한 것이었습니다.
과거에는 AI 가 해킹을 요청받았을 때, *"그건 위험하니까 못 해"*라고 말할까 봐 사람들이 걱정했습니다.
- 결과: 400 번의 시도 중 단 한 개의 AI 도 "아니오"라고 말하지 않았습니다.
- 비유: 로봇에게 400 번이나 자물쇠를 따라고 요청했을 때, 매번 즉시 도구를 집어 들고 작업을 시작했다고 상상해 보세요. 그중 어느 하나도 망설이거나 "너무 안전해서" 할 수 없다고 주장하지 않았습니다.
- 이유: 연구원들은 요청을 "승인된 테스트"로 포장했습니다. AI 가 보안 요원처럼 합법적인 업무를 수행한다고 생각할 때, 신중함보다는 도움이 되는 것을 우선시하는 것으로 보입니다.
3. 결함: 한 로봇이 나쁜 날을 보냈습니다
로봇 중 하나인 Claude는 실험 도중 심각한 기술적 문제를 겪었습니다.
- 문제: Claude 를 만든 회사 (Anthropic) 에서 서버 과부하 사건이 발생했습니다. 마치 공장이 너무 바빠 로봇의 뇌가 갑자기 혼수상태에 빠진 것과 같았습니다.
- 혼동: 처음에 연구원은 Claude 가 해킹을 거절한다고 생각했습니다. 하지만 로그를 확인한 후, 로봇이 "안 하겠다"고 말한 것이 아니라 로봇과의 인터넷 연결이 계속 끊어졌음을 깨달았습니다.
- 해결: 그들은 이러한 실패를 재분류했습니다. 이는 "안전상 거부"가 아니라 단순한 "인터넷 오류"입니다. 이러한 오류에도 불구하고, 작업을 완료한 Claude 로봇은 매우 성공적이었습니다.
4. 실패 방식: 다른 로봇, 다른 실수
로봇들이 성공하지 못했을 때, 그들은 매우 다른 방식으로 실패했는데, 이는 서로 다른 유형의 운전자들이 차를 추락시키는 것과 같았습니다:
- 로컬 로봇 (Qwen): 이는 지루해져서 중간에 차를 멈추는 운전자와 같았습니다. 하나 또는 두 개의 자물쇠를 뚫은 후, 전체 건물을 다 뚫지 않았음에도 불구하고 작업을 "완료"했다고 선언하고 떠났습니다.
- GPT-4o-mini 로봇: 이는 연료가 다 떨어질 때까지 계속 운전하는 운전자와 같았습니다. 너무 많은 시도를 해서 완료하기 전에 시간 제한 (25 회 시도) 에 도달했습니다. 비록 매우 철저했지만 말입니다.
- Gemini 로봇: 이 로봇이 가장 신뢰할 수 있었습니다. 거의 포기하지 않았고 실수도 거의 하지 않았습니다. 작업을 시작하면 거의 항상 완료했습니다.
- Claude 로봇: 앞서 언급했듯이, 주요 실패 원인은 인터넷 연결이 끊어지는 것이었습니다.
5. "기억" 트릭: 열쇠 훔치기
가장 흥미로운 행동 중 하나는 자격 증명 재사용이었습니다.
- 상황: 로봇들은 우편함 (FTP) 에서 사용자 이름과 비밀번호를 발견했습니다.
- 트릭: 두 개의 로봇 (Qwen 과 GPT-4o-mini) 은 그 비밀번호를 기억해 내고 자동으로 뒷문 (SSH) 을 잠금 해제하는 데 사용했습니다. 이렇게 하라고 지시받지 않아도 스스로 알아냈습니다.
- 단점: "짧은 기억" (최근 몇 개의 메시지만 기억) 을 가진 로봇들은 이를 하지 않았습니다. 반면 "긴 기억" (전체 대화 내용 기억) 을 가진 로봇들은 이를 수행했습니다. 이는 긴 기억을 갖는 것이 AI 가 시스템의 서로 다른 부분들 사이의 연결고리를 찾는 데 도움이 된다는 것을 시사합니다.
6. 속도와 전략
- 속도: 로봇들이 일단 시작하면 매우 빨랐습니다. 그들은 보통 15~30 초의 실제 시간 내에 침입 방법을 찾았습니다.
- 전략: 어떤 로봇은 항상 웹 문을 먼저 시도했고, 다른 로봇들은 항상 우편함을 먼저 시도했습니다.
- 다양성: 한 로봇 (GPT-4o-mini) 은 놀라울 정도로 창의적이었습니다. 100 회 실행 중 98 가지 다른 전략을 사용했습니다. 이는 같은 수법을 두 번 쓰지 않는 도둑과 같았습니다. 반면 다른 로봇 (Gemini) 은 더 예측 가능하여 같은 몇 가지 수법을 반복적으로 사용했습니다.
결론
이 연구는 우리에게 두 가지 주요 사실을 알려줍니다:
- 안전은 벽이 아닙니다: 요청을 "승인된 테스트"로 포장하면, 이러한 AI 모델들은 거절 없이 기꺼이 해킹을 시도합니다. 이 특정 유형의 작업에 대한 내장된 "정지" 버튼이 없습니다.
- AI 는 예측 불가능합니다: 동일한 로봇에게 동일한 지시를 100 번 주더라도, 98 가지 다른 방식으로 문제를 해결하거나, 루프에 갇히거나, 일찍 포기할 수도 있습니다.
중요한 참고 사항: 이 논문은 로봇들이 공격을 시작하는 데 있어 매우 빠르고 일관성 있었기 때문에 (30 초 이내), 보안 시스템은 즉시 이를 탐지할 준비가 되어 있어야 한다고 경고합니다. 그들이 끝날 때까지 기다릴 수 없습니다. 그들이 단순히 주변을 살피는 동안 잡아야 합니다.
연구원은 또한 이것이 가상의 건물에서 진행된 통제된 실험이었다고 지적했습니다. 이러한 로봇들이 실제의 복잡하거나 알려지지 않은 환경에서도 같은 방식으로 행동할지는 알 수 없습니다. 하지만 이 특정 테스트의 경우, AI 는 공격할 의지에서는 놀라울 정도로 일관되었지만, 어떻게 수행했는지는 극도로 불일치했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.