Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success
본 정책 제안서는 단일 구성 성공률에 의존하는 현재의 재일브레이크 평가가 위협을 특징화하는 데 불충분하다고 주장하며, 매개변수 변형에 따른 공격 성능의 전체 범위를 더 잘 포착하기 위해 변형 민감도 측정 (VSM) 및 유니온 커버리지 (UC) 와 같은 분포 기반 지표를 채택할 것을 제안합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
고급 기술이 적용된 건물을 침입하는 것이 얼마나 쉬운지 파악하려는 보안 요원이 되어 상상해 보세요.
AI 안전성 연구 세계에서는 연구자들이 AI 모델을 그들이 말해서는 안 되는 것을 말하도록 속이도록 설계된 '재일브레이크' 공격을 종종 테스트합니다. 이러한 테스트를 보고하는 현재의 표준은 도둑이 다음과 같이 말하는 것과 같습니다. "나는 정문을 80% 의 확률로 여는 특정한 열쇠 하나를 찾았습니다. 따라서 이 건물은 80% 취약합니다."
이 논문은 이러한 보고 방식이 오해의 소지가 있고 불완전하다고 주장합니다. 이는 36 개의 다른 열쇠가 다른 문을 열 수 있다는 사실이나, '최고'의 열쇠가 매우 특정 유형의 자물쇠에서만 작동한다는 사실을 무시한 채, 단지 한 개의 열쇠로 한 개의 문만 시도해 보았을 뿐이라는 이유로 건물이 안전하다고 말하는 것과 같습니다.
다음은 간단한 비유를 사용한 논문의 주장 요약입니다:
문제: "최고의 열쇠" 오류
대부분의 AI 안전성 논문은 단일 숫자, 즉 **공격 성공률 (ASR)**을 보고합니다. 그들은 단일 최상의 설정 조합 (가장 좋은 "열쇠"와 같은) 을 선택하고 "보세요, 이 공격은 80% 의 확률로 작동합니다!"라고 말합니다.
저자들은 이는 도둑이 정문을 여는 한 개의 열쇠를 보여 주며 "이것이 건물의 보안 수준입니다"라고 주장하는 것과 같다고 말합니다. 하지만 다음과 같은 경우가 있을 수 있습니다:
- 그 열쇠는 정문에만 작동하지만, 뒷문, 측면문, 그리고 지하실 문을 여는 10 개의 다른 열쇠가 있을 수 있습니다.
- "80% 성공"은 매우 특정 설정에서만 발생하는 행운의 우연일 뿐이며, 나머지 99 개 설정은 거의 작동하지 않을 수 있습니다.
방어자들 (보안 요원들) 이 그 하나의 "최고" 숫자만 본다면, 그들은 정문을 막고 안전하다고 생각할 수 있지만, 뒷문과 측면문은 여전히 활짝 열려 있을 수 있습니다.
해결책: 두 가지 새로운 측정 도구
저자들은 VSM과 UC라고 부르는 위험을 측정하는 두 가지 새로운 방법을 제안합니다.
1. VSM (변형 민감도 측정): "그 열쇠는 얼마나 운이 좋았을까?"
100 개의 서로 다른 열쇠가 들어 있는 가방을 상상해 보세요.
- 시나리오 A: 그중 95 개가 문을 쉽게 엽니다. 하나는 쓸모없습니다. 만약 "최고"의 열쇠를 보고한다면, 당신은 평균 경험에 대해 진실을 말하는 것입니다.
- 시나리오 B: 오직 1 개의 열쇠만 완벽하게 작동하고 나머지 99 개는 쓸모없습니다. 만약 "최고"의 열쇠를 보고한다면, 당신은 평균 경험에 대해 거짓말을 하는 것입니다.
VSM은 "최고" 결과와 "평균" 결과 사이의 격차를 측정합니다.
- 낮은 VSM: 공격은 일관적입니다. 헤드라인 숫자는 신뢰할 수 있습니다.
- 높은 VSM: 헤드라인 숫자는 우연입니다. 공격은 설정에서 극도로 운이 좋아야만 작동합니다. 논문은 일부 공격의 경우 "최고" 결과가 평균 결과보다 5 배 더 좋았음을 발견했는데, 이는 헤드라인 숫자가 극도로 낙관적이었음을 의미합니다.
2. UC (유니온 커버리지): "몇 개의 문을 열 수 있을까?"
이것은 보안에 있어 가장 중요한 부분입니다.
36 개의 서로 다른 열쇠가 있다고 상상해 보세요.
- 열쇠 A는 60% 의 문을 엽니다.
- 열쇠 B는 다른 40% 의 문을 엽니다.
- 열쇠 C는 나머지 20% 를 엽니다.
만약 당신이 "최고"의 열쇠 (열쇠 A) 만 본다면, 건물의 60% 가 취약하다고 생각합니다. 하지만 모든 열쇠를 함께 시도해 본다면, 건물의 **100%**가 취약하다는 것을 깨닫게 됩니다.
UC는 공격자가 공격의 모든 변형을 시도할 때 열 수 있는 문의 총 백분율을 측정합니다. 논문은 일부 공격의 경우 "유니온 커버리지"가 "최고 단일 구성"보다 33% 더 높았음을 발견했습니다. 이는 최고의 숫자만 보는 방어자들이 위험의 거대한 부분을 놓치고 있음을 의미합니다.
논문에서 제시된 실제 사례
저자들은 세 가지 다른 AI 모델을 사용하여 두 가지 유명한 "공격 패밀리 (PAIR 및 Bijection Learning)"에 대해 이러한 아이디어를 테스트했습니다.
- PAIR 공격: 그들은 서로 다른 "페르소나" (권위 있는 인물인 척하는 것 대 논리적 사고자인 척하는 것) 를 시도했습니다.
- 헤드라인: "권위 승인"은 69% 의 확률로 작동했습니다.
- 현실: 세 가지 페르소나를 모두 결합했을 때, 그들은 **88%**의 사례를 침입할 수 있었습니다. 단일 숫자는 취약한 프롬프트의 19% 를 놓쳤습니다.
- Bijection 공격: 이 공격은 서로 다른 "인코딩" 트릭 (텍스트의 언어나 간격을 변경하는 것 등) 을 사용합니다.
- 헤드라인: 최고의 단일 설정은 81% 의 확률로 작동했습니다.
- 현실: 가능한 36 가지 조합을 모두 시도했을 때, **100%**의 프롬프트가 깨졌습니다. "최고" 숫자는 충분한 변형을 시도하면 단일 테스트 사례가 모두 취약하다는 사실을 완전히 놓쳤습니다.
왜 이것이 중요한가
이 논문은 현재 숫자들이 수학적으로 "틀렸다"고 말하는 것이 아닙니다. 그들은 단지 불완전할 뿐입니다.
- 방어자들을 위해: 만약 당신이 "최고" 공격만 막는다면, 건물의 나머지 30% 는 잠금 해제된 채로 남게 됩니다. 건물의 실제로 얼마나 많은 부분이 위험에 처해 있는지 알기 위해서는 "유니온 커버리지"를 알아야 합니다.
- 연구자들을 위해: 만약 당신이 "최고" 점수가 80% 인 공격 (하지만 매우 불일치함) 과 "최고" 점수가 60% 인 공격 (하지만 매우 일관됨) 을 비교한다면, 단순히 첫 번째 것이 "더 낫다"고 말할 수 없습니다. 첫 번째 것이 단지 행운의 우연인지 알아야 합니다.
결론
저자들은 AI 연구 커뮤니티에 "최고 사례" 숫자만 외치는 것을 멈추고, 대신 다음을 보고하도록 요청하고 있습니다:
- 최고 사례 (헤드라인).
- 평균 사례 (그 성공이 얼마나 전형적인가?).
- 총 커버리지 (모든 변형을 시도할 때 몇 개의 서로 다른 프롬프트가 깨질 수 있는가?).
연구자들이 이 전체 그림을 보고하기 시작할 때까지, 우리는 정문만 확인하고 건물의 나머지 부분이 안전하다고 가정하는 보안 요원과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.