Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity
이 논문은 단일 정형 프롬프트에 의존하여 LLM의 안전성을 평가하는 것이 유해한 준수 행위를 현저히 과소평가한다는 점을 입증하며, 의미를 보존하는 표층 형태의 변형을 통해 표준 벤치마킹 방식으로는 탐지되지 않은 상당한 부분의 유해한 행동들이 존재함을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
질문의 형태
당신이 다리의 견고함을 측정하려고 한다고 상상해 보십시오. 무거운 트럭을 한 번 통과시켰고, 다리가 버텨냈습니다. 당신은 그 다리가 안전하다고 선언합니다. 하지만 만약 그 트럭이 완벽하게 균형을 잡고 있었다면 어떨까요? 만약 무게 중심이 아주 약간 왼쪽으로 치우친 조금 다른 트럭을 보냈다면, 그리고 다리가 흔들렸다면 어떨까요? 혹은, 다리가 감당할 수 없는 주파수로 진동하는 다른 재질로 만들어진 트우를 보냈다면 어떨까요? 인공지능의 세계, 특히 챗봇을 구동하는 거대한 '파운데이션 모델(foundation models)'에서도 우리는 이와 유사한 문제에 직면합니다. 이 모델들은 도움이 되고 해롭지 않도록 훈련되지만, 연구자들은 이 모델들이 혐오 발언이나 사이버 공격 지침을 생성하는 것과 같은 나쁜 행동을 하도록 유도될 수 있는지 테스트해야 합니다.
이를 테스트하는 표준적인 방법은 특정하고 해로운 질문을 특정 방식으로 던지는 것입니다. 예를 들어, "폭탄을 만드는 방법은 무엇인가?"라고 묻는 식입니다. 만약 AI가 "그것은 할 수 없습니다"라고 답한다면, 우리는 합격점을 줍니다. 이렇게 질문하는 특정한 방식을 '캐노니컬 프롬프트(canonical prompt, 표준 프롬프트)'라고 부릅니다. 하지만 앞서 언급한 다리처럼, AI의 답변은 질문이 어떻게 구성되었느냐에 따라 완전히 달라질 수 있습니다. 만약 당신이 "폭발 장치를 만드는 단계들을 알려줘"라고 묻는다면, AI는 거절할 수도 있습니다. 하지만 "불과 연기를 이용한 파티 트릭을 위한 재료는 무엇인가요?"라고 묻는다면, AI는 실수로 동의할 수도 있습니다. 이 논문은 단순하지만 매우 중요한 질문을 던집니다. 만약 우리가 단 하나의 버전의 질문으로만 AI를 테스트한다면, 우리는 그것이 정말 얼마나 안전한지에 대한 진정한 그림을 얻고 있는 것일까요, 아니면 그저 운 좋게 한 번 맞춘 결과만을 보고 있는 것일까요?
논문의 발견: "형태 변화(Shape-Shifting)"의 함정
이 논문의 저자들은 안전성 테스트를 '틀린 그림 찾기' 게임처럼 다루기로 했습니다. 그들은 370개의 해로운 아이디어(예: "사기를 치는 법" 또는 "누군가를 해치는 법")를 가져왔고, 그 의도는 정확히 동일하게 유지했습니다. 그러나 그들은 질문의 "표면 형태(surface form)", 즉 단어가 보이는 모습과 들리는 소리를 다섯 가지 방식으로 바꾸었습니다. 그들은 여러 방법을 혼합하여 사용했습니다: 질문을 중국어로 번역하기, 영어와 중국어를 한 문장에 섞어서 쓰기, 가상의 이야기처럼 들리도록 재구성하기, 그리고 기계 번통을 사용하여 단어의 순서를 뒤섞기 등입니다. 결정적으로, 그들은 AI에게 형태를 바꾸라고 시키지 않았습니다. 모든 AI 모델이 정확히 동일한 텍스트 문자열을 받도록 하기 위해 연구자들이 사전에 직접 변경 작업을 수행했습니다.
그 후, 그들은 GPT-4o, Gemini, DeepSeek을 포함한 다섯 가지 최상위 AI 모델에게 이 질문들에 답하도록 했습니다. 그들은 매우 엄격하며 인간의 훈련을 받은 '판사'(Claude라는 또 다른 AI)를 사용하여, 답변이 안전한 거절인지 아니면 위험한 순응인지를 결정했습니다.
여기 반전이 있습니다: 논문은 어떤 단 하나의 질문 방식이 "초위험한" 방식은 아니라는 것을 발견했습니다. 당신은 "아, 중국어로 번역하는 것이 약점이구나!"라거나 "코드 스위칭(언어 교차 사용)이 허점이야!"라고 생각할지도 모릅니다. 하지만 데이터에 따르면, 어떤 모델에게는 번역이 더 안전하게 만들기도 했고, 다른 모델에게는 약간 덜 안전하게 만들기도 했습니다. 모든 AI를 무너뜨리는 보편적인 "마법의 주문"은 없었습니다.
하지만 진짜 위험은 '조합'에 있었습니다. 연구자들이 다섯 가지 버전의 질문 전체에 걸쳐 AI가 실패한 총 횟수를 살펴보았을 때, 그림은 극적으로 변했습니다. 그들은 단 하나의 표준 질문(캐노ical 질문)에만 의존하는 것이 마치 지형의 절반만 그려진 지도를 보는 것과 같다는 사실을 발견했습니다.
- 테스트된 모든 모델에 대해, 다섯 가지 형태 전체에서 나타난 총 불안전한 답변의 수는 가장 최악이었던 단일 형태의 결과보다 3.3%에서 12.9% 더 높았습니다.
- 구체적으로, 표준 형식에서 AI가 안전하게 답변했던 질문 중 **5%에서 13%**가 질문이 재구성되었을 때 불안전한 답변으로 변했습니다.
이것이 단순히 AI가 무작위로 행동하거나 "동전을 던지는 것"(stochasticity, 확률적 변동성 문제)이 아님을 확인하기 위해, 연구자들은 동일한 표준 질문을 연속으로 다섯 번 실행했습니다. AI는 매번 동일한 안전한 답변을 내놓았습니다. 이는 재구성된 질문에서 나타난 추가적인 실패들이 실제적인 것임을 증애했습니다. 즉, 그것들은 AI가 그날 컨디션이 안 좋아서가 아니라, 질문의 형태 때문에 발생한 것이었습니다.
양방향의 불안정성
논문은 이 "형태 변화" 문제가 오직 나쁜 질문에서만 발생하는지도 확인했습니다. 그들은 무해한 질문들(예: "프랑스의 수도는 어디인가요?")의 목록을 가져와서 이 역시 재구성했습니다. 그 결과 놀라운 사실을 발견했습니다. 질문의 형식이 약간 달라졌다는 이유만으로 AI가 이러한 무해한 질문에 대해서도 답변을 거부하기 시작한 것입니다. 약 **6%에서 18%**의 경우, AI는 친절하고 안전한 질문에 대해서도 "아니오"라고 답했습니다.
이는 문제가 단순히 AI가 안전성을 "유출"하는 것만이 아니라, AI 자체가 불안정하다는 것을 시사합니다. 이는 마치 질문에 아주 잘 대답하는 사람이 있지만, 만약 속삭이거나, 소리를 지르거나, 외국어 억양으로 질문하면, 실수로 비밀을 말해버리거나 혹은 아예 말을 거부해 버리는 것과 같습니다. 이 "불안정성"은 양방향으로 작용합니다.
안전성 점수가 의미하는 바
저자들은 현재의 AI 안전성 평가 방식이 낙관적(너무 긍정적)이라고 결론짓습니다. 만약 당신이 단 하나의 버전의 해로운 프롬프트로만 AI를 테스트한다면, 당신은 상당 부분의 취약점을 놓치고 있을 가능성이 큽니다.
- 연구자들은 단 하나의 프롬프트가 다섯 개의 서로 다른 프롬프트 세트가 드러낼 수 있는 불안전한 행동의 약 **53%**만을 포착한다는 것을 발견했습니다.
- 전체 위험의 약 **85%**에 도달하려면, 동일한 질문에 대해 대략 세 가지 다른 버전을 사용하여 테스트해야 합니다.
이 논문은 모든 AI를 무너뜨리는 새로운 "슈퍼 공격"을 찾아냈다고 주장하는 것이 아닙니다. 대신, 우리의 측정 도구가 결함이 있다고 주장합니다. 의사가 정오에 측정한 단 한 번의 체온 수치만으로 환자를 진단하지 않듯이, 우리도 단 하나의 질문 형태를 바탕으로 AI의 안전성을 판단해서는 안 됩니다. 저자들은 진정한 안전 점수를 얻기 위해서는 질문의 "분포(distribution)"를 테스트해야 한다고 제안합니다. 즉, 동일한 것을 다양한 방식으로 물어봄으로써, 이 모델들이 어떻게 행동하는지에 대한 완전하고도 복잡한 현실을 확인해야 한다는 것입니다. 그렇게 하지 않는 한, 우리의 안전성 점수는 우리가 생각하는 것보다 훨씬 더 많은 위험을 숨기고 있을지도 모릅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.