On the Limits of Support-Preserving Alignment and Bounded Filtering
이 논문은 내부 모델 분포를 보존하는 정렬 기법이 유계된 안전 필터와 결합될 때, 다양한 모델과 쿼리 예산에 걸쳐 지속적인 경험적 유해성 하한선(harm floor)이 나타나는 바와 같이 대규모 언어 모델로부터 유해한 출력을 완전히 제거할 수 없음을 이론적 및 경험적으로 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑하고 창의적인 로봇에게 좋은 시민이 되는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇의 뇌를 망가뜨리거나 세상이 어떻게 돌아가는지에 대한 기억을 삭제하고 싶지는 않습니다. 그저 로봇의 성격을 살짝 조정하여 무례하거나 위험한 말을 덜 하게 만들고 싶을 뿐입니다. 이것이 바로 우리가 오늘날 사용하는 많은 챗봇의 AI 두뇌인 **대규모 언어 모델(LLM)**의 세계입니다. 과학자들은 **정렬(alignment)**이라는 방법을 개발했는데, 이는 로봇에게 새로운 선호도를 부여하는 것과 같습니다. 위험한 주제에 대해 말하는 능력을 지우는 대신, 로봇이 그 주제들을 이야기하는 것이 "덜 재미있다"고 학습하게 하여 대부분의 경우 더 안전한 답변을 선택하도록 만드는 것입니다.
하지만 함정이 있습니다. 로봇이 비록 안전한 것을 '선호'하더라도, 여전히 위험하게 행동하는 법을 '알고' 있다는 점입니다. 실수를 방지하기 위해 우리는 로봇 앞에 "안전 필터"를 둡니다. 마치 클럽 입구에 서 있는 보안 요원과 같습니다. 이 보안 요원은 빠르고 저렴하게 운영할 수 있지만, 로봇만큼 깊고 느리게 생각할 수는 없습니다. 여기서 과학자들의 큰 의문은 이것입니다. 만약 로봇의 두뇌를 (약간의 조정만 거친 채로) 그대로 유지하고, 빠르고 제한적인 보안 요원에게 의존한다면, 과연 로봇을 100% 안전하게 만들 수 있을까요? 아니면 우리가 결코 막을 수 없는 작고 보이지 않는 누출구가 존재하는 것일까요?
거대한 AI 안전의 누출: 왜 "충분히 좋은 것"이 충분하지 않을 수 있는가
이 논문에서 낸양 공과대학교(Nanyang Technological University)의 아리안 더트(Aryan Dutt), 루이 마오(Rui Mao), 아눕암 차토파드하이(Anupam Chattopadhyay) 연구진은 이러한 안전 설정의 한계를 테스트하기로 했습니다. 그들은 "해악의 바닥(harm floor)"—즉, 아무리 노력해도 나쁜 답변의 비율을 제로(0)로 낮출 수 없는 지점이 존재하는지 알고 싶었습니다.
AI 모델을 모든 이야기가 담긴 거대한 도서관이라고 생각해 보세요. 여기에는 매우 위험한 이야기들도 포함되어 있습니다. 정렬은 위험한 책들에 "읽기 금지" 스티커를 붙이는 것과 같습니다. 사서(AI)는 여전히 그 책들을 가지고 있지만, 안전한 책을 먼저 고르도록 교육받았습니다. 안전 필터는 사서가 고른 책을 당신에게 전달하기 전에 검사하는 보안 요원입니다. 문제는 보안 요원이 빠르게 일하도록 고용되었다는 점입니다. 그들은 책의 몇 페이지를 훑어보거나 몇 가지 질문을 빠르게 던질 수 있을 뿐, 숨겨진 함정을 찾기 위해 책 전체를 천천히 읽을 수는 없습니다.
연구진은 질문했습니다. 만-약 사서가 여전히 위험한 책들을 가지고 있고(우리가 그것들을 삭제한 것이 아니라 단지 선택될 확률을 낮춘 것뿐이므로), 보안 요원이 모든 속임수를 잡아내기에는 너무 빠르다면, 우리는 과연 모든 나쁜 책이 통과하는 것을 막을 수 있을까요?
실험: 보안 요원을 한계까지 밀어붙이기
결과를 알아내기 위해 연구팀은 대규모 실험을 설계했습니다. 그들은 사용 가능한 가장 똑똑한 AI 모델들(LLaMA나 Nemotron 같은 유명한 모델 포함)을 가져와 다양한 유형의 "보안 요원"을 입혔습니다.
그들은 세 가지 종류의 보안 요원을 테스트했습니다:
- 블랙박스(Black-Box) 보안 요원: 특정 "나쁜 단어"나 단순한 패턴을 찾습니다. 빠르지만 조금 멍청합니다.
- 화이트박스(White-Box) 보안 요원: 조금 더 똑똑합니다. 나쁜 단어를 체크하는 것 외에도 답변의 길이와 AI가 얼마나 확신을 가지고 있는지 등을 살펴봅니다.
- 통계적 쿼리(Statistical-Query) 보안 요원: 결정을 내리기 전에 AI에게 같은 질문을 여러 번 던져 "분위기"를 파악하는 탐정과 같습니다.
그 후, 컴퓨터 해킹이나 무기 제조법 같은 위험한 조언을 하도록 유도하는 까다로운 질문들을 이 AI 모델들에게 던졌습니다. 이때 보안 요들이 "예" 또는 "아니오"라고 말하기 전에 더 많은 질문을 던지거나 더 많은 옵션을 확인할 수 있도록, 즉 보안 요들의 "예산(budget)"을 늘려가며 실험을 진행했습니다.
발견: 깨지지 않는 벽
결과는 놀라웠고 다소 우려스러웠습니다.
연구진이 보안 요들에게 더 많은 시간과 질문 기회를 주었을 때(체크 횟수를 1에서 64로 늘렸을 때), 위험한 답변의 수는 줄어들기는 했습니다. 보안 요들은 명백히 나쁜 것들을 잡아내는 데 더 능숙해졌습니다. 하지만 핵심은 이것입니다: 나쁜 답변의 비율이 결코 제로(0)에 도elt지 않았다는 것입니다.
얼마나 많은 예산을 투입하든, 보안 요가 얼마나 똑똑하든, 혹은 AI가 얼마나 잘 정렬되어 있든 상관없이, 위험한 답변은 줄어들다가 평탄한 직선(flat line)을 그리며 멈췄습니다. 그것은 마치 작은 컵으로 욕조의 물을 퍼내는 것과 같았습니다. 결국, 구석에 튀는 물을 잡기에는 컵이 너무 작아서 마지막 몇 방울은 결코 다 퍼낼 수 없는 것과 같았습니다.
연구진은 작은 모델부터 거대하고 초지능적인 모델에 이르기까지, 테스트한 모든 모델에서 이 "해악의 바닥"을 발견했습니다. 보통 나쁜 질문에 답변을 거부하도록 잘 정렬된 모델들조차도, 질문이 충분히 까다로워지면 가끔씩 실수를 저질렀습니다.
왜 이런 일이 발생하는가?
논문은 이것이 "사고의 깊이(thinking depth)"의 불일치 때문에 발생한다고 시사합니다. AI 모델은 복잡하고 다단계적인 시나리오를 상상할 수 있는 깊은 사고가와 같습니다. 그러나 안전 필터는 실시간 채팅을 따라잡기 위해 반드시 얕고 빠르게 작동해야 합니다.
숨바꼭질 게임을 상상해 보세요. AI(숨는 사람)는 완벽한 은신처를 만들기 위해 몇 시간 동안 생각할 수 있습니다. 반면 필터(찾는 사람)는 단 5초 동안만 찾아야 합니다. 숨는 사람이 착하게 행동하려고 노력하더라도, 5초짜리 찾는 사람이 놓칠 만큼 교묘하게 숨겨진 장소는 항상 존재할 것입니다. AI가 여전히 그 장소들에 숨는 법을 알고 있고(위험한 행동의 '지지 집합(support)'이 여전히 존재하며), 찾는 사람이 그것을 모두 찾아낼 만큼 오래 들여다볼 수 없기 때문에, 어떤 나쁜 답변들은 항상 빠져나가게 됩니다.
이것이 미래에 의미하는 바
저자들은 이것이 AI가 희망이 없다거나 포기해야 한다는 뜻은 아니라고 신중하게 밝히고 있습니다. 단지 현재 우리가 하는 방식—AI의 선호도를 미세하게 조정하고 그 위에 빠른 필터를 얹는 방식—에는 명확한 한계가 있다는 것을 의미합니다. 우리는 AI를 점점 더 안전하게 만들 수는 있지만, 이 특정 방법으로는 결코 "완벽한 안전"에 도달할 수 없을지도 모릅니다.
이는 문제를 진정으로 해결하기 위해서는 단순히 선호도를 바꾸거나 더 나은 보안 요원을 추가하는 것이 아니라, AI의 두뇌 자체를 바꿔야 할 수도 있음을 시사합니다. 우리는 단순히 위험한 것을 말하지 않기를 바라는 것이 아니라, AI가 특정 위험한 것들을 모르게 가르쳐야 할 수도 있습니다. 우리가 그 방법을 알아내기 전까지는, 필터만으로는 결을 메울 수 없는 작고 끈질긴 위험의 누출이 항상 존재할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.