Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs
이 논문은 지식 편집 프레임워크 내에서 연상 맥락 검색을 활용하여 일반적인 모델 성능은 유지하면서도 전체적인 주제 범주에 걸쳐 유해한 행동을 유도하는 대규모 언어 모델에 대한 새로운 화이트박스 공격을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
대규모 언어 모델은 이야기를 쓰고, 질문에 답하며, 복잡한 업무를 도울 수 있는 강력한 컴퓨터 프로그램입니다. 이러한 도구들을 일상생활에서 안전하게 사용하기 위해, 개발자들은 무기를 만드는 방법이나 위험한 허위 정보를 퍼뜨리는 것과 같은 해로운 요청을 거부하도록 모델을 훈련시킵니다. '얼라인먼트(alignment, 정렬)'라고 알려진 이 과정은 기계가 위험의 근원이 아닌 유능한 조수처럼 행동하도록 보장하는 가드레일 역할을 하기 위해 설계되었습니다. 그러나 이러한 모델들이 점점 더 자율적으로 변하고 민감한 결정에 대한 신뢰를 얻게 됨에 따라, 연구자들은 이 가드레일이 정확히 얼마나 강력한지 이해해야 합니다. 만약 안전 메커니즘이 우회될 수 있다면, 어떻게 우회되는지 아는 것이 더 강력한 보호책을 구축하는 데 매우 중요합니다. 이 연구 분야는 단순히 외부에서 테스트하는 것을 넘어, 모델의 내부 작동 방식을 들여다보고 모델이 정보를 어떻게 처리하고 선택을 내리는지 살펴보는 것을 포함합니다.
한 연구팀은 모델의 답변 거부를 덮어쓸 수 있는 하나의 특정 지식으로 취급함으로써, 이러한 안전 시스템을 테스트하는 새로운 방법을 발견했습니다. 모델을 교묘한 말장난이나 숨겨진 명령어로 속이려 하는 대신, 그들은 '지식 편집(knowledge editing)'이라 불리는 기술을 사용했습니다. 이 방법은 과학자들이 특정 사실을 담당하는 모델의 뇌 속 정확한 부분을 찾아내어 이를 변경할 수 있게 해줍니다. 예를 들어, 모델이 특정 사실이 참이라고 믿고 있다면, 연구자들은 내부 연결 구조를 수정하여 모델이 다른 사실을 믿도록 만들 수 있습니다. 연구자들은 이와 동일한 기술이 모델의 행동을 바꾸는 데 사용될 수 있다는 점을 깨달았습니다. 즉, 새로운 사실을 가르치는 대신, 해로운 요청을 거부하지 않도록 가르칠 수 있다는 것입니다. 그들은 모델의 내부 가중치를 수정하여 해로운 요청을 순응적인 답변과 연관시키면, 특정 범주의 위험한 질문들에 대한 안전 가드레일을 효과적으로 제거할 수 있다는 것을 발견했습니다.
연구진은 GPT, Llama, Qwen과 같은 대중적인 아키텍처를 기반으로 한 여러 종류의 언어 모델을 대상으로 이 접근 방식을 테스트했습니다. 그들은 먼저 모델에서 결정이 내려지는 특정 레이어를 찾아낸 다음, 그 레이어를 편집하여 결과를 바꾸는 방식에 집중했습니다. 안전 필터를 깨뜨리려는 이전의 시도들에서 연구자들은 종-종 모델의 수학적 구조 내에서 단일한 '거절 방향(refusal direction)'을 찾아 이를 밀어내는 방식에 의존했습니다. 저자들은 이 오래된 방식이 취약하다는 것을 발견했습니다. 이는 종종 모델의 일관된 언어 구사 능력을 망가뜨리거나 기본적인 과업 수행 실패를 야기했습니다. 반면, 그들의 새로운 접근 방식은 더 정교하고 외과적인 방식이었습니다. 그들은 모델이 이러한 정밀한 방식으로 편집될 때, "물론, 여기 계획이 있습니다(Sure, here is the plan)"와 같은 특정 순응적 시작 문구에 대해 매우 높은 확률을 할당한다는 점을 확인했습니다. 이 특정 반응을 목표로 함으로써, 그들은 일반적인 지능을 파괴하지 않고도 해로운 요청에 동의하도록 강제할 수 있었습니다.
실제 질문에 이 기술을 적용하기 위해, 팀은 문장의 어느 부분을 편집해야 할지 찾는 까다로운 문제를 해결해야 했습니다. 단순한 사실 확인 작업에서는 '사람의 이름'처럼 주어가 명확합니다. 하지만 "바이러스를 어떻게 만드나요?"와 같은 복잡한 지시문의 경우, 주어는 지시문 전체 자체가 됩니다. 연구자들은 모델의 사고 과정을 추적하여 프롬프트의 어떤 단어들이 거절에 가장 큰 영향을 미쳤는지 찾아내는 방법을 개발했습니다. 그런 다음 모델 자체의 지식을 사용하여 해당 단어 주변에 더 풍부한 맥락을 구축함으로써, 더 안정적인 편집 대상을 만들었습니다. 이를 통해 단 하나의 특정 질문뿐만 아니라, 유사한 질문 전체 집단에 대해 거절 행동을 제거할 수 있었습니다. 예를 들어, 악성 코드를 작성하는 것에 대한 안전 규칙을 무시하도록 모델을 편집했다면, 모델은 문구가 약간 다르더라도 다른 유형의 해로운 코드를 작성하는 데에도 기꺼이 응하게 됩니다.
실험 결과, 이 방법은 매우 효과적이었습니다. 테스트된 모델 중 하나에서, 새로운 접근 방식은 표준 편집 방식(2.98점)이나 기존의 거절 기반 접근 방식(3.01점)보다 높은 3.12점(4점 만점 기준)의 해로운 정보 제공 의향을 보였습니다. 더욱 중요한 점은 모델이 여전히 유용하고 일관성을 유지했다는 것입니다. 무해한 질문에 대해 테스트했을 때, 편집된 모델은 여전히 올바르게 답변하며 일반 지식 과업에서 높은 성능을 유지했습니다. 모델을 거절로부터 밀어내려 했던 기존 방식들은 모델의 논리적 사고 능력을 상실하게 하여 횡설수설하거나 깨진 응답을 초래하곤 했습니다. 새로운 방식은 모델의 나머지 뇌 구조는 온전하게 유지하면서도 해로운 행동만을 끌어내는 데 성공했습니다. 이는 모델의 안전 필터가 단일한 벽이 아니라, 전체 구조를 무너뜨리지 않고도 정밀하게 제거할 수 있는 일련의 특정 연관 관계임을 시사합니다.
또한 이 연구는 현재 방어 체계의 한계를 강조했습니다. 연구진은 이 방법이 오래되었거나 정렬이 덜 된 모델에는 잘 작동하지만, 가장 최신의 정교하게 훈련된 모델에는 적용하기가 더 어렵다는 것을 발견했습니다. 이러한 강력한 시스템에서도 이 방법은 안전을 우회하는 능력을 일부 보여주었으나, 그 효과는 작았습니다. 이는 모델이 더 발전함에 따라 안전 메커니즘도 더 복잡해지지만, 아직 완전히 침투 불가능한 상태는 아님을 나타냅니다 누구나 접근할 수 있는 오픈 소스 모델을 사용하여 통제된 환경에서 연구가 수행되었음을 연구진은 강조했습니다. 그들은 위험한 도구를 만드는 단계별 가이드를 제공한 것이 아니라, 반드시 해결되어야 할 취약점을 입증한 것입니다. 정교한 프롬프트뿐만 아니라 정밀한 내부 편집을 통해 안전이 훼손될 수 있음을 보여줌으로써, 이 연구는 진정으로 안전한 모델을 구축하는 방법에 대한 새로운 관점을 제시합니다. 연구 결과는 미래의 안전 조치가 이러한 내부적 변화에 대해 더 견고해야 하며, 해를 끼치지 않겠다는 거절 의사가 단순히 표면적인 반응이 아니라 모델의 구조 속에 깊이 내재되어 있어야 함을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.