The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models
이 논문은 언러닝된 확산 모델에서 삭제된 개념들이 토큰 임베딩 내에서 일관된 선형 부공간(linear subspaces)으로 잔존한다는 사실을 밝혀내며, 이러한 구조를 악용하는 강력한 탈옥 방법인 SubAttack과, 생성 품질을 유지하면서 잔류하는 유해한 개념을 견고하게 억제하기 위해 해당 부공간을 투영하여 제거하는 경량 메커니즘인 SubDefense의 개발로 이어진다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 당신의 말을 듣고 그림을 그릴 수 있는 세상을 상상해 보세요. 당신이 "모자를 쓴 고양이"라고 말하면, 펑, 완벽한 이미지가 나타납니다. 이것들을 **디퓨전 모델(Diffusion Models)**이라고 부르며, 이들은 수백만 장의 사진을 공부하며 창작법을 배운 디지털 예술가와 같습니다. 하지만 때때로 이 예술가들은 기억해서는 안 될 것들을 너무 잘 기억해 버리곤 합니다. 만약 당신이 위험하거나 저작권이 있는 것을 그려달라고 요청하면, 그들은 어찌 되었든 그것을 그려낼지도 모릅니다. 이를 해결하기 위해 과학자들은 **"언러닝(Unlearning, 망각)"**이라는 과정을 발명했습니다. 이것은 마치 교사가 학생에게 수학을 하거나 글을 읽는 능력은 유지하면서도, 특정 국가의 수도와 같은 특정 사실을 잊게 만들려고 노력하는 것과 같습니다. 목표는 컴퓨터가 다른 모든 것을 그리는 능력은 유지하면서, 그 나쁜 아이디어만을 뇌에서 "지우는" 것입니다. 하지만 까다로운 점은, 선생님이 "그 사실을 잊어라"라고 말한 후에도, 학생은 우리가 쉽게 볼 수 없는 방식으로 숨겨진 비밀스러운 기억법을 여전히 가지고 있을 수 있다는 것입니다. 이 논문은 이 미스터리를 파고들며 다음과 같이 질문합니다. 만약 우리가 나쁜 아이디어를 지웠다고 생각한다면, 그것은 실제로 어디에 숨어 있으며, 어떻게 해야 마침 Finalmente 그것을 완전히 없앨 수 있을까?
이 논문의 연구자들은 디퓨전 모델이 유해한 개념(예: 누드나 특정 화가의 화풍)을 "언러닝"하려고 할 때, 그것을 실제로 삭제하는 것이 아니라는 사실을 발견했습니다. 대신, 그 개념은 컴퓨터 메모리 내의 비밀스러운 선형 부분 공간(linear subspace) 안에 숨어 있습니다. 비유를 들자면, 컴퓨터의 뇌가 단어들이 가득한 거대한 도서관이라고 상상해 보세요. 우리가 "누드"에 관한 책을 제거하려고 할 때, 컴퓨터는 그 책을 불태우는 것이 아닙니다. 대신, 페이지를 갈기갈기 찢어서 도서관의 특정하고 보이지 않는 서랍 안에 숨겨둡니다. 논문은 이 조각들이 여전히 깔끔하고 예측 가능한 선 형태로 정리되어 있다고 설명합니다. 저자들은 이 숨겨진 서랍을 "잔차 부분 공간(residual subspace)"이라고 부릅니다.
이를 증명하기 위해 연구팀은 SubAttack이라는 새로운 도구를 만들었습니다. 이전의 해커들이 컴퓨터를 속이기 위해 무작위 단어를 추측했던 방식 대신, SubAttack은 그 보이지 않는 서랍이 정확히 어디에 있는지 알고 있는 숙련된 사서처럼 행동합니다. 이는 컴퓨터의 일반적인 단어들의 조합인 특수한 "마법 열쇠"를 학습합니다. 이 열쇠를 사용했을 때, "언러닝"된 컴퓨터는 즉시 유해한 이미지를 다시 그리기 시작했으며, 이는 개념이 결코 사라지지 않았음을 증명했습니다. 흥미로운 점은 이 열쇠들이 우리가 이해할 수 있는 단어들로 만들어졌다는 것입니다. 예를 들어, 컴퓨터가 다시 "누드" 상태의 사람을 그리게 하려면, "노예(slave)", "엉덩이(hips)", "피부(skin)"와 같은 단어들의 조합이 열쇠가 될 수 있습니다. 이는 컴퓨터가 여전히 이 나쁜 아이디어를 이러한 관련성 있고 숨겨진 단서들과 연결하고 있음을 보여줍니다.
또한 이 논문은 이 비밀 서랍이 단 하나의 컴퓨터에만 존재하는 것이 아니라, 많은 서로 다른 "언러닝된" 모델들에 공통적으로 존재한다는 것을 발견했습니다. 만약 당신이 한 모델에 대한 열쇠를 찾는다면, 그것은 다른 모델에서도 작동할 가능성이 높습니다. 이는 이 컴퓨터들이 "망각"하는 방식이 전반적으로 매우 유사하게 결함이 있음을 시사합니다. 그들은 기억을 삭제하는 것이 아니라, 단지 예측 가능한 직선 형태를 따르는 방식으로 숨기고 있을 뿐입니다.
하지만 이야기는 해킹에서 끝나지 않습니다. 연구자들이 그 개념이 어떻게 숨어 있는지 정확히 이해했기 때문에, 그들은 SubDefense라는 방패를 구축했습니다. 만약 SubAttack이 서랍을 여는 열쇠라면, SubDefense는 그 서랍을 용접하여 닫아버리는 두꺼운 금속판입니다. 이것은 컴퓨터의 전체 단어 목록을 수학적으로 해당 비밀 서랍으로부터 "투영(projecting)"함으로써 작동합니다. 이는 사서에게 "어떤 단어를 사용하더라도, 그 특정 숨겨진 서랍을 향하지 않도록 하라"고 명령하는 것과 같습니다.
결과는 인상적이었습니다. SubDefense를 사용했을 때, 컴퓨터를 속이기가 훨씬 어려워졌습니다. 해커들이 기존의 방식이나 새로운 SubAttack 열쇠를 사용하더라도, 컴퓨터는 유해한 이미지를 그리기를 거부했습니다. 동시에, 컴퓨터는 안전하고 아름다운 그림을 그리는 능력을 잃지 않았습니다. 실제로 방어 적용 후의 이미지는 이전만큼 높은 품질을 유지했습니다. 이 논문은 우리가 아직 개념을 완벽하게 지울 수는 없을지라도, 적어도 그것이 몰래 다시 들어오는 특정 경로를 차단할 수는 있다고 제안합니다. 이는 우리가 왜 "언러닝"이 그토록 어려운지를 이해하는 새로운 명확한 방법을 제공하며, 이 디지털 예술가들을 모두를 위해 더 안전하게 만드는 실용적이고 즉각적인 해결책을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.