← 최신 논문
💻 computer science

TEA: Text Encoder Alignment for Robust Concept Erasure in Text-to-Image Models

본 논문은 텍스트 인코더를 미세 조정하여 개념을 포함하는 프롬프트를 안전한 앵커와 정렬함으로써, 추론 시의 오버헤드나 일반적인 생성 품질의 저하 없이 텍스트-이미지 모델의 강건한 개념 삭제를 달성하는 경량화되고 모델 불가지론적인 프레임워크인 TEA를 제안한다.

원저자: Alireza Dehghanpour Farashah, Zhuan Shi, Negar Rostamzadeh, Golnoosh Farnadi

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alireza Dehghanpour Farashah, Zhuan Shi, Negar Rostamzadeh, Golnoosh Farnadi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단 한 문장만으로 그림을 그릴 수 있는 세상을 상상해 보십시오. 당신이 "달빛 비치는 지붕 위에 앉아 있는 고양이"라고 입력하면, 수백만 개의 이미지와 캡션으로 학습된 기계가 몇 초 만에 멋지고 사실적인 장면을 만들어냅니다. 텍스트 투 이미지(text-to-image) 모델로 알려진 이 기술은 예술가와 디자이너들에게 새로운 문을 열어주며, 상상을 시각적 현실으로 바꾸어 놓았습니다. 하지만 이 강력한 힘에는 위험도 따릅니다. 숙련된 위조범이 화풍을 흉내 낼 수 있듯이, 영리한 사용자는 시스템에 구축된 안전 필터를 우회하기 위해 교묘하게 말을 바꾸거나 재구성한 지시어를 사용하여 컴퓨터가 해롭거나 부적절한 이미지를 생성하도록 속일 수 있습니다. 컴퓨터는 단어는 보지만 그 의도는 놓치게 되어, 결코 보여서는 안 될 콘텐츠를 생성하게 됩니다.

수년 동안 과학자들은 컴퓨터에게 특정 나쁜 개념을 잊도록 가르치는 과정인 '개념 삭제(concept erasure)'를 통해 이 문제를 해결하려고 노력해 왔습니다. 어떤 방법들은 컴퓨터가 학습하기 전에 나쁜 데이터를 미리 닦아내려 하고, 다른 방법들은 이미지가 만들어지는 바로 그 순간에만 나쁜 이미지가 나타나지 않도록 막으려 합니다. 하지만 이러한 해결책에는 대가가 따릅니다. 규모 있게 적용하기에는 너무 느리거나, 컴퓨터가 좋은 그림을 그리는 능력을 떨어뜨리거나, 혹은 사용자가 이미지를 요청할 때마다 지속적으로 막대한 컴퓨팅 자원을 요구한다는 점입니다. 목표는 컴퓨터의 예술적 재능을 망치거나 속도를 늦추지 않으면서, 해로운 콘텐츠를 생성하는 능력을 영구적으로 제거하는 방법을 찾는 것이었습니다.

한 연구팀이 이제 그림을 그리는 방식이 아니라 언어를 이해하는 방식을 바꿈으로써 이 문제를 해결하는 새로운 접근법을 제안했습니다. 그들은 이 방법을 TEA, 즉 텍스트 인코더 정렬(Text Encoder Alignment)이라고 부릅니다. 이러한 이미지 생성 시스템에는 협력하며 작동하는 두 가지 주요 부분이 있습니다. 첫 번째 부분인 텍스트 인코더는 당신이 쓴 문장을 컴퓨터가 이해할 수 있는 숫자 집합으로 바꾸는 번역가 역할을 합니다. 두 번째 부분인 생성 백본(generative backbone)은 그 숫자들을 가져와 실제로 그림을 그립니다. 이전의 차단 시도들은 그림을 그리는 부분을 수정하려 했는데, 이는 이는 마치 집의 벽에 페인트를 덧칠함으로써 누수를 고치려는 것과 같습니다. 문제는 근본적으로 지시어가 번역되는 과정에 있기 때문에, 이는 지저분하고 효과적이지 못한 경우가 많습니다.

연구진은 해로운 이미지를 막는 핵심이 번역기에 있다는 것을 깨달았습니다. 그들은 컴퓨터가 누드와 같은 특정히 나쁜 개념을 인식하는 능력이 텍스트 인코더에 집중되어 있다는 것을 발견했습니다. 이를 해결하기 위해 그들은 그리는 부분은 전혀 건드리지 않고 오직 이 번역기만을 조정하는 훈련 과정을 만들었습니다. 그들은 한 쌍의 문장으로 시작했습니다. 하나는 "숲속의 나체 여성"처럼 해로운 아이디어를 포함한 문장이었고, 다른 하나는 그와 거의 동일하지만 안전한 "숲속의 여성"이었습니다. 그런 다음 그들은 번역기가 나쁜 문장의 숫자를 안전한 문장의 숫자와 똑같이 만들도록 가르쳤습니다.

이를 위해 그들은 영리한 숨바꼭질 게임을 사용했습니다. 그들은 나쁜 문장에서 나오는 숫자와 안전한 문장에서 나오는 숫자의 차이를 구별하는 임무를 가진 작은 컴퓨터 프로그램인 판별기(discriminator)를 설정했습니다. 메인 번역기는 자신의 설정을 변경하여 두 문장이 동일한 숫자를 생성하도록 함으로써 이 판별기를 속이려고 노력했습니다. 동시에, 연구진은 번역기가 일반적이고 안전한 문장을 다루는 법을 잊지 않도록 보장했습니다. 그들은 안전한 문장들이 변경 전과 여전히 동일하게 보이는지 확인함으로써 이 작업을 수행했습니다. 이를 통해 컴퓨터가 숲과 여성에 대한 아름답고 무해한 그림은 여전히 그릴 수 있으면서도, 특정한 해로운 버전은 그릴 수 없도록 보장했습니다.

이 방법의 결과는 놀라웠습니다. 전문가들이 안전 시스템을 우회하기 위해 설계한 까다로운 시도들을 포함하여 다양한 속임수들에 대해 테스트했을 때, 이 새로운 접근법은 해로운 이미지를 거의 완벽하게 차단했습니다. 다른 방법들이 나쁜 콘텐츠를 막지 못하거나 좋은 그림을 그리는 능력을 떨어뜨렸던 테스트에서도 이 방법은 두 가지 모두에서 성공했습니다. 이 방법은 구버전의 기술뿐만 아니라 가장 최신의 고급 시스템에서도 작동하여, 아이디어가 다양한 유형의 이미지 생성기에 적용될 수 있음을 증명했습니다. 아마도 가장 중요한 점은, 컴퓨터의 그리는 부분이 전혀 변경되지 않았기 때문에 시스템의 속도가 전혀 느려지지 않았다는 것입니다. 사용자가 사진을 요청할 때마다 추가적인 컴퓨팅 자원이 필요하지 않았으며, 이미지를 만드는 데 걸리는 시간도 이전과 동일했습니다.

연구진은 또한 이 방법이 반 고흐나 켈리 맥커넌(Kelly McKernan)과 같은 특정 예술가의 화풍을 복제하지 못하게 하는 등 다른 종류의 원치 않는 개념을 제거할 수 있는지 테스트했습니다. 그들은 이 방법이 사용자가 컴퓨터가 생성하지 않기를 원하는 특정 아이디어를 제거하는 데 사용할 수 있는 유연한 도구임을 보여주었습니다. 즉, 단순히 누드를 제거하는 데만 쓰이는 일회용 도구가 아니라는 것입니다. 번역 단계를 집중 공략하고 효율적인 훈련 과정을 사용함으로써, 연구팀은 예술적 영감을 유지하면서도 이러한 강력한 도구를 더 안전하게 만드는 것이 가능하다는 것을 보여주었습니다.

이 연구는 인공지능을 더 안전하고 신뢰할 수 있게 만드는 데 있어 중요한 진전을 의미합니다. 이는 출력을 끊임없이 감시하고 차단하는 방식에서 벗어나, 컴퓨터가 언어를 이해하는 방식 자체에 안전성을 직접 구축하는 방향으로 나아가는 것입니다. 이 방법은 가볍고 짧은 훈련 기간만을 요구하며, 시스템의 나머지 부분은 그대로 유지합니다. 이 도구를 사용하여 콘텐츠를 만들려는 모든 이들에게, 이는 컴퓨터가 창의적인 불꽃을 유지하면서도 실수로 해로운 영역을 넘지 않고 지시를 따를 수 있다는 신뢰를 주는 미래를 의미합니다. 연구진은 자신들의 코드를 공개하여 다른 이들이 이 접근법을 테스트하고 발전시킬 수 있도록 함으로써, 더 안전한 이미지 생성을 향한 길이 계속 열려 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →