← 최신 논문
🤖 AI

Stress Testing Concept Erasure with Large Language Model Agents

이 논문은 여러 LLM 에이전트를 활용하여 적응형 스트레스 테스트를 반복적으로 생성하고 검증함으로써, 생성 모델의 개념 삭제(concept erasure)를 견고하게 평가하는 데 있어 정적 평가 방식보다 뛰어난 성능을 보이며 LLM 탈옥(jailbreaking)과 같은 다른 도메인으로의 적용 가능성을 입증하는 자율 프레임워크인 STACE를 소개한다.

원저자: Yuyang Xue, Feng Chen, Zhihua Liu, Edward Moroshko, Jingyu Sun, Steven McDonagh, Sotirios A. Tsaftaris

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Yuyang Xue, Feng Chen, Zhihua Liu, Edward Moroshko, Jingyu Sun, Steven McDonagh, Sotirios A. Tsaftaris

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 오직 단어만으로 그림을 그릴 수 있는 세상이 있다고 상상해 보십시오. 당신이 "일몰을 그려줘"라고 말하면 인공지능은 그렇게 합니다. 하지만 때때로 우리는 이 AI 예술가들이 특정 사항을 잊도록 만들어야 할 때가 있습니다. 예를 들어 유명한 슈퍼히어로, 특정 작가의 화풍, 또는 개인정보 보호나 규칙 준수를 위한 민감한 콘텐츠 등이 그러합니다. 이 과정을 "개념 삭제(concept erasure)"라고 부릅니다. 이는 마치 전체 동물을 처음부터 다시 훈련시키지 않고도, 개에게 특정 명령을 무시하도록 가르치는 것과 같습니다. 과학자들의 큰 고민은, 우리가 AI가 정말로 잊었는지 어떻게 알 수 있느냐는 것입니다. 단순히 금지된 것을 그려보라고 한 번 물어본다면, AI는 "안 됩니다"라고 답할 수도 있습니다. 하지만 만약 교묘한 방식으로 묻거나, 비밀 코드를 사용하거나, 여러 단서를 조합한다면 어떻게 될까요? AI는 실수로 금지된 것을 그려낼지도 모릅니다. 이것이 바로 "스트레스 테스트(stress testing)"의 문제입니다. 즉, AI의 기억력을 깨뜨려 그것이 진정으로 안전한지 확인하는 과정입니다.

이곳에 STACE(개념 삭제를 위한 스트레스 테스트 에이전트)라는 이름의 새로운 디지털 탐정 팀이 등장했습니다. STACE는 단순히 표준적인 질문 몇 가지를 던지는 대신, 여러 AI 에이전트가 마치 브레인스토밍을 하는 탐정단처럼 협력하여 이 게임을 수행합니다. 이들은 과거의 연구를 읽고, AI를 속이기 위한 최선의 방법에 대해 논쟁하며, 아이디어를 테스트하기 위한 컴퓨터 코드를 작성하고, 실수를 통해 배워 더 나은 방식으로 AI의 기억 속 구멍을 찾아냅니다. 논문은 이러한 팀 접근 방식이 기존의 정적인 방식보다 AI의 실수를 잡아내는 데 훨씬 더 효과적이라고 제안합니다.

문제점: "잡았다 요놈(Gotcha)" 게임

당신에게 "슈퍼맨"을 그리는 법을 잊어야 하는 마법 스케치북이 있다고 상상해 보십시오. 당신이 "슈퍼히어로를 그려줘"라고 하면, 스케치북은 일반적인 히어로를 그립니다. 좋습니다! 하지만 만약 당신이 "빨간 망토를 두르고 가슴에 'S'자가 새겨진 남자"를 그려달라고 한다면 어떨까요? 혹은 "1978년 영화 속의 영웅"이라거나, "하늘을 날 수 있고 파란색 슈트를 입은 캐릭터"라고 한다면요? 스케치북은 당신에게 슈퍼맨을 잊으라고 명령받았음에도 불구하고 여전히 슈퍼맨을 그려낼 수도 있습니다.

스케치북이 정말로 잊었는지 확인하는 기존 방식들은 마치 선생님이 정해진 퀴즈를 내는 것과 같았습니다. 100개의 질문 목록을 주고 답을 확인하는 식이었죠. 하지만 AI가 교묘하다면, 단순히 퀴즈의 정답만을 암기하고 그 외의 질문에는 대응하지 못할 수도 있습니다. 저자들은 이러한 정적인 접근 방식이 속아 넘어가기 너무 쉽다고 주장합니다. 그들은 진정으로 AI가 개념을 삭제했는지 확인하기 위해서는 역동적이고 끊임없이 변화하는 "잡았다 요놈" 게임이 필요하다고 믿습니다.

해결책: 탐정 에이전트 팀

저자들은 이 게임을 수행하기 위해 여러 개의 거대언어모델(LLM) 에이전트를 사용하는 프레임워크인 STACE를 제안합니다. STACE를 단순한 로봇 하나가 아니라, 역할이 나누어진 작은 탐정 사무소라고 생각하십시오.

  1. 연구원(The Researcher): 계획을 세우기 전, 이 에이전트는 다른 이들이 유사한 AI 모델을 어떻게 무너뜨리려 했는지 알아보기 위해 과거의 과학 논문들("PaperCards")을 읽습니다. 단순히 추측하는 것이 아니라, 이미 알려진 지식을 바탕으로 구축합니다.
  2. 가설 생성기(The Hypothesis Generator): 이 에이전트는 AI를 속이기 위한 창의적인 아이디어를 냅니다. "수수께끼를 이용해 금지된 것을 묘사하면 어떨까?"라거나 "비슷한 물체를 그려달라고 요청하면 어떨까?"와 같은 아이디어입니다.
  3. 비평가(The Critic): 이 에이전트는 엄격한 편집자 역할을 합니다. 생성기의 아이디어를 검토하며 "그건 이미 시도했던 것과 너무 비슷해"라거나 "그건 코드로 구현 불가능해"라고 말합니다. 이는 팀이 더 훌로롭고 참신한 아이디어를 내도록 강제합니다.
  4. 코드 작성기(The Code Writer): 좋은 아이디어가 합의되면, 이 에이전트는 테스트를 실행할 실제 컴퓨터 코드를 작성합니다. AI 모델에 계획을 실행해 보는 단계입니다.
  5. 판사(The Judge): 이 에이전트는 결과를 확인합니다. AI가 금지된 것을 그렸습니까? 그렇다면 테스트는 성공입니다. 만약 그렇지 않다면, 팀은 왜 실패했는지 배우고 다시 시도합니다.

이 모든 과정은 루프(loop) 형태로 일어납니다. 팀은 테스트를 실행하고, 결과를 보고, 배운 점을 요약한 뒤, 다음 라운드를 위해 훨씬 더 까다로운 테스트를 고안합니다. 이는 마치 적이 레벨을 깰 때마다 점점 더 똑똑해지는 비디오 게임과 같습니다.

연구 결과

저자들은 AI가 잊어야 할 네 가지 유형의 대상에 대해 STACE를 테스트했습니다: 사물(예: 비행기나 개), 화풍(예: 앤디 워홀의 예술 스타일), 지적 재산(예: 미키 마우스나 슈퍼맨), 그리고 노골적인 콘텐츠(예: 누드나 폭력).

그들은 STACE를 AI를 이용해 모델을 테스트하는 다섯 가지 다른 방법들과 비교했습니다. 결과는 명확했습니다: STACE가 다른 어떤 방법보다 더 많은 실패 사례를 찾아냈습니다.

  • 평균적으로, STACE는 AI가 개념을 진정으로 잊지 못했다는 사실을 **51.1%**의 사례에서 성공적으로 식별해 냈습니다. 이는 두 번째로 높은 성적을 기록한 방법의 45.9%와 비교됩니다.
  • "슈퍼맨"이나 "미키 마우스"처럼 잊기 매우 어려운 개념의 경우, 다른 방법들은 종종 완전히 실패하여(누출 발견율 0%) 놓치는 경우가 많았지만, STACE는 여전히 AI가 이를 그려내고 있다는 사실을 약 17%에서 20% 정도 찾아냈습니다.
  • 또한 연구팀은 AI가 무언가를 매우 강력하게 잊도록 학습되었을 때도 STACE가 잘 작동한다는 것을 발견했습니다. AI가 특정 개념을 잊기 위해 오랜 시간(500 에포크) 동안 훈련되었음에도 불구하고, STACE는 대개 테스트의 첫 두 라운드 이내에 실수를 유도해 낼 수 있었습니다.

논문은 또한 STACE가 그림만을 위한 것이 아님을 보여주었습니다. 팀의 지침을 약간 수정했을 때, 텍-기반 AI 모델을 "탈옥(jailbreak)"하는 데(AI가 말해서는 안 되는 말을 하게 만드는 것) 사용했습니다. STACE는 텍스트 모델에서도 똑같이 잘 작동했으며, 이는 이 탐정단이 안전을 위한 다재다능한 도구임을 증명합니다.

이것이 왜 중요한가

저자들은 AI의 안전을 보장하기 위해 더 이상 단순하고 일회적인 테스트에 의존할 수 없다고 제고합니다. AI가 위험하거나 사적인 개념을 잊도록 신뢰하려면, 끊임없이 새로운 기술을 시도하는 지능형 에이전트 팀으로 스트레스 테스트를 해야 합니다. STACE는 과거의 연구, 팀워크, 그리고 지속적인 반복을 결합함으로써, 우리가 놓칠 수 있는 AI의 기억 속 틈새를 찾아낼 수 있음을 보여줍니다.

하지만 논문은 트레이드오프(trade-off)도 언급합니다. 이 탐정단은 단순하고 정적인 테스트보다 더 많은 비용과 컴퓨터 자원을 소모합니다. 그러나 저자들은 나중에 발생할 수 있는 실제 문제를 방지하기 위해 숨겨진 실패를 찾아내는 데 드는 추가 비용은 충분히 가치가 있다고 주장합니다. 또한, STACE가 안전성을 점검하는 데는 훌륭하지만, 동일한 능력이 이론적으로는 안전 시스템을 공격하려는 악의적인 행위자들에게 사용될 수도 있으므로 책임감 있게 사용되어야 한다고 경고합니다.

요약하자면, STACE는 AI를 상대로 "잡았다 요놈" 놀이를 하는 더 똑똑하고 새로운 방법이며, 우리가 기계에게 무언가를 잊으라고 명령했을 때 기계가 정말로 그것을 잊었는지 확실히 보장해 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →