← 최신 논문
🤖 AI

I-CARE: Analysis of interference-related phenomena in a controllable, diverse and representative unlearning setting for text-to-image models

이 논문은 텍스트-투-이미지 모델 언러닝에서 간섭 관련 현상을 분석하기 위한 체계적인 방법론과 표준화된 도구를 제공하여, 다양한 설정에 걸쳐 의도치 않은 지식 저하를 체계적이고 재현 가능한 방식으로 평가할 수 있게 하는 I-CARE를 소개한다.

원저자: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

게시일 2026-09-02
📖 5 분 읽기🧠 심층 분석

원저자: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

지난 몇 년 동안 인공지능은 단어를 통해 그림을 그리는 법을 배웠습니다. "모자를 쓴 고양이"와 같은 문장을 입력하면, 컴퓨터 프로그램은 그 설명에 부합하는 독특한 이미지를 생성합니다. 생성 모델(generative models)이라고 불리는 이러한 시스템은 방대한 이미지와 텍스트 컬렉션을 학습하여 단어와 시각적 패턴을 연관시키는 법을 배웁니다. 하지만 이러한 도구들이 더욱 강력해짐에 따라 새로운 문제가 발생했습니다. 바로, 무언가를 '잊게' 만들고 싶을 때 어떤 일이 벌어지는가 하는 점입니다.

특정 유명인을 그리도록 학습된 모델이 있다고 가정해 봅시다. 그런데 그 사람이 개인정보 보호 문제나 디지털 발자국을 통제하려는 목적 등으로 자신의 이미지를 시스템에서 제거해 달라고 요청할 수 있습니다. '기계 망각(machine unlearning)'이라고 불리는 이 과정은 AI 시스템이 다른 모든 것을 그리는 능력은 손상시키지 않으면서 특정 개념만을 "망각"하도록 만드는 시도입니다. 이는 매우 섬세한 작업입니다. 만약 한 가지를 너무 공격적으로 지우려 한다면, 모델은 의도치 않게 관련 없는 다른 지식까지 손상시킬 수 있습니다. 특정 견종을 그리려는 모델이 모든 개를 잘 못 그리게 될 수도 있고, 특정 정치인을 제거하려는 모델이 다른 공인들의 이미지를 왜곡하여 생성하기 시작할 수도 있습니다. 이처럼 관련 개념에 발생하는 의도치 않은 손상을 '간섭(interference)'이라고 하며, 지금까지 과학자들은 이것이 얼마나 심각한지 또는 왜 발생하는지를 측정할 신뢰할 만한 방법을 가지고 있지 않았습니다.

한 연구팀은 이 문제를 연구하기 위해 I-CARE라는 새로운 프레임워크를 도입했습니다. 이들은 데이터를 지우는 새로운 방법이나 새로운 AI 모델을 발명하는 대신, 서로 다른 삭제 기술이 시스템의 나머지 부분에 어떤 영향을 미치는지 테스트하는 표준화된 방법을 구축했습니다. 이것은 마치 손상을 측정하기 위한 새로운 자(ruler)와 같습니다. 이 연구 이전의 망각 연구들은 종-종 일관성이 없었습니다. 어떤 팀은 사람을 잊는 것을 테스트하고 다른 팀은 풍경을 잊는 것을 테스트하여 결과를 공정하게 비교하는 것이 불가능했습니다. I-CARE 프레임워크는 실험을 설정하기 위한 공통 언어와 엄격한 규칙을 제공합니다. 이 프레임키는 무언가를 "잊는다"는 것이 정확히 무엇을 의미하는지, 남은 이미지의 품질을 어떻게 측정하는지, 그리고 어떤 관련 없는 개념들이 피해를 입었는지 추적하는 방법을 정의합니다. 또한 연구진은 코드를 작성하거나 복잡한 수학을 이해할 필요 없이 누구나 이 결과를 탐색할 수 있도록 'Forgety'라는 무료 오픈 소스 소프트웨어 도구를 제작했습니다.

연구진은 이 방법이 효과적인지 증명하기 위해 대규모 실험을 수행했습니다. 그들은 유명인, 특정 견종, 그리고 숲이나 경기장 같은 다양한 장면이라는 세 가지 뚜렷한 카테고리를 선택했습니다. 각 카테고리에 대해 특정 배우, 특정 테리어 종, 또는 특정 종류의 다리와 같이 100개의 구체적인 엔티티(entity)를 선정했습니다. 그런 다음 최첨단 이미지 생성기에 세 가지 서로 다른 망각 기술을 적용하여 한 번에 하나의 엔티티를 제거했습니다. 총 900개의 서로 다른 개념을 지워야 했으며, 무엇이 일어나는지 확인하기 위해 36만 개의 새로운 이미지를 생성했습니다. 그들은 단순히 대상이 사라졌는지만을 보기 위해서가 아니라, 그 카테고리의 나머지 99개 엔티티를 그리는 모델의 능력이 변했는지를 확인하기 위해 이 작업을 수행했습니다.

결과는 간섭이 과학자들이 이전에 생각했던 것보다 훨씬 더 복잡하다는 것을 보여주었습니다. 흔한 가설은 모델이 지워지는 것과 매우 유사한 개념에만 영향을 줄 것이라는 것이었습니다. 예를 들어, 골든 리트리버를 지운다면 래브라도 리트리버는 피해를 입고 푸들은 괜찮을 것이라고 예상할 수 있습니다. 그러나 연구 결과는 이것이 항상 사실은 아니라는 것을 밝혀냈습니다. 때때로 하나의 엔티티를 지우는 것이 전혀 관련 없어 보이는 엔티티에 상당한 손상을 입히는 반면, 매우 유사한 것들은 그대로 두기도 했습니다. 어떤 경우에는 손상이 너무 예측 불가능해서 연구진이 이를 설명할 간단한 규칙을 찾을 수 없었습니다. 그들은 데이터가 삭제되는 방식에 따라 발생하는 피해의 양이 크게 달라진다는 것을 발견했습니다. 게임 이론 접근 방식에 기반한 한 가지 방법은 테스트된 다른 두 가지 방법보다 훨씬 더 많은 부수적 피해를 일으켰습니다. 추가 데이터가 필요하지 않은 다른 방법은 전체적인 피해는 적었지만 예측하기는 더 어려웠습니다.

또한 연구진은 남은 개념들을 보호하기 위해 사용한 데이터가 결과에 어떤 영향을 미치는지 살펴보았습니다. 그들은 모델이 대상을 잊는 동안 유사한 것들의 사례를 보여주면, 그 유사한 것들을 보호하는 데 훨씬 더 효과적이라는 것을 발견했습니다. 예를 들어, 축구장을 지우려고 할 때, 모델이 지우는 과정 중에 다른 스포츠 경기장의 사진을 능동적으로 보여주어야만 다른 스포츠 경기장들을 안전하게 유지할 수 있었습니다. 만약 이러한 예시들이 없다면, 모델은 모든 스포츠 경기장의 이미지를 실수로 저하시켰습니다. 이는 모델이 "잊는" 동안 어떻게 "기억"하도록 훈련받는지가 "지우는" 기술 자체만큼 중요하다는 것을 시사합니다.

아마도 가장 놀라운 발견은 간섭이 항상 파괴적인 것만은 아니라는 점일 것입니다. 약 2.7%의 사례에서 연구진은 하나의 개념을 지우는 것이 유사한 개념의 이미지를 약간 더 좋게 만든다는 것을 관찰했습니다. 예를 들어, 유명한 레이싱 카 드라이버의 이미지를 지웠을 때, 모델이 유명한 수영 선수를 그리는 능력이 약간 향 향상되었습니다. 연구진은 이를 "건설적 간섭(constructive interference)"이라고 부릅니다. 비록 드물게 발생했지만, 이는 AI 모델 내의 개념 간 관계가 단순히 한 방향으로만 흐르는 것이 아님을 증명합니다. 즉, 어떤 것을 지우는 것이 항상 다른 것을 해치는 것은 아닙니다. 때로는 특정 패턴을 제거함으로써 모델이 관련 패턴에 대한 이해를 정교하게 다듬을 수 있게 됩니다.

연구는 또한 이러한 결과를 예측하는 것의 어려움을 강조했습니다. 연구진은 인간이 보기에 얼마나 유사한지에 기초하여 어떤 개념들이 서로 간섭할지 추측할 수 있는 시스템을 구축하려고 시도했습니다. 그들은 이러한 예측이 자주 틀린다는 것을 발견했습니다. 인간에게 매우 비슷해 보이는 두 엔티티는 모델 내에서 서로 간섭하지 않을 수 있는 반면, 서로 달라 보이는 두 엔티티가 엄청난 피해를 줄 수도 있었습니다. 이는 이러한 AI 모델의 내부 논리가 여전히 우리에게 큰 미스터리임을 시사합니다. 우리는 피해를 볼 수는 있지만, 지우기 전에는 어디에서 피해가 발생할지 신뢰할 수 있게 예측할 수는 없습니다.

이러한 발견을 쉽게 접할 수 있도록, 팀은 'Forgety'라는 웹 기반 인터페이스를 만들었습니다. 이 도구는 사용자가 프로그래머가 아니더라도 실험 결과를 찾아보고, 어떤 개념들이 서로 간섭하는지 시각화하며, 데이터를 탐색할 수 있게 해줍니다. 이는 수천 개의 복잡한 데이터 포인트를 누구나 이해할 수 있는 간단한 차트와 목록으로 변환해 줍니다. 이러한 투명성은 그들 작업의 핵심적인 부분인데, 정책 입안자, 윤리학자, 그리고 대중이 AI 시스템을 잊게 만드는 시도의 실제적인 결과를 볼 수 있게 해주기 때문입니다.

논문은 우리가 기계 망각을 이해하는 데 진전을 이루었지만, 아직 이를 수행하는 단 하나의 "최선의" 방법은 없다고 결론짓습니다. 지우는 방법의 효과는 전적으로 특정 작업과 사용된 데이터에 달려 있습니다. 연구진은 자신들의 프레임워크가 진화하도록 설계되었다는 점을 강조합니다. 새로운 AI 모델이 만들어지고 데이터를 지우는 새로운 방법이 발명됨에 따라, I-CARE 방식은 이를 테스트하는 데 적용되어 이 분야가 명확하고 비교 가능하며 재현 가능한 결과와 함께 앞으로 나아갈 수 있도록 보장할 수 있습니다. 궁극적인 목표는 단순히 AI가 잊게 만드는 것이 아니라, 그 과정에서 AI의 나머지 지능을 망가뜨리지 않고, 이 강력한 도구들이 모두에게 안전하고 신뢰할 수 있는 상태로 남도록 하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →