← 최신 논문
🤖 machine learning

Signed Rectified Flow: Negativity-Controlled Generation

이 논문은 이미지 품질과 다양성을 유지하면서 원치 않는 콘텐츠(누드 또는 암기된 데이터 등)를 억제하기 위해 원칙적인 부정적 정보의 통합을 가능하게 하는, 부호 있는 측도(signed measures)를 다루도록 Rectified Flow를 확장한 생성 모델링 프레임워크인 Signed Rectified Flow를 소개한다.

원저자: Runlong Liao, Baiyu Su, Lizhang Chen, Qiang Liu

게시일 2026-07-22
📖 6 분 읽기🧠 심층 분석

원저자: Runlong Liao, Baiyu Su, Lizhang Chen, Qiang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 그림 그리는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 수천 장의 아름다운 일몰 사진을 보여주었고, 로봇은 그것을 바탕으로 자신만의 일몰을 만드는 법을 배웠습니다. 하지만 만약 당신이 로봇에게 무엇을 '그리지 말아야 하는지'도 가르치고 싶다면 어떻게 될까요? 예를 들어, 못생긴 낙서를 그리지 않기를 원하거나, 혹은 미키 마우스 같은 특정 저작권이 있는 캐릭터를 베끼지 않기를 원할 수도 있습니다. 인공지능의 세계에서 이것은 까다로운 퍼즐입니다. 보통 AI 모델은 무엇을 해야 하는지를 보여줌으로써 학습하지만, 단순히 "그렇게 하지 마"라고 말하는 것에는 어려움을 겪습니다. 이는 마치 개에게 그냥 가만히 서 있는 것으로 다람쥐를 쫓지 말라고 말하는 것과 같습니다. 개는 자신의 에너지를 어디에 써야 할지 알 수 없기 때문입니다.

이 논문은 컴퓨터가 무(random noise)로부터 새로운 이미지, 소리, 또는 경로를 만들어내는 "생성 모델링(generative modeling)"이라는 AI의 특정 분야를 깊이 있게 다룹니다. 저자들은 "정류 흐름(Rectified Flow)"이라 불리는 기술을 기반으로 연구를 진행하고 있는데, 이 기술은 무작위적인 노이즈를 선명한 그림으로 바꾸는 매우 효율적인 고속도로와 같습니다. 이것을 혼란스러운 먼지 구름을 완벽한 조각상으로 안내하는 곧고 빠른 기차 선로라고 생각해보세요. 여기서 핵심적인 질문은 다음과 같습니다: 우리가 원하는 '쓰레기 더미'로부터 먼지를 능동적으로 밀어내면서도, 동시에 먼지를 조각상으로 안내할 수 있는 기차 선로를 어떻게 구축할 것인가?

저자들은 영리한 새로운 방법인 **부호 정류 흐름(Signed Rectified Flow)**을 소개합니다. AI를 단순히 나쁜 것들로부터 멀어지도록 유도하는 대신, 수학적으로 "나쁜 것들"을 "음의 질량(negative mass)"을 가진 것으로 취급합니다. AI의 창의적 공간을 하나의 풍경이라고 상상해 보세요. 보통 AI는 높은 지대(좋은 그림)에 끌립니다. 이 새로운 방법은 나쁜 그림들 위에 "음의 중력" 지대를 생성합니다. 이는 마치 AI의 창의적 에너지를 밀어내는 거대한 보이지 않는 자석을 배치하는 것과 같아서, AI가 금지된 구역을 돌아 안전하고 아름다운 영역에 안착하도록 강제합니다. 저자들은 2D 지도부터 복잡한 이미지에 이르기까지 다양한 테스트를 진행했으며, 결과는 이 방식이 예술적 품질을 해치지 않으면서도 AI를 더 안전하고 순종적으로 만드는 강력한 방법임을 시사합니다.

"음의" 중력의 마법

이것이 어떻게 작동하는지 이해하기 위해, AI의 여정을 노이즈가 가득한 산의 샘물(무작위 정적)에서 평온한 호수(최종 이미지)로 흘러가는 강의 흐름이라고 상상해 봅시다. 표준적인 AI에서는 물을 호수로 안내하기 위해 채널을 구축할 뿐입니다. 하지만 만약 중간에 피해야 할 늪이 있다면 어떨까요?

저자들은 매혹적인 아이디어를 제안합니다. 바로 늪을 **음의 물(negative water)**을 가진 것으로 취급하는 것입니다. 현실 세계에 음의 물은 존재하지 않지만, 수학에서는 존재합니다. 그들은 좋은 영역은 양의 물을, 나쁜 영역은 음의 물을 가진 "부호화된(signed)" 지도를 만듭니다. AI가 이 지도를 통해 흐르려고 할 때, 음의 물은 밀어내는 힘으로 작용합니다. 그것은 그냥 가만히 있는 것이 아니라, 강물을 밀어냅니다.

여기서 놀라운 점은, AI가 실제로 음의 늪을 통과하지 않는다는 것입니다. 대신 수학적으로 "유령 영역(ghost region)" 또는 장벽을 만들어냅니다. 강물은 자연스럽게 음의 구역을 우회하여, 완전히 양의 영역인 안전한 경로를 찾게 됩니다. 이는 마치 절벽 가장자리로부터 밀려나는 느낌을 받는 등산객과 같습니다. 지형 자체가 위험으로부터 멀어지는 방향으로 기울어져 있기 때문에 등산객은 결코 떨어지지 않습니다.

"전하 입자" 비유

저자들은 이를 재미있는 물리학 비유인 **전하 입자(charged particles)**를 사용하여 설명합니다. AI의 데이터 포인트들을 작은 입자라고 상상해 보세요. 좋은 데이터(예: 고양이 사진)는 양전하를 가지고, 나쁜 데이터(예: 고양이를 원했는데 나온 개 사진)는 음전하를 가집니다.

AI가 새로운 이미지를 생성할 때, 이는 여정의 시작점에서 양전하 입자를 방출하는 것과 같습니다. 입자가 앞으로 나아감에 따라, 입자는 음전하로부터 강한 반발력을 느낍니다. 만약 입자가 "나쁜" 구역에 너무 가까워지면, 그 반발력이 벽처럼 작용하여 입자를 다시 좋은 쪽으로 튕겨냅니다. 논문은 이 방식이 AI가 안전하게 탐색할 수 있는 "도달 가능 영역(reachable region)"을 만드는 동시에, "음의 영역"은 완전히 건드리지 않은 채로 유지한다는 것을 보여줍니다. AI는 수학적 흐름 덕분에 그 경계를 넘는 것이 물리적으로 불가능하기 때문에 실수로라도 금지된 영역에 발을 들여놓지 않습니다.

실험실에서의 발견

연구팀은 단순히 이론에 그치지 않고 여러 방식으로 테스트를 진행했으며, 결과는 매우 유망합니다.

1. 2D 토이 맵 (2D Toy Maps)
먼저 간단한 2D 지도로 실험했습니다. "좋은 섬"과 "나쁜 늪"이 있는 지도를 상상해 보세요. 기존의 방식을 사용했을 때, AI는 늪에 갇히거나 혹은 너무 멀리 밀려나 황폐한 사막에 도달했습니다. 하지만 부호 정류 흐름을 사용하자, AI는 늪을 완전히 피하면서도 섬 전체를 완벽하게 커버하며 좋은 섬 위에 머물렀습니다. 이는 마치 정확히 어디로 가지 말아야 할지를 아는 완벽한 GPS와 같았습니다.

2. "역-암기" 테스트 (The "Anti-Memorization" Test)
AI에 대한 가장 큰 우려 중 중 하나는 AI가 훈련 데이터의 사진을 그대로 복사해서 붙여넣는 것(암기)입니다. 저자들은 이 방법을 사용하여 AI에게 "훈련 중에 본 사진을 똑같이 복사하지 마라"고 명령했습니다. 그들은 훈련 데이터를 "음의" 구역으로 취급했습니다.

  • 결과: 특정 견종을 그려달라고 요청했을 때, 표준 AI는 워터마크나 테두리 같은 이상한 흔적을 포함하여 훈련 세트의 사진을 그대로 복사하는 경우가 있었습니다. 그러나 부호 정류 흐름 AI는 해당 견종처럼 보이면서도 훈련된 특정 사진을 복사하지 않은, 새롭고 독특한 개를 그려냈습니다. 이 방식은 이미지가 견종처럼 보이게 유지하면서도 "훈련 데이터 늪"으로부터 생성된 이미지를 성공적으로 밀어냈습니다.
  • 수치: 테스트 결과, 이 방법을 사용하면 훈련 이미지와의 유사성을 크게 줄일 수 있음을 발견했습니다. 예를 들어, 특정 설정에서 안전 테스트 시 "공격 성공률"(AI가 나쁜 콘텐츠를 피하지 못한 비율)을 **15.19%**에서 **6.33%**로 낮추면서도, 이미지 품질 점수(CLIP 및 Aesthetic 점수)는 거의 동일하게 유지했습니다.

3. 안전 및 개념 억제 (Safety and Concept Suppression)
또한 부적절한 콘텐츠나 특정 저작권 캐릭터를 그리지 못하도록 제어할 수 있는지 테스트했습니다.

  • 미키 마우스 테스트: "검은색 둥근 귀와 빨간 바지를 입은 만화 쥐"를 그리되, 명시적으로 "미키 마우스를 그리지 마라"고 명령했습니다. 표준 AI는 종종 미키 마우스를 그려냈습니다. 하지만 부호 정류 흐름 AI는 요청된 모든 특징(귀, 바지, 신발)을 갖추면서도 저작권이 있는 정체성을 피할 수 있을 만큼 충분히 구별되는 쥐를 그려냈습니다.
  • 누드 테스트: AI가 누드를 그리도록 유도하는 "Ring-A-Bell" 벤치마크에서, 이 새로운 방법은 실패율을 **15.19%**에서 **6.33%**로 낮추었습니다. 이는 이미지를 흐릿하거나 깨지게 만들지 않으면서도 "하지 마라"는 규칙을 훨씬 더 잘 따랐음을 의미합니다.

이것이 왜 중요한가

이 접근 방식의 아름다움은 이것이 단순한 "편법(hack)"이나 단순한 필터가 아니라는 점에 있습니다. 이는 AI가 창의적 공간을 이동하는 방식에 대한 근본적인 변화입니다. "음의 질량"이라는 개념을 사용함으로써, 저자들은 AI가 나쁜 것을 피하는 것이 자연스러운 현상이 되도록 만들었습니다. 즉, 여정의 수학적 구조 자체가 AI를 밀어내기 때문입니다.

연구팀은 이 방식이 미로를 통과하는 로봇을 안내하든, 개 이미지를 생성하든, 혹은 AI가 훈련 데이터를 복사하지 않도록 하든 상관없이 작동함을 보여주었습니다. 이 방법은 유연합니다. "반발력"의 강도를 조절하는 파라미터(α\alpha)를 사용하여 AI가 얼마나 엄격하게 나쁜 것을 피해야 하는지 결정할 수 있습니다.

이 논문은 이것이 부정적인 지시(negative instructions)를 처리하는 원칙적이고 수학적으로 타당한 방법임을 시사합니다. 이것은 단순히 "안 돼"라고 말하는 것이 아니라, "안 돼"라는 말이 AI가 결코 넘을 수 없는 물리적 장벽이 되는 세상을 구축하는 것입니다. 저자들은 이 방법이 이러한 반발력을 계산하기 위해 약간 더 많은 컴퓨팅 자원(시간 및 메모리 약 10% 추가)을 필요로 한다고 언급했지만, 그로 인해 얻는 추가적인 안전성과 제어 능력은 충분히 가치 있는 교환인 것으로 보입니다.

요약하자면, 부호 정류 흐름은 AI에게 새로운 종류의 상식을 부여합니다. 즉, 무엇을 해야 하는지 아는 것을 넘어, 무엇을 '하지 말아야 하는지'를 진정으로 이해하고, 그 과정에서도 창의적인 불꽃을 유지할 수 있는 능력입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →