← 최신 논문
🤖 machine learning

Mitigating Negative Flips via Margin Preserving Training

이 논문은 로짓 보정(logit calibration)을 통해 기존 모델의 마진을 보존하고, 구 클래스와 신규 클래스 모두에서 높은 정확도를 유지하기 위해 이중 소스 포컬 증류(double-source focal distillation)를 채택함으로써 진화하는 이미지 분류 시스템에서의 네거티브 플립(negative flips)을 완화하는 새로운 학습 프레임워크를 제안한다.

원저자: Simone Ricci, Niccolò Biondi, Federico Pernici, Alberto Del Bimbo

게시일 2026-08-10
📖 6 분 읽기🧠 심층 분석

원저자: Simone Ricci, Niccolò Biondi, Federico Pernici, Alberto Del Bimbo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 수년간 메뉴를 완성해 온 숙련된 셰프라고 상상해 보십시오. 고객들은 무엇을 기대해야 할지 정확히 알고 있습니다. "매콤한 두부"는 항상 매콤하고, "크리미한 버섯"은 항상 부드러워야 합니다. 그러다 당신은 메뉴를 확장하기로 결심합니다. "용과 소르베"와 "와사비 아이스크림" 같은 흥eli로운 새로운 요리들을 추가합니다. 이는 아주 멋진 일처럼 들리지만, 한 가지 문제가 있습니다. 새로운 맛을 만들기 위해 서두르는 과정에서, 실수로 기존의 인기 메뉴 레시피를 미세하게 건드린 것입니다. 갑자기 매콤한 두부는 약간 싱겁게 느껴지고, 크리미한 버섯에서는 이상한 뒷맛이 납니다. 충성스러운 고객들은 혼란스러워하고 불만족스러워합니다. 비록 새로운 메뉴가 서류상으로는 기술적으로 더 "나아졌을지라도" 말입니다. 이것이 인공지능(AI)이 겪는 일상의 고충입니다. AI 시스템이 새로운 것을 배울 때, 종종 이전에 잘하던 것들을 잊어버리곤 합니다. 컴퓨터 과학의 세계에서, AI가 예전에 맞혔던 것을 오히려 못하게 되는 이 특정한 종류의 혼란을 "네거티브 플립(negative flip)"이라고 부릅니다. 이는 업데이트가 고장 나지 않았던 부분을 망가뜨리는 좌절스러운 글리치(glitch)입니다.

당신이 읽게 될 이 논문은 바로 이 문제를 다룹니다. 이미지 분류(컴퓨터에게 고양이, 개, 자동차 등의 사진을 인식하도록 가르치는 작업)를 연구하는 연구자들은, AI의 뇌에 새로운 카테고리를 추가할 때 기존의 것들과 새로운 것들 사이의 "결정 경계선(decision lines)"이 너무 붐비게 된다는 사실을 발견했습니다. 이는 마치 좁은 방에 너무 많은 사람을 밀어 넣으려는 것과 같아서, 모두가 서로 부딪히며 AI가 누가 누구인지 혼란스러워하게 만드는 상황과 같습니다. 이를 해결하기 위해 그들은 **마진 보존 훈련(Margin Preserving Training, MPT)**이라는 새로운 훈련 방법을 발명했습니다. 이것은 AI에게 기존 친구들의 개인 공간을 존중하면서도 새로운 친구들을 위한 자리를 만드는 법을 가르치는 영리한 방법이라고 생각하면 됩니다. 단순히 모든 것을 한데 몰아넣는 대신, 그들은 기존 카테고리를 안전하게 지키기 위한 특별한 "편향(bias)"과 새로운 카테고리가 뒤처지지 않도록 하는 "더블 티처(double-teacher)" 시스템을 사용합니다. 그들의 실험은 이 방법이 이전만큼 잘 학습하는 동시에, 기존 작업에서 발생하는 짜증 나는 실수들을 성공적으로 막아낸다는 것을 보여줍니다.

문제점: "더 좋아짐"이 "더 나빠짐"을 의미할 때

AI의 급변하는 세계에서 모델은 끊임없이 업데이트됩니다. 개발자들은 AI가 더 똑똑하고, 빠르고, 더 많은 것을 인식할 수 있기를 바라며 새로운 버전을 훈련시킵니다. 보통은 잘 작동합니다. 하지만 때때로 이상한 일이 발생합니다. "골든 리트리버"를 식별하는 데 완벽했던 AI가 업데이트 후에 갑자기 그것을 "래브라도"라고 부르기 시작합니다. 또는, 이전에는 하지 않았던 "정지 표지판"과 "속도 제한 표지판"을 혼동하기도 합니다.

이 현상을 **네거티브 플립(negative flip)**이라고 합니다. 이는 AI가 이전에 틀렸던 것을 마침내 인식하게 되는 "포지티브 플립(positive flip)"의 반대 개념입니다. 포지티브 플립이 목표라면, 네거티브 플립은 발전의 숨겨진 비용입니다. 이는 특히 위험한데, 자율주행차가 익숙한 도로 표지판을 갑자기 잘못 식별하는 것과 같이 현실 세계의 시스템에서 예측 불가능한 행동을 유발할 수 있기 때문입니다.

연구자들은 이러한 네거티브 플립이 AI에게 더 많은 *클래스(카테고리)*를 배우라고 요구할 때 가장 자주 발생한다는 것을 발견했습니다. 10명의 학생을 구별해야 하는 교실을 상상해 보십시오. 쉽습니다. 이제 100명의 학생이 들어온다고 상상해 보십시오. 선생님은 그들을 모두 같은 방에 밀어 넣어야 합니다. 그들을 모두 수용하기 위해, 각 학생 사이의 "개인 공간"(또는 마진(margin))은 점점 작아집니다. AI 용어로, "마진"은 모델이 서로 다른 카테고리 사이에 유지하는 안전 완충 지대입니다. 새로운 클래스를 추가하면, 모델은 모두를 위한 공간을 극대화하기 위해 모든 것을 압축하려고 시도하지만, 이 과정에서 종종 기존 클래스들을 가장자리로 너무 가깝게 밀어내어 서로 혼동하기 쉽게 만듭니다.

해결책: MPT로 평화를 유지하기

저자들은 **마진 보존 훈련(Margin Preserving Training, MPT)**이라는 새로운 방법을 제안합니다. 그들의 목표는 단순합니다. 이미 알고 있는 것들의 안전 완충 지대를 줄이지 않으면서 새로운 것을 배우도록 AI를 업데이트하는 것입니다.

그들은 두 가지 주요 기술을 사용하여 마치 잘 기름칠 된 기계처럼 함께 작동하도록 했습니다.

1. "VIP 패스" (마진 교정 손실 - Margin-Calibrated Loss)
먼저, 그들은 훈련 중에 새로운 클래스들에게 약간의 "선점 효과"를 줍니다. 여러분이 학급을 가르치고 있다고 상상해 보십시오. 기존 학생들(기존 클래스)은 이미 자기 자리에 앉아 있습니다. 새로운 학생들(새로운 클래스)은 문 앞에 서 있습니다. 만약 여러분이 그냥 모두 앉으라고 명령한다면, 기존 학생들은 자리를 만들기 위해 의자에서 밀려날 수도 있습니다.

이를 방지하기 위해, 연구자들은 새로운 학생들에게 "VIP 패스"(양의 로짓 편향, positive logit bias)를 줍니다. 이 패스는 AI에게 이렇게 말합니다. "이봐, 이 새로운 친구들도 중요해, 이들이 자리를 잡을 수 있도록 약간의 추가 공간을 더 줘." 훈련 중에 새로운 클래스에 대한 확신을 인위적으로 높임으로써, AI는 결정 경계를 기존 클래스로부터 멀리 밀어내도록 강제됩니다. 이는 기존 클래스가 넓고 안전한 "마진"을 유지하고 압착되지 않도록 보장합니다. 이는 마치 AI에게 "새로운 것에 너무 신경 쓰지 말고, 기존의 것들이 안전하게 유지되도록 해"라고 말하는 것과 같습니다.

2. "더블 티처" 시스템 (이중 소스 포컬 증류 - Double-Source Focal Distillation)
하지만 VIP 패스에는 문제가 있습니다. 만약 새로운 클래스들에게 너무 많은 선점 효과를 준다면, 그들이 실제 이미지의 특징을 무시할 정도로 지나치게 확신을 가져서 새로운 카테고리에 대한 실수를 초래할 수 있습니다. AI는 기존 클래스를 보호하는 데 너무 바쁜 나머지 새로운 클래스를 제대로 배우지 못할 수도 있습니다.

이를 해결하기 위해, 연구자들은 두 번째 선생님을 도입합니다.

  • 선생님 A (기존 모델): 이 선생님은 기존 클래스를 완벽하게 알고 있습니다. 이 선생님은 새로운 모델이 기존의 것들을 어떻게 다루는지 기억하도록 돕습니다.
  • 선생님 B (새로운 모델): 이것은 모든 클래스(기존 및 신규)에 대해 처음부터 훈련된 완전히 새로운 모델입니다. 이 모델은 새로운 클래스를 올바르게 다루는 법을 알고 있습니다.

새로운 모델은 두 선생님으로부터 동시에 배웁니다. 모델은 기존 클래스를 안전하게 지키기 위해 선생님 A의 말을 듣고, 새로운 클래스를 망치지 않기 위해 선생님 B의 말을 듣습니다. 이 "이중 소스" 접근 방식은 완벽한 균형을 보장합니다. 즉, 기존 클래스는 안전하게 유지되고, 새로운 클래스는 정확하게 학습됩니다.

연구 결과

연구자들은 자신들의 아이디어를 두 가지 유명한 이미지 데이터셋인 CIFAR100(100개의 작은 이미지 카테고리)과 ImageNet1K(1,000개의 크고 복잡한 이미지 카테고리)에서 테스트했습니다. 그들은 자신들의 방법과 네거티브 플립을 해결하기 위해 사용되는 몇몇 다른 대중적인 기술들을 비교했습니다.

결과는 유망했습니다. 그들의 방법인 MPT는 네거티브 플립을 일관되게 감소시켰습니다.

  • CIFAR100에서, 표준 ResNet-18 모델을 사용했을 때, 그들의 최적 버전(MPT-KL)은 처치(treatment)를 하지 않은 모델의 **14.04%**와 비교하여 **네거티브 플립 비율(NFR)**을 **9.26%**로 낮추었습니다.
  • ImageNet1K에서의 개선은 더욱 명확했습니다. NFR은 **6.09%**로 떨어졌으며, 이는 두 번째로 좋은 방법(ELODI)의 **7.61%**를 앞선 수치입니다.

결정적으로, 그들은 단순히 네거티브 플립을 멈춘 것이 아니라, 전체적인 정확도 또한 희생하지 않았습니다. 모델은 여전히 새로운 것들을 올바르게 파악했습니다. 실제로 ImageNet1K에서 그들의 방법은 기존 클래스에 대한 전체 오차율을 처치 전의 **28.40%**에서 **24.68%**로 낮추었습니다.

그들은 또한 자신들의 레시피 중 어떤 것이 핵심 비결인지 확인하기 위해 "만약 ~했다면" 실험(소거 연구, ablation study)을 수행했습니다. 그들은 만약 "VIP 패스"(마진 편향)를 제거한다면 네거티브 플립이 다시 증가한다는 것을 발견했습니다. 만약 "더블 티처" 시스템을 제거한다면 모델이 새로운 클래스들을 다루는 데 어려움을 겪는다는 것도 발견했습니다. 결국, 최상의 결과를 얻기 위해서는 두 부분이 모두 함께 작동해야 한다는 것이 밝혀졌습니다.

마법의 시각화

무엇이 일어나고 있는지 실제로 보기 위해, 연구자들은 AI가 이미지를 "보는" 방식을 시각적 지도로 만들었습니다. 그들은 AI 내부의 복잡한 수학을 단순한 2D 그림으로 변환했습니다.

  • 그들의 방법이 없을 때: 기존 클래스(예: 고양이)와 새로운 클래스(예: 개)의 클러스터가 서로 찌그러져 있었습니다. 이들을 나누는 경계선은 얇고 흔들렸습니다. "고양이"가 실수로 "개"의 영역으로 넘어갈 수 있었습니다.
  • 그들의 방법이 있을 때: 기존 클래스들은 각자의 깔끔하고 넓은 원 안에 머물렀습니다. 새로운 클래스들은 기존의 것들을 압박하지 않으면서 자신만의 자리를 찾았습니다. "결정 경계선"은 원래 모델에서와 마찬가지로 넓고 명확하게 유지되었습니다.

시사점

이 논문은 AI를 망가뜨리지 않고 업데이트하는 열쇠는 이미 알고 있는 것들의 "개인 공간"을 존중하는 데 있다는 점을 시사합니다. 기존 클래스의 결정 마진을 명시적으로 보존하고, 새로운 클래스를 가이드하기 위해 스마트한 이중 선생님 시스템을 사용함으로써, 우리는 AI 모델을 더 안전하게 업데이트할 수 있습니다.

저자들은 이 방법이 추가적인 "참조(reference)" 모델을 훈련해야 하므로 약간 더 많은 컴퓨터 자원을 필요로 한다고 언급했지만, 여질 많은 모델 그룹을 필요로 하는 다른 복잡한 방법들에 비하면 여전히 훨씬 저렴합니다. 또한 그들은 "VIP 패스"의 강도(편향 값)를 다양한 데이터셋에 맞춰 주의 깊게 조정해야 한다고 강조합니다.

요약하자면, MPT는 AI의 기억력을 줄이지 않으면서 AI의 뇌를 성장시키는 방법을 제공합니다. 이는 AI 시스템이 과거의 교훈을 잊지 않으면서도 새로운 세상에 적응하며 지속적으로 학습할 수 있게 하는 단계로 나아가는 길입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →