← 최신 논문
🤖 AI

A Robust Out-of-Distribution Detection Framework via Synergistic Smoothing

본 논문은 중앙값 평활화를 활용하여 로컬 점수 불안정성을 정량화함으로써 점수 최소화 및 점수 최대화 적대적 공격 모두에 대한 최첨단 대칭적 강인성을 달성하는 강인한 사후 분포 외 검출 프레임워크인 ROSS 를 소개합니다.

원저자: Maria Stoica, Abdelrahman Hekal, Alessio Lomuscio

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Maria Stoica, Abdelrahman Hekal, Alessio Lomuscio

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑한 보안 요원 (AI) 이 클럽 입구에 서 있습니다. 이 요원은 정회원을 (In-Distribution 데이터) 식별하는 데 탁월하며, 보통 그들을 입장시키는 시기를 잘 알고 있습니다. 하지만 이 요원에게는 치명적인 결함이 있습니다. 낯선 사람 (Out-of-Distribution 데이터) 이 설득력 있는 가면을 쓰거나 특정 유형의 노이즈로 요원을 속이면, 요원은 그 사람이 회원인 것처럼 확신하며 그들을 입장시킬 수 있습니다. 이는 안전상의 위험입니다.

이 논문은 이러한 문제를 해결하기 위해 ROSS(Synergistic Smoothing 을 통한 견고한 OOD 탐지기) 라는 새로운 시스템을 소개합니다. 간단한 비유를 들어 작동 원리를 설명해 보겠습니다.

1. 문제: "변덕스러운" 보안 요원

현재의 보안 요원 (AI 탐지기) 은 종종 "방향성"을 띱니다.

  • 어떤 요원들은 누군가가 너무 완벽해 보이면 불안해하도록 훈련되었습니다. 사기꾼이 낯선 사람을 약간 더 "회원처럼" 보이게 만들면, 요원은 혼란을 겪고 그들을 입장시킵니다.
  • 다른 요원들은 누군가가 너무 지저분해 보이면 불안해하도록 훈련되었습니다. 사기꾼이 낯선 사람을 약간 더 "낯선 사람처럼" 보이게 만들면, 요원은 혼란을 겪습니다.
  • 결함: 이러한 요원들은 특정 유형의 속임수에 취약합니다. 요원 A 를 속이는 방법을 안다면 보안 시스템을 우회할 수 있습니다.

2. 해결책: "안정성 테스트"

ROSS 는 게임 방식을 바꿉니다. 낯선 사람을 한 번만 보는 대신, ROSS 는 요원에게 카메라를 약간 흔들거나 매번 이미지에 약간의 정적 노이즈를 추가하면서 낯선 사람을 25 번 보게 합니다.

이것을 다음과 같이 생각하세요:

  • 실제 회원 (In-Distribution): 흔들리는 카메라로 실제 회원의 사진을 25 번 찍어도, 그들은 여전히 같은 사람처럼 보입니다. 그들의 얼굴은 안정적입니다. 요원의 확신은 크게 흔들리지 않습니다.
  • 위조자 (Out-of-Distribution): 흔들리는 카메라로 위조자의 사진을 25 번 찍으면, 한 장에서는 고양이처럼, 다음 장에서는 바위처럼, 또 다음 장에서는 흐릿하게 보일 수 있습니다. 요원의 의견은 극적으로 요동칩니다. 그들은 불안정합니다.

3. 두 단계 확인

ROSS 는 결정을 내리기 위해 두 가지 특정 도구를 사용합니다:

A. "중앙값" (중도)
요원의 25 가지 의견 중 하나 (이상치) 에 의해 왜곡될 수 있는 평균을 내는 대신, ROSS는 중간 의견을 취합니다. 이는 많은 사람에게 추측을 요청하고 가장 시끄럽고 극단적인 목소리는 무시하는 것과 같습니다. 이는 속이기 어려운 "부드럽게 처리된" 점수를 제공합니다.

B. "불안정성 미터" (MAD)
ROSS 는 그 25 번의 흔들림 동안 요원의 의견이 얼마나 요동쳤는지 측정합니다.

  • 낮은 요동 (안정적): "좋습니다, 이는 회원처럼 보였고 카메라를 흔들 때마다 매번 회원처럼 보였습니다." -> 높은 신뢰.
  • 높은 요동 (불안정): "이것은 한 번은 회원처럼 보였지만 다음에는 개처럼 보였습니다." -> 낮은 신뢰.

4. "확신 게이트" (안전망)

여기가 교묘한 부분입니다. 논문은 때때로 완전히 낯선 사람이 매우 안정적으로 보일 수 있다고 지적합니다 (예: 단단한 회색 벽의 사진). 만약 요원이 안정성만 본다면, "와, 저 벽은 매우 일관성이 있군, 그들을 입장시키자!"라고 생각할 수 있습니다.

ROSS 는 확신 게이트를 추가하여 이를 방지합니다:

  • 낯선 사람이 이미 높은 확신으로 회원처럼 보일 때만 "안정성 보너스"를 부여합니다.
  • 낯선 사람이 회원처럼 보이지만 불안정하면 거절됩니다.
  • 낯선 사람이 회원처럼 보이고 안정적이면 점수에 "초강력 부스트"가 적용됩니다.
  • 낯선 사람이 낯선 사람처럼 보이면 안정성과 관계없이 거절됩니다.

5. 왜 "대칭적"인가 (가장 좋은 부분)

이전 방법들은 한 방향으로만 키를 밀어야 작동하는 자물쇠와 같았습니다. 반대 방향으로 당기면 고장 났습니다.

  • ROSS 는 "대칭적" 자물쇠입니다. 점수를 올리거나 내리는 것에 상관없이 점수가 얼마나 흔들리는지를 보기 때문에, AI 가 낯선 사람을 회원으로 생각하게 만드는 공격자와, AI 가 회원을 낯선 사람으로 생각하게 만드는 공격자 모두에게 효과적입니다.

결과 요약

저자들은 표준 이미지 데이터셋 (CIFAR-10 및 ImageNet 등) 에서 이를 테스트했습니다. 그들은 다음과 같은 사실을 발견했습니다:

  • ROSS 는 이전 방법들보다 속이기 훨씬 어렵습니다.
  • 공격을 받을 때 구식 방법들에 비해 위조를 탐지하는 시스템의 능력을 최대 **40%**까지 향상시켰습니다.
  • 이는 "플러그인" 업그레이드로 작동합니다. 전체 AI 를 다시 훈련할 필요가 없으며, 기존 시스템 위에 이 "안정성 확인" 계층만 추가하면 됩니다.

요약하자면, ROSS 는 세상이 약간 흔들릴 때 요원의 확신이 유지되는지 확인함으로써, AI 보안 요원들이 가면에 속을 가능성을 줄여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →