← 최신 논문
🤖 machine learning

Neither Adversarial Training Nor Purification: Emergent Adversarial Robustness from Oscillatory Predictive Learning

이 논문은 계산 비용이 많이 드는 적대적 훈련이나 테스트 단계의 정화 과정에 의존하지 않고도 CIFAR-10 및 CIFAR-100에서 경쟁력 있는 적대적 강건성을 달성하는, 인공 쿠라모토 진동 뉴런(Artificial Kuramoto Oscillatory Neurons)과 예측적 자기지도 사전학습을 결합한 프레임워크인 진동 예측 학습(Oscillatory Predictive Learning, OPL)을 소개한다.

원저자: Mohammed-Yassine Habibi, Klea Ziu, Martin Takáč, Makoto Yamada

게시일 2026-09-09✓ Author reviewed
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohammed-Yassine Habibi, Klea Ziu, Martin Takáč, Makoto Yamada

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 컴퓨터 비전 시스템은 나무 위의 고양이나 거리의 정지 표지판처럼 사물을 인식하는 데 매우 뛰어난 능력을 보여줍니다. 하지만 이러한 시스템에는 숨겨진 취약성이 존재합니다. 인간은 팬더 사진을 보고 팬더라고 인식할 수 있지만, 공격자가 이미지에 아주 미세하고 거의 보이지 않는 정적 패턴을 추가하면 컴퓨터는 갑자기 확신을 가지고 그것을 긴팔원숭이라고 식별할 수 있습니다. 이러한 취약성을 '적대적 약점(adversarial weakness)'이라고 합니다. 수년 동안 이를 해결하는 표준적인 방법은 컴퓨터에게 이러한 속임수가 담긴 이미지를 수백만 번 보여주며 학습시켜, 노이즈를 무시하는 법을 강제로 배우게 하는 것이었습니다. 이 과정은 엄청난 양의 컴퓨팅 파워와 시간을 요구하여 매우 비용이 많이 들 뿐만 아니라, 실제로 시스템이 사용될 때 속도를 늦추기도 합니다. 연구자들은 처음부터 더 똑똑한 방식으로 이러한 시스템을 구축할 수 있는 방법, 즉 끝없는 훈련을 통해 힘으로 밀어붙이는 대신 내부 구조를 설계함으로써 자연스럽게 저항력을 갖도록 만드는 방법이 있지 않을까 오랫동안 고민해 왔습니다.

한 연구팀은 이러한 값비싼 훈련 세션을 완전히 건너뛰는 새로운 접근 방식을 제안했습니다. 모델에게 손상된 이미지를 수백만 장 먹이는 대신, 그들은 이미지 시퀀스의 다음 장면을 예측하는 법을 배우는 시스템과 자연에서 발견되는 리듬감 있는 동기화 현상을 모방한 독특한 내부 메커니즘을 결합하여 구축했습니다. 그들은 이 방법을 '진동 예측 학습(Oscillatory Predictive Learning)'이라고 부릅니다. 핵심 아이디어는 컴퓨터에 특정한 종류의 내부 '시계' 또는 리듬을 부여하여 서로 다른 부분들이 조화롭게 움직이도록 함으로써, 작은 악의적인 변화가 전체 시스템의 균형을 무너뜨리기 어렵게 만드는 것입니다. 이 방법을 테스트했을 때, 연구진은 시스템이 훈련 과정에서 단 하나의 적대적 사례도 보지 않고도 높은 수준의 보안을 달와하며 놀라운 방어력을 갖추게 된다는 것을 발견했습니다.

연구진은 이 시스템을 컴퓨터 학습에 사용되는 두 가지 표준 이미지 세트, 즉 비행기와 자동차 등 열 가지 카테고리가 포함된 세트와 백 가지 카테고리가 포함된 세트를 대상으로 테스트했습니다. 그들은 모델의 가장 약한 지점을 찾아내기 위해 엄격한 테스트를 수행했습니다. 첫 번째 테스트인 열 가지 카테고리 세트에서, 그들의 새로운 방법은 이미지가 공격을 받는 상황에서도 76.63%의 확률로 이미지를 정확하게 식별했습니다. 이는 무작위성에 의존하여 공격에 방어하는 다른 방법들이 보통 71% 정도의 점수를 기록하는 것과 비교했을 때 유의미한 개선입니다. 더 어려운 백 가지 카테고리 세트로 넘어갔을 때도, 시스템은 50.44%의 성공률을 유지하며 버텨냈습니다. 이러한 결과는 모델을 견고하게 만들기 위해 통상적으로 요구되는 막대한 계산 비용 없이도 이 정도의 보안 수준을 달성했다는 점에서 주목할 만합니다.

왜 이것이 작동했는지 이해하기 위해, 팀은 그들의 창조물을 두 가지 주요 부분으로 나누어 분석했습니다. 첫 번째 부분은 서로 영향을 주고받는 작은 결합된 진자(pendulum)와 같은 진동 유닛을 사용하는 특수한 형태의 신경망 층입니다. 두 번째 부분은 현재의 이미지를 바탕으로 미래의 이미지 뷰를 예측하도록 시스템을 가르치는 학습 방법입니다. 이 부분들을 각각 분리하여 테스트했을 때, 연구진은 진동 구조만으로도 견고한 방어 기반을 제공하지만 그것만으로는 충분하지 않다는 것을 발견했습니다. 또한 일반적인 컴퓨터 비전 모델에 예측 학습을 적용했을 때는 공격을 막는 데 거의 아무런 효과가 없었습니다. 그러나 진동 구조와 예측 학습을 결합했을 때, 방어력은 훨씬 강력해졌습니다. 예측 학습이 진동 부분의 자연스러운 안정성을 증폭시켜, 부분의 합보다 훨씬 더 강력한 회복력을 가진 시스템을 만들어낸 것입니다.

연구진은 또한 이러한 견고함이 매우 까다로운 조건 하에서만 존재한다는 사실을 발견했습니다. 그들은 내부 '시계' 유닛의 크기가 매우 중요하다는 것을 알아냈습니다. 유닛이 특정하고 작은 차원으로 설정되었을 때 시스템은 공격에 매우 강한 저항력을 보였습니다. 하지만 일반적인 조건에서 이미지를 더 잘 인식하도록 유닛의 크기를 키워 유연성을 높이자, 방어력은 갑자기 무너졌습니다. 시스템은 깨끗한 이미지를 식당하는 능력은 더 좋아졌지만, 공격에는 거의 완전히 취약해졌습니다. 이는 시스템의 보안이 단순히 모델을 더 크게 만들거나 더 강력하게 만드는 데서 오는 것이 아님을 시사합니다. 대신, 내부 리듬을 동기화 상태로 유지하는 엄격하고 좁은 규칙에 달려 있습니다. 시스템에 너무 많은 자유를 허용하면 조작에 저항하는 능력을 상실하게 됩니다.

이 연구는 안전한 인공지능을 구축하기 위한 새로운 길을 제시합니다. 이는 모델을 견고하게 만드는 유일한 방법이 수백만 개의 적대적 사례를 학습시키는 것이라는 오랜 믿음에 도전합니다. 특정한 구조적 설계와 자가 학습 방법을 결합함으로써, 연구진은 견고함이 시스템이 구축되는 방식과 학습하는 방식으로부터 자연스럽게 발생할 수 있음을 보여주었습니다. 비록 이 시스템이 더 크고 복잡한 이미지 데이터셋에서 작동하기 위해 여전히 개선이 필요하지만, 이번 연구 결과는 현재의 계산 집약적인 방법들에 대한 유망한 대안을 제시합니다. 이는 모델의 내부 역학을 세심하게 설계함으로써, 우리가 더 똑똑할 뿐만 아니라 본질적으로 속이기 어려운 AI를 만들 수 있음을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →