← 최신 논문
🤖 machine learning

How Much Regularization Survives Averaging? Update Masking in Federated Learning

이 논문은 마스킹을 통한 노이즈 유도 정규화가 중앙 집중형 학습에서는 평탄한 최솟값(flat minima) 형성을 효과적으로 촉진하지만, 연합 학습에서는 평균화 과정으로 인해 그 이점이 크게 감소하여 비IID 데이터 시나리오에 대한 해당 접근 방식이 비실용적임을 입증한다.

원저자: Wenhao Yan, Fu Kuroda, Yucheng Jin, Zhenke Chen

게시일 2026-08-25
📖 5 분 읽기🧠 심층 분석

원저자: Wenhao Yan, Fu Kuroda, Yucheng Jin, Zhenke Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에는 '연합(federated)' 문제라고 불리는 지속적인 과제가 존재합니다. 각자가 퍼즐의 고유한 조각을 하나씩 들고 있는 사람들이, 서로에게 자신의 조각을 절대 보여주지 않으면서도 하나의 완성된 그림을 함께 만들어내고자 한다고 상상해 보십시오. 이것이 현대 머신러닝이 작동하는 방식입니다. 중앙 컴퓨터가 여러 기기(스마트폰이나 센서 등)를 조율하여 공통의 기술을 학습합니다. 문제는 각 기기에 담긴 데이터가 결코 동일하지 않다는 점입니다. 어떤 스마트폰에는 주로 고양이 사진이 있고, 다른 쪽에는 자동차 사진만 있을 수 있습니다. 중앙 컴퓨터가 모두가 배운 것을 결합하려고 할 시도할 때, 결과물인 모델은 전체적인 그림을 이해하는 데 어려움을 겪으며 새로운 상황에 잘 일반화되지 못하는 경우가 많습니다. 이를 해결하기 위해 연구자들은 오랫동안 학습의 수학적 지형에서 '평평한(flat)' 해답을 찾는 방법을 모색해 왔습니다. 날카로운 봉우리와 넓고 평평한 고원을 생각해 보십시오. 날카로운 봉우리에 안착한 모델은 자신이 본 특정 데이터에 대해서는 완벽하게 작동할지 모르지만, 데이터가 조금만 변해도 즉시 비틀거리게 됩니다. 반면 넓고 평평한 고원에 자리 잡은 모델은 더 견고합니다. 이 모델은 데이터의 작은 변화에도 무너지지 않고 잘 대처할 수 있습니다.

수년 동안 과학자들은 모델이 이러한 평평한 고원을 찾도록 강제하기 위해 학습 과정 중에 노이즈를 추가하거나 의도적으로 작은 실수를 만드는 방법을 시도해 왔습니다. 이 노이즈는 마치 부드러운 흔들개처럼 작용하여, 모델이 좁고 취약한 곳에 갇히는 것을 방지합니다. 최근에는 단일 컴퓨터가 모든 작업을 수행하는 중앙 집중형 학습에서 '업데이트 마스킹(update masking)'이라는 특정 기법이 인기를 얻었습니다. 이 방법은 학습 지침의 덩어리들을 무작위로 버리고 나머지를 재조정함으로써, 모델을 안정적이고 평평한 영역으로 밀어넣는 유익한 종류의 노이즈를 효과적으로 추가합니다. 그러나 연구자들이 이 기법을 여러 기기가 개별적으로 학습한 후 그 결과를 결합하는 연합 환경으로 가져오려 했을 때, 이 기법은 사라져 버리는 듯했습니다. 소피아 대학교와 선디안 에너지(Shendian Energy Co., Ltd.)의 연구팀이 해결하고자 했던 질문은 간단했습니다. 그 유익한 노이즈가 어디로 사라졌으며, 그것을 회복할 수 있는가 하는 것이었습니다.

연구진은 노이즈가 사라진 것이 아니라, 결과를 결합하는 과정 자체에 의해 희석되었다는 사실을 발견했습니다. 연구팀의 설정에서는 100개의 서로 다른 기기, 즉 '클라이언트'가 있었고, 각 클라이언트는 자신만의 데이터 조각을 바탕으로 학습했습니다. 표준적인 접근 방식에서는 각 기기가 자신만의 고유한 선택 패턴을 사용하여 학습 지침의 어느 부분을 유지하고 어느 부분을 버릴지 무작위로 결정합니다. 중앙 서버가 이러한 업데이트를 수집하여 평균을 낼 때, 개별 기기들의 무작위적인 선택들은 서로 상쇄됩니다. 이는 마치 열 명의 사람이 무거운 물체를 서로 약간씩 다른 무작위 방향으로 밀려고 하는 것과 같아서, 그 순 결과로는 물체가 거의 움직이지 않게 되는 것과 같습니다. 모델을 견고하게 만드는 수학적 페널티는 그룹 내의 기기 수와 동일한 계수로 약화되었습니다. 10개의 기기가 있다면, 유익한 효과는 원래 강도의 10분의 1로 줄어들어 모델을 과적합으로부터 보호할 수 있는 능력이 거의 남지 않게 됩니다.

연구팀은 다른 전략을 테스트했습니다. 만약 모든 기기가 정확히 같은 선택 패턴을 사용한다면 어떻게 될까? 만약 열 명의 사람이 물체를 같은 무작위 방향으로 밀었다면, 그 효과는 보존될 것입니다. 연구진은 이러한 선택을 동기화하는 것이 실제로 보호적인 노이즈를 복구한다는 것을 발견했지만, 여기에는 중대한 전제 조건이 있었습니다. 복구된 노이즈의 강도는 기기들이 서로 얼마나 일치하느냐에 전적으로 달려 있었습니다. 만약 기기들이 매우 다른 데이터를 학습하여 그 업데이트가 서로 충돌하는 방향을 가리킨다면, 동기화된 노이즈는 효과가 없거나 심지어 해로울 수 있었습니다. 이 일치도를 측정하는 개념이 바로 '그래디언트 다양성(gradient diversity)'으로, 이는 각 기기의 개별적인 노력이 얼마나 겹치는지를 계산하는 것입니다. 기기들이 조화를 이룰 때 노이즈는 온전한 힘으로 돌아옵니다. 기기들이 충돌할 때 노이즈는 감소하거나 완전히 사라집니다.

이것이 실제 현장에서 왜 발생하는지 이해하기 위해, 연구진은 100개의 시뮬레이션된 클라이언트에 분할된 표준 이미지 데이터셋인 CIFAR-10을 사용하여 광범위한 실험을 수행했습니다. 그들은 서로 다른 조건 하에서 보호적인 노이즈가 평균화 과정에서 정확히 얼마나 살아남는지 측정했습니다. 연구진은 기기들이 작은 배치(batch) 단위로 학습하는 가장 일반적인 설정에서 생존율이 충격적으로 낮다는 것을 발견했습니다. 가능한 최대 강도인 10 중에서 최종 모델에 도달한 노이즈는 약 1.19에 불과했습니다. 이 아주 작은 비율은 모델이 노이즈를 전혀 추가하지 않았을 때보다 거의 더 견고하지 않음을 의미했습니다. 연구진은 이러한 실패의 원인을 표준 학습에서 매 단계마다 발생하는 데이터의 무작위 샘플링에서 찾았습니다. 작은 이미지 배치를 선택함으로써 발생하는 무작위 노이즈가 마스킹 기법에 의해 생성된 특정한 유익한 노이즈를 압도하여 삼켜버린 것입니다.

연구팀은 데이터 자체의 차이, 즉 어떤 기기는 고양이가 더 많고 어떤 기기는 자동차가 더 많은 현상이 원인인지도 조사했습니다. 그들은 어떤 기기는 다른 기기보다 100배 더 많은 데이터를 보유하도록 데이터 분포를 극단적으로 불균형하게 만들었습니다. 놀랍게도, 이러한 극단적인 차이는 노이즈 생존율에 거의 영향을 미치지 않았습니다. 데이터가 거의 동일하든 혹은 매우 다르든, 생존율은 1.17에서 1.50 사이로 정체되어 있었습니다. 진정한 장벽은 데이터의 다양성이 아니라 학습 방법이었습니다. 연구진이 작은 배치 샘플링을 끄고 각 기기가 전체 데이터 컬렉션을 한 번에 학습하도록 하자, 생존율은 8.96으로 급격히 뛰어올랐습니다. 이는 작은 배치의 무작위 노이즈가 연합 환경에서 이 기법을 실패하게 만드는 주요 원인임을 입증했습니다.

그러나 연구는 냉혹한 현실 점검과 함께 결론을 맺었습니다. 대규모의 전체 데이터 배치를 사용하고 선택을 동기화함으로써 보호적인 노이즈의 완전한 강도를 회복하는 것이 수학적으로는 가능하지만, 그렇게 하는 데에는 모델의 실제 성능에 대한 엄청난 대가가 따릅니다. 노이즈가 살아남을 수 있었던 구성들은 모델의 학습 결과가 가장 나쁜 구성들과 동일했으며, 테스트 정확도가 현저히 떨어졌습니다. 실험에서 가장 성능이 좋았던 모델들은 작은 배치를 사용했기에 보호적 노이즈가 거의 남아있지 않았던 반나면, 노이즈가 가장 많았던 모델들은 너무 부정확하여 쓸모가 없었습니다. 연구진은 노이즈를 보존하면서도 모델의 학습 능력을 희생하지 않는 중간 지점을 찾지 못했습니다.

결국, 이 논문은 업데이트 마스킹의 실패가 단순한 실수나 버그가 아니라, 시스템이 작동하는 방식의 근본적인 결과임을 밝혀냈습니다. 많은 기기가 함께 학습할 수 있게 해주는 바로 그 메커니즘(업데이트의 평균화)이 업데이트 마스킹이 의존하는 특정한 종류의 노이즈를 씻어내 버립니다. 연구진은 기기들을 동기화함으로써 노이즈가 살아남도록 강제할 수는 있지만, 그렇게 하기 위해 필요한 조건들이 유용한 모델을 훈련시키려는 실제적인 요구사항들과 양립할 수 없음을 보여주었습니다. 단일 컴퓨터에서는 매우 잘 작동하는 보호 효과가, 유용한 모델을 배우기 위해 기꺼이 낮은 학습 성능을 감수하지 않는 한, 다수의 네트워크에서는 제대로 전달되지 않습니다. 이 연구는 이 기법의 한계를 명확히 이해하게 함으로써, 연합 모델이 저렇게 안정적이고 평평한 고판을 찾을 수 있도록 돕는 미래의 솔루션은 다른 곳에서 찾아야 함을 시사하며 마무리됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →