← 최신 논문
💻 computer science

FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs

FedLNS는 추가적인 데이터 교환이나 레이블이 지정된 공격 사례를 필요로 하지 않으면서, 정규화 계층 파라미터 변화에 대한 경량 분석을 통해 악의적인 클라이언트 업데이트를 스크리닝함으로써 다양한 모델 아키텍처 전반에 걸쳐 우수한 강건성을 달성하여 연합 LLM 학습에서의 적대적 조작을 완화하는 서버 측 프레임워크이다.

원저자: Kai Li, Jong-Ik Park, Carlee Joe-Wong, Wei Ni, Falko Dressler

게시일 2026-08-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kai Li, Jong-Ik Park, Carlee Joe-Wong, Wei Ni, Falko Dressler

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 우리가 매일 사용하는 스마트 어시스턴트, 검색 도구, 그리고 글쓰기 보조 도구의 엔진 역할을 합니다. 이러한 시스템은 방대한 양의 텍스트를 읽으며 학습하지만, 가장 가치 있는 정보 중 상당수는 개인적인 메시지, 의료 기록, 또는 기업의 기밀 문서와 같이 사적인 영역에 잠겨 있습니다. 데이터를 직접 보지 않고도 이 사적인 데이터를 사용하여 모델을 가르치기 위해, 연구자들은 연합 학습(federated learning)이라 불리는 방법을 사용합니다. 이 설정에서는 데이터가 모델로 이동하는 대신 모델이 데이터를 찾아갑니다. 중앙 컴퓨터는 현재 모델의 복사본을 여러 기기로 보내고, 각 기기는 자신만의 사적인 정보를 바탕으로 학습한 뒤, 자신이 배운 '변화량'만을 다시 보냅니다. 그러면 중앙 컴퓨터는 이 변화량들을 결합하여 더 똑똑하고 업데이트된 모델을 만듭니다. 이 과정은 개인정보를 보호하지만, 새로운 취약점을 만들어냅니다. 중앙 컴퓨터가 로컬 기기에서 어떤 일이 일어나고 있는지 볼 수 없다는 점입니다. 부정직한 기기는 사적인 데이터로부터 학습하는 척하면서 실제로는 잘못된 지침을 주입하여, 모델이 올바르게 말하거나 쓰는 능력을 저하시키도록 중앙 컴퓨터를 속일 수 있습니다.

한 연구팀이 이러한 부정직한 업데이트가 글로벌 모델에 피해를 주기 전에 이를 포착할 수 있는 새로운 방법을 개발했습니다. 그들은 이 시스템을 FEDLNS라고 부르며, 이는 중앙 서버로 흘러 들어오는 정보의 보안 검문소와 같은 역할을 합니다. 수십억 개의 숫자를 포함하고 있어 철저히 검사하기에는 너무 복잡한 거대한 모델 업데이트의 모든 부분을 일일이 검사하는 대신, 연구진은 모델 내의 아주 작고 특정한 숫자 집합에 집중합니다. 이 숫자들은 모델이 언어를 이해하는 방식을 어떻게 조절하고 변화시키는지 제어하며, 일종의 모델 조정 방식에 대한 '서명(signature)' 역할을 합니다. 이 특정 숫자들의 변화를 관찰함으로써, 서버는 정상적이고 정직한 학습이 어떤 모습인지에 대한 프로필을 구축할 수 있습니다. 기기가 업데이트를 보낼 때, 서버는 그 서명을 다른 기기들의 서명 이력과 비교합니다. 만약 어떤 기기의 변화가 대중의 흐름과 너무 다르다면, 시스템은 이를 의심스러운 것으로 분류하여 따로 떼어 놓음으로써, 나쁜 업데이트가 최종 모델에 섞이는 것을 방지합니다.

연구진은 이 접근 방식을 문장의 다음 단어를 예측하는 모델부터 빈칸을 채우는 모델, 그리고 현대의 챗봇을 구동하는 것과 유사한 거대 모델에 이르기까지 세 가지 다른 유형의 언어 모델에 대해 테스트했습니다. 그들은 참여하는 기기의 최대 40%가 악의적인 의도를 가지고 단어 간의 잘못된 연관성을 가르쳐 모델을 타락시키려 하는 시나리오를 시뮬레이션했습니다. 이러한 까다로운 조건에서도 이 새로운 시스템은 유해한 업데이트를 성공적으로 걸러냈습니다. 이 보호 기술로 학습된 모델은 기존의 안전 기술로 학습된 모델보다 성능이 현저히 뛰어났습니다. 구체적으로, 보호된 모델은 다음 단어를 예측할 때 오류가 적었으며, 기존의 차세대 방식과 비교했을 때 혼란도가 최대 18%까지 감소했습니다. 또한 선택의 불확실성도 줄어들었는데, 이는 모델이 혼란스럽거나 터무니없는 문장을 생성할 가능성이 낮아졌음을 의미합니다.

이 발견이 특히 유용한 이유는 중앙 서버가 알려진 악성 행위자의 목록을 가질 필요가 없으며, 거짓말쟁이를 잡아내기 위한 별도의 사전 학습된 탐지기를 필요로 하지 않기 때문입니다. 이 시스템은 단순히 그룹의 기기들을 관찰함으로써 무엇이 정상인지를 학습합니다. 시스템은 신뢰할 수 있는 정직한 행동의 모습을 구축할 만큼 충분히 다양한 기기들을 관찰할 때까지 기다린 후, 비로소 스크리닝을 시작합니다. 연구진은 스크리닝을 시작하기 전 더 많은 기기를 관찰할수록 성능이 향아졌지만, 그룹의 일부만 보고도 여전히 효과적으로 작동할 수 있다는 것을 발견했습니다. 결정적으로, 이 보호 기능은 전적으로 서버 측에서 이루어지므로, 업데이트를 보내는 기기들은 소프트웨어를 변경하거나 추가 정보를 보낼 필요가 없습니다. 따라서 이 방법은 기존 시스템의 속도를 늦추지 않고도 쉽게 도입할 수 있습니다.

이 연구는 신뢰할 수 있는 데이터 없이도 개인정보를 희생하지 않고 연합 학습을 보호하는 것이 가능하다는 점을 확인시켜 줍니다. 전체 모델 대신 압축된 구조 인식형 서명에 집중함으로써, 연구진은 악의적인 조작이 퍼지는 것을 막는 가벼운 방패를 만들었습니다. 시뮬레이션 결과, 이 접근 방식은 다양한 데이터 분포와 모델 유형에 걸쳐 6가지의 흔한 안전 기술들을 지속적으로 능가했습니다. 이 결과는 모델의 미세한 내부 변화를 모니터링함으로써, 다수의 참가자가 시스템을 속이려 하는 상황에서도 협업 학습의 무결성을 유지할 수 있음을 시사합니다. 이는 나쁜 행위자들에게 쉽게 속지 않으면서도 사적인 데이터로부터 학습할 수 있는, 더 신뢰할 수 있는 인공지능을 구축하기 위한 실질적인 경로를 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →