← 최신 논문
🤖 machine learning

Output Dilution: Redundant but Fragile Representations in MoE Models

이 논문은 혼합 전문가(Mixture-of-Experts, MoE) 모델이 밀집(dense) 모델만큼이나 도덕적 내용을 중복적으로 인코딩함에도 불구하고, 활성화된 전문가들의 평균화가 신호 강도를 급격히 감소시켜 안정적인 라우팅에도 불구하고 인코딩된 정보가 노이즈에 의해 쉽게 압도되게 만드는 '출력 희석(output dilution)' 현상 때문에 그 표현형이 현저히 더 취약하다는 사실을 밝혀낸다.

원저자: Orion Reblitz-Richardson

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Orion Reblitz-Richardson

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능 분야가 급격히 발전함에 따라, 연구자들은 거대 언어 모델이 어떻게 사고하는지 이해하기 위해 끊임없이 노력하고 있습니다. 이야기를 쓰고, 문제를 해결하며, 질문에 답할 수 있는 이 시스템들은 방대한 수학적 연결망을 기반으로 구축됩니다. 이러한 네트워크의 대중적인 설계 방식 중 하나는 '전문가 혼합(mixture of experts)'이라고 불립니다. 이는 마치 숙련된 전문가들로 구성된 큰 팀을 상상하는 것과 같습니다. 컴퓨터가 문장을 처리할 때마다 그중 아주 작은 그룹만이 작업할 수 있도록 허용되고, 나머지는 침묵을 지키는 방식입니다. 이러한 접근법은 더 적은 자원을 사용하여 각 작업을 수행함으로써 컴퓨터를 더 빠르고 효율적으로 만들기 위해 설계되었습니다. 과학자들이 이러한 모델을 인간의 가치와 정렬(aligning)—즉, 모델이 윤리적이고 안전하게 행동하도록 보장하는 것—시키는 방법을 연구할 때, 이 구조는 매혹적인 가능성을 제공합니다. 만약 도덕적 추론이 특정하고 격리된 전문가 그룹에 의해 처리된다면, 연구자들은 나머지 시스템을 방해하지 않고도 그 특정 그룹만을 미세하게 조정하거나 제거하여 잘못된 행동을 수정할 수 있을 것입니다. 이는 복잡한 문제에 대한 깔끔하고 외과적인 접근법입니다.

그러나 OLMoE라는 특정 오픈 소스 모델을 사용한 새로운 연구는 이러한 희망이 헛된 것임을 밝혀냈습니다. 연구진은 이 '전문가' 모듈들이 실제로 도덕적 추론을 전문으로 하는지, 아니면 모두 동일한 일을 하는지를 확인하고자 했습니다. 또한 도덕적 신호가 실제로 얼마나 강력한지도 테스트하고자 했습니다. 결과는 놀라웠습니다. 연구 결과, 모델에는 전담 도덕 전문가 팀이 존재하지 않았습니다. 대신, 네트워크의 모든 층에 걸쳐 있는 모든 개별 전문가 모듈이 동일한 도덕적 정보를 포함하고 있었습니다. 더 중요한 것은, 이 도덕적 정보가 존재하기는 하지만 믿기 힘들 정도로 취약하다는 점을 발견했다는 것입니다. 정보는 시스템 안에 존재하지만, 너무 약하게 표현되어 있어 아주 적은 양의 디지털 노이즈만으로도 사라질 수 있는 반면, 동일한 크기의 일반적인 모델은 같은 방해에도 쉽게 견뎌낼 수 있었습니다.

조사는 16개의 층 각각에 64개의 전문가 모듈을 포함하고 있는 OLMoE 모델의 내부 작동 원리를 조사하는 것으로 시작되었습니다. 연구진은 각 개별 모듈의 출력 내에서 도덕적 개념을 찾아낼 수 있는지 확인하기 위해 간단한 탐지기를 훈련시켰습니다. 만약 '전문가 혼합' 설계가 기대했던 대로 작동한다면, 특정 몇 개의 모듈만이 도덕적 내용을 인식하는 데 능숙하고, 나머지 모듈은 문법이나 사실 같은 다른 작업에 집중할 것이라고 예상했습니다. 그러나 결과는 정반대였습니다. 거의 모든 단일 모듈이 네트워크 내의 위치와 상관없이 도덕적 내용을 높은 정확도로 식별할 수 있었습니다. 이러한 능력의 분포는 완벽하게 균등했습니다. 어떤 모듈도 전문가가 아니었고, 어떤 모듈도 초보자가 아니었습니다. 어떤 모듈이 작업할지를 결정하는 라우터(router) 역시 특정 전문가에게 도덕적 문장을 보내는 것에 대해 아무런 선호도를 보이지 않았습니다. 라우터는 모든 입력을 동일하게 취급했습니다. 이는 별도의 전문가를 두는 구조적 이점이 도덕적 특징을 표적화된 개입을 위해 분리하는 데 도움이 되지 않음을 의미합니다.

연구진은 다음으로 더 미묘한 질문, 즉 이 도덕적 정보가 얼마나 견고한가에 주목했습니다. 그들은 OLMoE 모델을 전문가 시스템을 사용하지 않지만 유사한 수의 활성 파라미터를 가진 표준 '밀집(dense)' 모델과 비교했습니다. 모델이 도덕적 내용을 인식하는 능력을 잃기 전까지 얼마나 많은 노이즈를 견딜 수 있는지 테스트했을 때, 극명한 차이가 나타났습니다. 표준 모델은 매우 튼튼하여 상당한 수준의 디지털 간섭을 견디면서도 도덕적 이해를 유지할 수 있었습니다. 반면, OLMoE 모델은 거의 즉각적으로 무너졌습니다. 이 모델은 표준 모델보다 4배 이상 더 취약했습니다. 전문가 모델의 도덕적 신호는 너무나 섬세해서, 아주 작은 정적 노이즈만으로도 완전히 묻혀버릴 정도였습니다.

이 현상의 원인을 이해하기 위해 연구팀은 정보가 시스템을 통해 어떻게 흐르는지 살펴보았습니다. 표준 모델에서 처리 단위들은 다음 단계의 네트워크로 강하고 명확한 신호를 보냅니다. 반면 전문가 모델에서는 시스템이 몇몇 전문가를 선택하고, 그들의 출력을 평균화하여 그 결과를 앞으로 전달합니다. 연구진은 이 결합된 신호의 강도를 측정했고, 그것이 표준 모델보다 현저히 약하다는 것을 발견했습니다. 신호는 희석되어 원래보다 거의 두 자릿수(orders of magnitude)나 작아졌습니다. 이를 시각화하는 한 가지 방법은 붐비는 방 안에서의 대화를 상상하는 것입니다. 표준 모델에서는 한 사람이 명확하고 강한 목소리로 말하여 모두가 들을 수 있습니다. 하지만 전문가 모델에서는 여덟 명의 사람이 같은 문장을 속삭이고, 방 안에서는 그 속삭임들의 평균값만을 듣게 되는 것과 같습니다. 메시지는 존재하지만, 너무 작아서 약간의 소음이라는 바람만 불어도 듣는 것이 불가능해집니다.

이 발견은 우리가 이러한 시스템을 이해하고 제어하는 방식에 심오한 시사점을 던집니다. 연구는 이러한 취약성이 모델이 시간이 지남에 따라 제대로 학습하지 못해서 발생한 결과가 아님을 보여주었습니다. 연구진은 모델의 첫 단계부터 최종 형태에 이르기까지의 훈련 이력을 검토함으로써, 도덕적 정보가 처음부터 존재했으며 전체 과정 동안 균일하게 분포되어 있고 약한 상태로 유지되었음을 확인했습니다. 모델은 결코 특화된 도덕 전문가를 개발하지 못했으며, 신호를 강화하지도 않았습니다. 이 취약성은 구조 자체에 내재된 특징입니다. 시스템이 선택된 몇몇 전문가의 출력을 평균화하기 때문에, 결과물인 신호는 본질적으로 작을 수밖에 없습니다. 이 작은 신호는 노이즈에 의해 쉽게 압도되며, 이는 이러한 모델의 도덕적 인코딩이 전통적인 설계보다 훨씬 덜 안전함을 의미합니다.

연구는 전문가 혼합 설계가 정렬 연구를 위한 희망이라는 주장이 환상이라는 결론을 내립니다. 이 구조는 네트워크를 별개의 단위로 분할하는 방법을 제공하지만, 편집하거나 제거하기 쉬운 고립된 도덕적 추론 영역을 만들어내지는 않습니다. 대신, 도덕적 정보를 모든 단위에 얇게 퍼뜨려 놓음으로써, 정보의 중복성은 높이지만 동시에 믿을 수 없을 정도로 취약하게 만듭니다. 모델이 안전하게 행동하도록 보장하려는 연구자들에게 이는, 단순히 모델이 도덕적 개념을 식별할 수 있는지 여부를 보는 것만으로는 충분하지 않다는 것을 의미합니다. 그들은 그 정보가 얼마나 안전하게 보유되고 있는지도 측정해야 합니다. 모델이 표면적으로는 윤리를 완벽하게 이해하는 것처럼 보일지라도, 환경의 미세한 변화나 미세 조정(fine-tuning) 과정에서의 작은 조정만으로도 그 이해를 완전히 잃어버릴 만큼 취약할 수 있기 때문입니다. 이 연구는 이러한 모델들이 구축되는 방식이 내부 신호의 본질을 근본적으로 변화시켜, 훈련만으로는 해결할 수 없는 영구적인 구조적 약점을 만든다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →