← 최신 논문
💬 NLP

RARE: Decoupling Representation Steering from Expert Routing in Mixture-of-Experts Language Models

이 논문은 행동적 섭동(behavioral perturbations)을 라우터의 영공간(null space)에 투영함으로써 표현 제어(representation steering)를 Mixture-of-Experts 모델의 전문가 라우팅으로부터 분리하여, 모델의 유용성을 유지하면서도 유해성, 진실성 및 사실 편집에 대한 제어 효과를 크게 향상시키는 라우터 불가지론적 프레임워크인 RARE를 소개한다.

원저자: Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

게시일 2026-08-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 현대 인공지능의 엔진으로서 이야기를 쓰고, 문제를 해결하며, 질문에 답하는 능력을 갖추고 있습니다. 이러한 거대한 시스템을 효율적으로 만들기 위해, 최근에는 많은 모델이 '전문가 혼합(mixture of experts)'이라 불리는 설계 방식을 사용하여 구축되고 있습니다. 모든 요청을 받는 매니저가 있고, 그 매니저가 어떤 특정 전문가가 해당 요청을 처리해야 할지 결정하는 큰 사무실을 상상해 보십시오. 이 모델들에서 '매니저'는 문장의 각 단어를 살펴보고 이를 컴퓨터 전체의 뇌를 사용하는 대신, 내부 프로세서의 작고 특화된 그룹인 '전문가'들에게 전달하는 라우팅 메커니즘입니다. 이를 통해 모델은 매우 크고 똑똑하면서도, 실행 시에는 매우 빠르고 경제적으로 운영될 수 있습니다.

연구자들은 오랫동안 모델을 특정 행동(예: 더 진실하거나 유해한 콘텐츠를 생성할 가능성이 낮아지도록)으로 유도하거나 '조종(steer)'하는 방법을 모색해 왔습니다. 한 가지 인기 있는 기술은 모델의 사고 과정 중에 모델의 내부 수학적 상태를 미세하게 조정하는 '넛지(nudge)' 방식인데, 이는 뇌의 모든 부분이 항상 활성화되어 있는 기존의 더 오래되고 단순한 모델에서는 잘 작동하는 방법입니다. 그러나 과학자들이 이 동일한 넛지 기술을 최신 전문가 혼합 모델에 적용하려 했을 때, 이는 종종 실패했습니다. 문제는 행동을 바꾸기 위해 의도된 넛지가 실수로 매니저를 혼란스럽게 하여, 요청을 잘못된 전문가에게 보내게 만들었다는 점이었습니다. 이러한 불일치는 모델의 자연스러운 흐름을 방해하여 좋지 않은 결과를 초래했습니다.

한 연구팀은 이제 RARE라는 새로운 프레임워크를 개발하여 이 수수께끼를 풀었습니다. 그들의 연구는 이 모델의 매니저가 모델이 보여주어야 할 구체적인 '행동'이 아니라, 요청의 '주제'에 주로 관심을 둔다는 결정적인 통찰을 밝혀냈습니다. 사용자가 코딩에 대해 질문하든 유해한 요청을 거부하도록 요청하든, 주제가 동일하다면 매니저는 동일한 전문가 집단으로 요청을 보내는 경향이 있습니다. 연구진은 기존의 방법들이 데이터가 지나가는 경로를 변경함으로써 행동을 바꾸려 했기 때문에 매니저를 혼란스럽게 했다는 사실을 발견했습니다. 대신, 그들의 새로운 접근 방식은 경로를 바꾸지 않고 행동을 바꿉니다.

RARE 프레임워크는 넛지를 적용하기 전에 이를 세심하게 필터링함으로써 작동합니다. 이 방식은 매니저가 사용할 전문가에 대한 생각을 바꾸게 만드는 지시 사항의 모든 부분을 제거합니다. 이렇게 함으로써 모델은 올바른 전문가에게 요청을 계속 보내되, 그 전문가들이 원하는 행동을 생성하도록 정보를 처리하게 만듭니다. 연구진은 이 방법을 6개의 서로 다른 대규모 모델과 3가지 별개의 작업(유해성 감소, 진실성 향상, 특정 지식 업데이트)에 대해 테스트했습니다.

결과는 놀라웠습니다. 모델이 유해한 지시를 따르지 못하게 하려 할 때, 이 새로운 방법은 일반 지식 테스트에 대한 정확도를 67.8%로 유지하면서도 53.3%의 성공률을 기록하며 이전의 시도들에 비해 유의미한 개선을 보였습니다. 진실성 테스트에서는 모델이 정답을 제시하는 능력이 41.0%에서 58.6%로 향상되었습니다. 아마도 가장 극적인 것은 특정 사실을 업데이트하도록 요청했을 때로, 성공률이 16.8%에서 96.3%로 급증했습니다. 이러한 수치는 모델의 내부 라우팅 시스템을 존중함으로써, 연구진이 근본적인 지능을 손상시키지 않고도 모델의 행동을 효과적으로 가이드할 수 있음을 시사합니다.

또한 이 연구는 필요한 넛지를 계산하는 다섯 가지 서로 다른 방법을 비교하여 어떤 것이 가장 잘 작동하는지 찾아냈습니다. 연구진은 단순히 평균적인 방향만을 분석하는 것이 아니라, 데이터의 형태와 퍼짐을 분석하는 데 기반한 방법이 모든 모델에 걸쳐 가장 일관되고 강력한 결과를 제공한다는 것을 발견했습니다. 이 발견은 내부 데이터의 기하학적 구조가 변화의 방향만큼이나 중요하다는 것을 시사합니다.

궁극적으로, 이 연구는 현대의 복잡한 AI 모델의 행동을 제어하는 데는 섬세한 균형이 필요하다는 것을 보여줍니다. 단순히 강제로 변화를 줄 수는 없으며, 모델의 기존 구조 내에서 움직여야 합니다. 모델이 주어진 주제에 대해 선택한 자연스러운 경로를 보존함으로써, 그 출력값을 안전, 진실 또는 정확성 쪽으로 유도하는 것이 가능합니다. 이 접근 방식은 모델의 일반적인 능력을 저해하지 않으면서도 특정 목적에 맞게 도구를 적응시킬 수 있는 신뢰할 수 있는 방법을 제공하며, 인공지능을 인간의 가치에 더 부합하도록 만드는 명확한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →