← 최신 논문
💬 NLP

Does the Same Token Mean the Same State? MoE Routing as Signal for Reasoning Control

이 논문은 동일한 토큰의 뚜렷한 Mixture-of-Experts 라우팅 패턴을 활용하여 정답 문자열 파싱이나 투표에 의존하지 않고 고품질 추론 궤적을 선택함으로써, 전통적인 다수결 투표가 실패하는 코드 및 에이전트 작업에서 효과적인 pass@1 선택을 가능하게 하는 새로운 추론 전략인 RAD(Routing Agreement Decoding)를 소개한다.

원저자: Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 질문: "Hello"는 항상 같은 "Hello"일까요?

당신이 100명의 서로 다른 가수들(대규모 AI 모델 내부의 "전문가들")로 구성된 합창단을 듣고 있다고 상상해 보세요. 합창단이 "Hello"라는 단어를 노래할 때, 당신은 그들이 모두 똑같은 발성 기술과 감정을 사용하여 동일한 방식으로 노래하고 있다고 가정할 수도 있습니다.

이 논문은 질문합니다: 만약 AI가 두 가지 서로 다른 상황에서 정확히 똑같은 단어(토큰)를 출력한다면, 그 단어를 만들어낸 내부의 "기계 장치" 또한 동일했다는 것을 의미할까요?

정답은: 아니요.

AI가 똑같은 단어(예: "Hello" 또는 "The answer is 42")를 쓴다 하더라도, 그 단어를 만들어낸 내부의 특정 전문가 그룹(전문가들)은 맥락에 따라 완전히 다를 수 있습니다. 어떤 "Hello"는 수학을 생각하는 전문가 집단에 의해 불릴 수 있고, 또 다른 "Hello"는 코딩을 생각하는 전문가 집단에 의해 불릴 수 있습니다. 단어는 같지만, *내부 상태(internal state)*는 다릅니다.

문제점: 어떻게 정답을 고를 것인가?

보통 우리가 AI에게 어려운 문제(수학 퍼즐이나 코딩 버그 등)를 풀게 하고 싶을 때, 우리는 64번의 시도(64개의 "롤아웃")를 요청합니다. 그런 다음 최종 답변들을 살펴봅니다. 만약 50개가 "42"라고 답하고 14개가 "43"이라고 답한다면, 우리는 다수결에 따라 "42"를 선택합니다.

함정: 이 "최종 답변에 대한 투표" 방식은 수학(정답이 명확한 숫자일 때)에서는 매우 잘 작동합니다. 하지만 다음과 같은 경우에는 문제가 발생합니다:

  1. 코드: 두 프로그램은 완전히 다르게 보일 수 있지만(변수 이름이나 포맷팅이 다름) 동일한 기능을 수행할 수 있습니다. 단순히 "print"라는 단어가 몇 번 나타나는지 세는 것만으로는 부족합니다.
  2. 에이전트: 때때로 AI는 소프트웨어 버그를 수정하려고 합니다. 이때 "답변"은 코드 패치입니다. 모든 시도마다 코드가 고유하기 때문에, 투표할 수 있는 단 하나의 "정확한 문자열"이 존재하지 않습니다.

우리는 최종 답변을 읽거나 비교하지 않고도 최선의 시도를 선택할 수 있는 방법이 필요합니다.

해결책: RAD (라우팅 합의 디코딩, Routing Agreement Decoding)

저자들은 AI 내부에 숨겨진 비밀 신호를 발견했습니다: 바로 **라우터(Router)**입니다.

AI를 수천 명의 전문화된 작업자(전문가)가 있는 거대한 사무실 건물이라고 생각해 보세요. 작업자가 업무를 수행하기 전, 라우터(매니저)가 어떤 팀이 일을 맡을지 결정합니다.

  • 발견: 논문은 AI가 답변의 시작 부분(예: 수학의 \boxed{ 기호나 코드의 백틱 ```)을 쓰기 직전에, 라우터의 결정 패턴이 답변의 품질에 대해 많은 것을 드러낸다는 사실을 발견했습니다.
  • 비유: 당신이 스포츠 토너먼트에서 어떤 팀이 우승할지 예측하려고 한다고 상상해 보세요. 최종 점수를 확인하는 대신, 코치가 경기를 시작하기 위해 어떤 선수들을 선발했는지를 보는 것입니다.
    • 만약 코치가 50번의 서로 다른 경기에서 똑같은 "드림팀" 라인업을 뽑는다면, 그 경기들은 아마도 비슷한 결과로 끝날 가능성이 높습니다.
    • 만약 코치들이 무작위로 맞지 않는 라인업을 뽑는다면, 결과는 제각각일 것입니다.

RAD는 다음과 같이 작동합니다:

  1. 문제에 대해 64개의 서로 다른 시도를 생성합니다.
  2. 최종 답변을 완전히 무시합니다. 답변을 읽지 않습니다.
  3. 답변이 시작되는 바로 그 순간의 라우터 라인업(어떤 전문가들이 선택되었는지)을 살펴봅니다.
  4. "64개의 시도 중 어떤 것들이 가장 유사한 라인업을 가졌는가?"라고 묻습니다.
  5. 가장 유사한 라인업을 가진 그룹에 속한 시도를 선택합니다.

만약 50개의 시도가 답변을 시작할 때 동일한 "전문가 팀"을 사용했다면, RAD는 그 그룹이 가장 확신을 가지고 있으며 정답일 가능성이 높다고 가정합니다. 실제 답변이 무엇인지 알지 못하더라도 말입니다.

이것이 왜 중요한가

  1. 투표가 실패하는 곳에서도 작동합니다: 코딩 작업처럼 단어를 단순히 세는 것이 불가능한 경우에도 RAD는 여전히 작동합니다. RAD는 코드 자체를 보는 것이 아니라, 그 코드를 작성한 "내부 팀"을 보고 최선의 코드 패치를 선택합니다.
  2. 빠르고 단순합니다: 코드의 의미를 이해할 필요가 없습니다. 단지 내부의 "스위치"가 켜지는 패턴을 볼 뿐입니다.
  3. 마법 같은 진실 탐지기는 아닙니다: 논문은 이 점을 솔직하게 밝히고 있습니다. 만약 50명이 모두 틀린 답에 동의한다면("밀집된 오답 영역", dense wrong basin), RAD 역시 그 틀린 답을 선택할 것입니다. RAD는 "진리"를 찾는 것이 아니라 가장 "인기 있는" 경로를 선택하는 것입니다. 이는 "합의 신호(consensus signal)"이지 "진리 검증기(truth verifier)"가 아닙니다.

한 문장 요약

이 논문은 AI가 똑같은 단어를 두 번 말하더라도 내부의 "팀"은 다를 수 있음을 보여줍니다. 답변의 시작 부분에서 가장 일관된 "팀 라인업"을 가진 답변을 선택함으로써, 우리는 최종 답변을 읽지 않고도 최선의 결과를 선택할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →