Divergence Decoding: Training-Free Capability Fusion
Divergence Decoding는 젠슨-섀넌 발산(Jensen-Shannon divergence)을 사용하여 토큰 생성을 적응적으로 라우팅함으로써 전문 모델의 도메인 지식과 범용 모델의 논리적 추론을 동적으로 결합하여 과학 벤치마크에서 단일 모델 베이스라인을 능가하는 학습 불필요(training-free) 프레임워크이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 아주 똑똑하고 어려운 시험을 앞두고 있는 두 명의 천재 친구가 있다고 상상해 보세요. 한 친구는 "전문가(The Specialist)"입니다. 그녀는 화학 교과서의 모든 사실을 암기했습니다. 모든 분자의 이름과 반응의 정확한 공식까지 알고 있죠. 하지만 그녀는 때때로 세부 사항에 너무 집중한 나머지 논리적으로 생각하는 것을 잊어버려, 복잡한 퍼즐을 풀기 위해 필요한 단계에서 비틀거리곤 합니다. 다른 친구인 "일반인(The Generalist)"은 논리와 추론의 달인입니다. 그는 거의 모든 문제의 해결 단계를 찾아낼 수 있지만, 구체적인 화학 명칭이나 사실은 모릅니다. 본 적 없는 성분이라서 엉뚱한 재료를 추측할 수도 있습니다.
오랫동안 과학자들은 이 두 친구 중 한 명을 선택해야 하는 문제로 고민해 왔습니다. 화학 질문에 대한 답이 필요하다면, 보통 둘 중 하나를 선택해야만 했습니다. 하지만 만약 이들이 실시간으로 협력하게 만들 수 있다면 어떨까요? 전문가가 답을 쓰게 하되, 일반인이 바로 옆에 서서 "잠깐, 그 단계는 말이 안 돼"라고 속삭이며, 필요할 때만 개입하여 수정하게 한다면 어떨까요? 이것이 바로 **다이버전스 디코딩(Divergence Decoding)**이라 불리는 새로운 방법의 핵심 아이디어입니다. 이는 두 모델을 새롭게 학습시키거나 함께 훈련시키지 않고도, 전문가의 깊은 지식과 일반인의 날카로운 논리를 결합하는 방법입니다.
문제점: "똑똑하지만 서툰" 대 "논리적이지만 무지한" 딜레마
인공지능의 세계에는 두 가지 주요 유형의 "두뇌"가 있습니다. 첫째는 **범용 대규모 언어 모델(Generalist LLMs)**입니다. 이들은 인터넷의 모든 것을 아는 백과사전과 같습니다. 추론 능력이 뛰어나고, 긴 논리의 사슬을 따르며, 실수로부터 회복하는 능력이 탁받습니다. 이들은 거의 모든 주제에 대해 이야기할 수 있습니다. 반면에 **도메인 특화 모델(Domain-Specialist Models)**이 있습니다. 이들은 전문가들입니다. 화학이나 생물학처럼 특정 과학 분야에 맞춰 훈련되었습니다. 전문 용어와 사실을 누구보다 잘 알고 있습니다.
문제는 어느 쪽도 완벽하지 않다는 점입니다. 범용 모델은 논리는 완벽할지 몰라도 구체적인 사실이 부족하여 과학적 오류를 범할 수 있습니다. 전문가는 사실은 잘 알지만, 복가한 설명을 하는 도중에 논리적인 사고의 흐름을 놓쳐 어처구별한 실수를 저지르곤 합니다. 과학자들은 궁금했습니다. 이 두 가지 강점을 컴퓨터가 생각하는 바로 그 순간에 결합하여, 두 세계의 장점만을 취할 수 있을까?
해결책: "JS 게이트"와 "초안 작성 및 검증"의 댄스
베이징 대학교와 여러 기관의 저자들은 **다이버전스 디코딩(Divergence Decoding)**이라는 영리하고 별도의 훈련이 필요 없는 기법을 고안해 냈습니다. 이것을 두 사람이 벌이는 초고속 "전화기 놀이(Telephone game)"라고 생각하되, 약간의 변주를 준 것이라 상상해 보세요.
보통 컴퓨터가 텍스트를 쓸 때는 단어를 하나씩 예측합니다. 이 새로운 방법에서는 전문가(화학 전문가)가 주도권을 잡습니다. 마치 작가가 문장을 빠르게 휘갈겨 쓰듯, 몇 단어 앞을 미리 "초안(draft)"을 작성합니다. 하지만 그 단어들이 공식적으로 기록되기 전에, 일반인(논리 전문가)이 이를 검토합니다.
여기서 마법 같은 부분이 일어납니다. 시스템은 단순히 "일반인이 그 단어에 동의하는가?"를 묻는 것이 아닙니다. 대신, "그들의 생각이 얼마나 다른가?"를 묻습니다. 이 시스템은 젠슨-섀넌(Jensen-Shannon, JS) 발산이라는 수학적 도구를 사용합니다. 이것을 "불일치 측정기"라고 생각하면 쉽습니다.
- 낮은 불일치 (녹색 신호): 만약 전문가와 일반인이 다음 단어에 대해 거의 같은 생각을 하고 있다면, 시스템은 전문가가 옳다고 가정합니다. 그 단어를 수용하고 다음으로 넘어갑니다. 이를 통해 과학적 사실의 정확성을 유지합니다.
- 높은 불일치 (적색 신호): 만약 두 모델의 예측이 완전히 다르다면, 시스템은 이를 경고 신호로 간주합니다. 이는 전문가가 논리적 오류를 범하기 직전임을 의미합니다. 이 경우, 시스템은 즉시 제어권을 일반인에게 넘겨, 논리적 흐름을 유지할 수 있는 더 나은 단어를 선택하게 합니다.
이 과정은 개별 단어(토큰) 단위로 초당 수천 번 발생하며, 전문가가 사실을 제공하고 일반인이 안전망 역할을 하는 매끄러운 대화를 만들어냅니다.
발견한 내용: "A + B > A" 효과
연구진은 이 아이디어를 ChemBench, ChemCoTBench, GPQA와 같은 벤치마크를 포함한 매우 어려운 화학 및 과학 퍼즐에 테스트했습니다. 그들은 Qwen 및 Llama 시리즈와 같은 다양한 모델을 짝지어 이 "융합"이 실제로 작동하는지 확인했습니다.
결과는 흥미로웠습니다. 결합된 시스템(Divergence Decoding)은 전문가 단독 모델이나 일반인 단독 모델보다 일관되게 높은 성능을 보였습니다.
- 분자를 이해하고 편집하는 화학 작업에서, 융합된 모델은 두 모델 중 어느 하나가 단독으로 작동할 때보다 더 높은 점수를 기록했습니다.
- 예를 들어, "고리 구조 스캐폴드(Ring System Scaffold)"(분자 내 복잡한 고리 구조 식별)라는 작업에서, 융합 모델은 0.70의 점수를 기록하여 전문가의 0.58과 일반인의 0.67을 모두 앞질렀습니다.
- 까다로운 GPQA(대학 수준의 구글 검색 불가능한 Q&A) 화학 질문에서, 융합 모델은 **37.50%**의 정확도를 기록한 반면, 전문가는 15.28%, 일반인은 **23.61%**에 그쳤습니다.
이는 두 모델이 협력함으로써, 각자의 부분의 합보다 더 똑똑한 "슈퍼 브레인"을 만들어낼 수 있음을 시사합니다.
마법이 일어나는 "시기"와 "장소"
논문은 또한 이 전환이 언제 일어나는지를 면밀히 살펴보았습니다. 연구진은 시스템이 주로 답변의 맨 앞부분(0% ~ 25%)에서 개입한다는 것을 발견했습니다. 이때가 바로 추론 경로가 설정되는 시점입니다. 만약 전문가가 초기에 잘못된 논리 경로로 접어든다면, 일반인이 개입하여 실수가 확산되기 전에 방향을 바로잡습니다.
흥 nghiệm스럽게도, 교체되는 단어들은 어려운 과학 용어(예: "벤젠" 또는 "촉매")가 아니라, 연결어 나 논리적 구절(예: "그러므로", "그러나", "이러한 특징들이 인식되면")인 경우가 많았습니다. 이는 일반인의 주된 역할이 이야기의 논리를 바로잡는 것이며, 전문가는 사실을 채워 넣는 것임을 말해줍니다.
이것이 아닌 것 (및 한계)
이 방법이 무엇이 아닌지를 명시하는 것도 중요합니다. 이것은 AI의 속도를 높이기 위해 흔히 사용되는 기술인 "추측적 디코딩(Speculative Decoding)"이 아닙니다. 추측적 디코딩은 단일 모델인 것처럼 가장하면서 속도를 높이기 위해 다음 단어를 예측하려고 노력합니다. 반면 다이버전스 디코딩은 속도에 신경 쓰지 않습니다. 그것은 품질에 집중합니다. 컴퓨터가 조금 더 많이 생각하게 되더라도, 더 나은 답을 만들기 위해 적극적으로 답을 수정합니다.
또한, 논문은 이 방식이 두 모델이 서로 다른 유형의 실수를 하기 때문에 효과적이라고 제안합니다. 두 모델이 의견 차이를 보일 때, 그것은 대개 전문가가 논리 문제로 고전하고 있다는 신호이지, 일반인이 혼란을 겪고 있다는 신호가 아닙니다. 시스템은 이 불일치를 기어를 전환하는 신호로 사용합니다.
결론
다이버전스 디코딩은 거대한 새로운 모델을 훈련시키기 위해 몇 달을 보낼 필요 없이 더 똑똑한 AI를 구축하는 새로운 방법입니다. 이는 단순히 전문가와 논리학자를 데려와 서로 대화하게 하고, "불일치 측정기"를 사용하여 다음에 누가 말할지를 결정하는 것입니다. 연구 결과는 이 간단하고 훈련이 필요 없는 기법이 두 모델이 단독으로 존재할 때보다 더 신뢰할 수 있고 정확한 시스템을 만들 수 있음을 보여주며, 과학과 발견을 위한 더 나은 AI 도구를 구축하는 유망한 길을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.