← 최신 논문
💬 NLP

Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance

이 논문은 텍스트 확산 모델에서 충실도(fidelity)와 다양성(diversity)의 균형을 동적으로 조절하기 위해 커널 그램 행렬(kernel Gram matrix)에 대한 2차 레니 엔트로피(order-2 Rényi entropy)를 활용하는 새로운 학습 불필요(training-free) 가이드 방법인 SAKE(Semantic-Aware Kernel Entropy)를 소개하며, 이를 통해 코드 및 수학 생성과 같이 추론 집약적인 작업에서 기존 베이스라인들을 능가하는 성능을 보여준다.

원저자: Jingwei Zhang, Haoyu Lei, Zijin Feng, Jiacheng Sun, Farzan Farnia

게시일 2026-08-04
📖 6 분 읽기🧠 심층 분석

원저자: Jingwei Zhang, Haoyu Lei, Zijin Feng, Jiacheng Sun, Farzan Farnia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 이야기를 쓰거나, 수학 문제를 풀거나, 비디오 게임을 코딩하도록 가르치려 한다고 상상해 보세요. 오랫동안 이를 수행하는 가장 좋은 방법은 인간이 키보드로 타이핑하는 것처럼 로봇이 한 번에 한 단어씩 쓰게 만드는 것이었습니다. 하지만 여기에는 함정이 있습니다. 로봇이 일단 단어를 선택하면, 그 선택에 묶여 버린다는 것입니다. 만약 초반에 아주 작은 실수라도 한다면, 전체 이야기가 엉망진창으로 흘러갈 수 있으며, 다시 돌아가서 수정하기가 쉽지 않습니다. 최근 과학자들은 "디퓨전 모델(Diffusion Model)"이라는 새로운 종류의 로봇 두뇌를 발명했습니다. 이 로봇은 단어를 하나씩 타이핑하는 대신, 온통 엉망인 페이지에서 시작하여 한꺼번에, 그러나 점진적으로 내용을 정돈해 나갑니다. 이는 마치 예술가가 먼지를 닦아내며 흐릿한 그림을 점점 더 선명한 걸작으로 만들어가는 과정을 지켜보는 것과 같습니다. 이 방식은 전체적인 그림을 한 번에 볼 수 있다는 점에서 매우 훌륭하지만, 까다로운 문제점이 하나 있습니다. 바로 로봇이 똑같은 패턴에 갇혀 버릴 수 있다는 것입니다. 로봇이 계속해서 똑같이 지루한 문장만을 반복하거나, 혹은 너무 다르게 보이려고 애쓰다가 이야기가 무너져 버릴 수도 있습니다. 과학자들의 큰 과제는 어떻게 하면 로봇이 논리적인 능력을 잃지 않으면서도 창의적이고 새로운 아이디어를 탐구하게 만들 것인가 하는 점입니다.

이 논문은 이러한 "디퓨전" 로봇들이 더 창의적으로 생각할 수 있도록 돕는 SAKE(Semantic-Aware Kernel Entropy)라는 영리한 새로운 기술을 소개합니다. 연구진은 로봇을 더 다양하게 만드는 일반적인 방법, 즉 "온도(temperature)" 조절 노브를 높여 무작위성을 높이는 것이 마치 지루한 이야기에 꽃가루를 한 움큼 던지는 것과 같다는 사실을 발견했습니다. 꽃가루는 다양성을 더해줄 수는 있지만, 품질을 망쳐서 이야기를 무작위적인 소음처럼 만들어 버립니다. 대신, 저자들은 "호기심 많은 탐험가" 역할을 하는 더 똑똑한 가이드를 제안합니다. 이 가이드는 로봇이 방금 쓴 내용과 너무 유사한 단어를 선택하려 하는지 확인합니다. 만약 로봇이 반복적인 아이디어의 굴레에 갇히려 한다면, 가이드는 부드럽게 로봇을 다른, 하지만 여전히 말이 되는 경로로 밀어줍니다. 반대로 로봇이 이미 창의적으로 행동하고 있다면, 가이드는 뒤로 물러나 로봇이 스스로 나아가도록 둡니다.

연구팀은 이 방법을 코딩이나 복잡한 수학 문제를 푸는 것과 같은 어려운 과제들에 테스트했습니다. 그 결과, 새로운 가이드가 기존 방식보다 훨씬 더 다양한 정답을 생성하는 데 도움을 준다는 것을 발견했습니다. 예를 들어, 코드를 작성하라는 요청을 받았을 때, SAKE를 사용한 로봇은 32번의 시도 중 55.8%의 확률로 정답을 맞힌 반면, 표준 방식은 41.1%에 그쳤습니다. 수학에서도 이와 유사한 개선이 나타났습니다. 이 논문은 "엔트로피 기반 가이던스(entropy-based guidance)"를 사용함으로써, 우리가 작업의 품질을 희생하지 않고도 AI가 더 많은 가능성을 탐색하게 할 수 있으며, 결과적으로 창의성과 정확성 사이의 절충안을 효과적으로 해결할 수 있음을 시사합니다.

문제점: 로봇의 "지루한 루프"

이것이 왜 중요한지 이해하기 위해, 이러한 AI 모델들이 보통 어떻게 작동하는지 살펴봅시다. 당신이 비밀 단어를 맞히는 게임을 하고 있다고 상상해 보세요. 만약 당신이 안전하게 플레이한다면, 가장 흔한 단어들을 먼저 추측할 것입니다. 하지만 승리하고 싶다면, 다양한 추측을 시도해야 합니다. AI 텍스트 생성의 세계에는 "온도 스케일링(temperature scaling)"이라 불리는 흔한 도구가 있습니다. 이것을 무작위성을 조절하는 볼륨 노브라고 생각하세요. 노브를 낮추면(낮은 온도), AI는 안전한 선택을 하여 가장 가능성 높은 단어들을 고르게 되며, 이는 종종 반복적이고 지루한 텍스트로 이어집니다. 반대로 노브를 아주 높이면(높은 온도), AI는 거칠어져서 무작위적인 단어들을 선택합니다. 이것은 다양성을 만들어내지만, 지저치 못한 다양성입니다. 이는 라디오의 볼륨을 끝까지 높여서 새로운 채널을 들으려는 것과 같습니다. 새로운 것을 들을 수는 있겠지만, 동시에 엄청난 잡음과 정전기가 섞여 음악을 알아들을 수 없게 되는 것과 마찬가지입니다.

연구진은 코딩이나 수학과 같은 복잡한 작업에서는 단순히 '더 많은' 다양성이 필요한 것이 아니라, '더 나은' 다양성이 필요하다고 주장합니다. 우리는 AI가 (마치 퍼즐을 푸는 다양한 방법을 시도하듯) 다양한 추론 경로를 탐색하면서도, 엉터리가 되지 않기를 원합니다. 기존 방식은 AI를 너무 안전하게 만들거나(지루함), 혹은 너무 거칠게 만들었습니다(망가짐).

해결책: "호기심 많은 탐험가" 가이드

이 논문의 저자인 장징웨이(Jingwei Zhang)와 그의 팀은 AI를 안내하는 새로운 방법인 SAKE(Semantic-Aware Kernel Entropy)를 고안했습니다. SAKE는 단순히 "무작위성" 노브를 돌리는 대신, AI 옆에 서 있는 똑똑한 코치처럼 행동합니다.

작동 방식은 다음과 같습니다:

  1. 코치가 지도를 확인합니다: AI가 텍스트를 생성하는 동안, SAKE는 AI가 이미 선택한 단어들과 다음에 고려 중인 단어들을 살펴봅니다. 그리고 특수한 "지도"(커널 그램 행렬, kernel Gram matrix라고 불림)를 사용하여 아이디어들이 얼마나 유사한지 확인합니다.
  2. "밀어내는" 힘: 만약 AI가 방금 말한 것과 너무 유사한 단어(예를 들어, "개가 달린다"라고 말한 뒤 또 "개가 달린다"라고 말하는 경우)를 선택하려 한다면, 코치는 "밀어내는 힘(repulsive force)"을 느낍니다. 코치는 AI를 그 반복적인 선택으로부터 멀어지게 밀어내어, 다른, 하지만 여전히 연관된 아이디어를 시도하도록 독려합니다.
  3. 동적 조정: 멋진 점은 이 코치가 똑똑하다는 것입니다. 만약 AI가 이미 창의적으로 다양하게 단어를 선택하고 있다면, 코치는 긴장을 풀고 AI가 자연스러운 확신을 따르도록 내버려 둡니다. 코치는 AI가 루프에 갇히기 시작할 때만 개입합니다.

논문은 이를 문제의 "선형화(linearizing)"라고 설명합니다. 모든 단어 사전에 대해 완벽한 답을 계산하려고 노력하는 대신(그것은 시간이 너무 오래 걸릴 것입니다), AI는 자신의 뇌 속(임베딩 공간)에 있는 아이디어의 "모양"을 보고 빠르게 올바른 방향으로 밀어주는 계산을 수행합니다. 이 덕분에 이 과정은 실시간으로 사용하기에 충분히 빠르게 진행됩니다.

결과: 더 나은 결과, 더 적은 소음

연구팀은 새로운 가이드가 실제로 작동하는지 확인하기 위해 여러 벤치마크에서 테스트를 진행했습니다. 그들은 SAKE를 표준 "온도" 방식 및 "이산 분류기-자유 가이던스(Discrete Classifier-Free Guidance, D-CFG)"라고 불리는 또 다른 인기 있는 방식과 비교했습니다.

  • 코드 생성: 컴퓨터 코드를 작성하도록 요청받았을 때(HumanEval 및 MBPP 테스트 사용), SAKE를 사용한 AI는 여러 번의 시도 중 정답을 찾는 능력이 훨씬 뛰어났습니다. HumanEval 테스트의 경우, 성공률이 표준 방식의 **41.1%**에서 SAKE를 사용했을 때 **55.8%**로 뛰었습니다. MBPP의 경우, **48.2%**에서 **56.1%**로 상승했습니다.
  • 수학적 추론: GSM8K 수학 테스트에서 SAKE를 사용한 AI는 **75.1%**의 자기 일관성(self-consistency) 점수를 기록하며, 표준 모델의 **71.5%**를 앞질렀습니다.
  • "파레토 프런티어(Pareto Frontier)": 연구진은 또한 품질과 다양성 사이의 균형을 조사했습니다. 그들은 온도를 높이는 것이 AI를 더 다양하게 만들기는 하지만, 텍스트의 품질을 해친다는 것(일관성을 떨어뜨린다는 것)을 발견했습니다. 그러나 SAKE는 이 "프런티어"를 바깥쪽으로 확장했습니다. 이는 AI가 품질을 잃지 않으면서도 더 다양해질 수 있음을 의미합니다. 이는 마치 케이크를 먹으면서 동시에 그것을 소유하는 법을 찾아낸 것과 같습니다.

흥미로운 발견 중 하나는 "모드 붕괴(mode collapse)"에 관한 것이었습니다. 이것은 AI가 생성하는 몇 가지 답변의 루프에 갇히는 현상을 말합니다. 논문은 낮은 온도(AI가 보통 매우 안전하게 행동하는 구간)에서 표준 방식들이 빠르게 갇히는 모습을 보여주었습니다. 반면 SAKE는 AI가 탐색하도록 강제하여, "무작위성" 설정이 낮을 때도 성능을 크게 향상시켰습니다.

트레이드오프: 속도 대 지능

물론 세상에 공짜는 없습니다. 논문은 코치가 단어의 유사성을 확인하기 위해 추가적인 계산을 해야 하므로 SAKE가 표준 방식보다 약간 더 많은 컴퓨팅 파워를 요구한다는 점을 인정합니다. 하지만 연구팀은 이 속도 저하가 매우 미미하다는 것을 발견했습니다. AI는 여전히 가이드가 없는 버전 속도의 약 93% 속도로 텍스트를 생성했습니다. 반면, D-CFG라는 다른 방식은 훨씬 느려져 약 **67%**의 속도로 떨어졌습니다. 이는 SAKE가 속도를 크게 늦추지 않으면서도 실용적으로 사용할 수 있는 도구임을 시사합니다.

이것이 왜 중요한가

이 논문은 다양성이 단순히 무언가를 다르게 보이게 만드는 것이 아니라, "강건함(robustness)"에 관한 것이라고 결론짓습니다. 수학 문제를 풀거나 코드를 작성하는 것과 같은 복잡한 작업에서, 문제에 대해 여러 가지 다른 방식으로 생각하는 것은 정답을 찾을 확률을 높여줍니다. SAKE를 사용함으로써, 우리는 AI 모델이 혼란스럽고 터무니없는 생성기가 되지 않으면서도 이러한 다양한 경로를 탐색하도록 도울 수 있습니다.

저자들은 이 방법이 미래에 AI를 사용하는 방식, 특히 깊은 사고와 창의성을 요구하는 작업에서 게임 체인저가 될 수 있다고 제안합니다. 그들은 AI의 마음속에 있는 아이디어의 "모양"을 이해함으로써, AI가 똑똑하면서도 창의적일 수 있도록 가이드할 수 있으며, 품질과 다양성 사이의 균형을 맞추는 오래된 문제를 해결할 수 있음을 보여줍니다. 비록 이 논문이 AI의 모든 문제를 해결했다고 주장하는 것은 아니지만, 결과는 이 새로운 "엔트로피 기반 가이던스"가 텍스트 생성 AI를 더욱 신뢰할 수 있고 다재다능하게 만드는 중요한 진전임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →