← 최신 논문
💬 NLP

Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization

이 논문은 LLM 강화학습에서 정확도를 해치지 않으면서 다양한 탐색을 장려하기 위해, 정상 모드와 고엔트로피 모드로 정책을 분할하여 상호 보완적으로 학습시키는 'Policy Split'이라는 새로운 패러다임을 제안하고 다양한 작업에서 기존 기법보다 우수한 성능을 입증했습니다.

원저자: Jiashu Yao, Heyan Huang, Chuwei Luo, Daiqing Wu, Zeming Liu, Yuhang Guo, Yangyang Kang

게시일 2026-04-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiashu Yao, Heyan Huang, Chuwei Luo, Daiqing Wu, Zeming Liu, Yuhang Guo, Yangyang Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 "두 가지 모드를 가진 AI": 정책 분할 (Policy Split) 이란 무엇인가요?

이 논문은 거대 언어 모델 (LLM, 즉 AI) 을 훈련시킬 때 겪는 **"정확성 vs 창의성"**이라는 고전적인 딜레마를 해결하는 새로운 방법을 제안합니다.

기존의 방법들은 AI 에게 "더 많이 생각해보라 (탐색)"라고 강요하면, 오히려 "정답을 맞추는 능력"이 떨어지는 문제가 있었습니다. 마치 수학 시험을 보는데, "더 다양한 풀이법을 찾아봐"라고 해서 오히려 정답을 못 맞추는 상황과 비슷합니다.

이 논문은 이를 해결하기 위해 "한 명의 AI 에게 두 가지 성격 (모드) 을 심어주는" 혁신적인 아이디어를 제시합니다.


🎭 비유: "엄격한 수학 선생님"과 "자유로운 화가"

이 방법의 핵심은 **Policy Split(정책 분할)**입니다. 이를 쉽게 비유하자면 다음과 같습니다.

1. 기존 방식의 문제점 (혼란스러운 한 명)

기존에는 AI 한 명에게 "정답도 잘 맞추되, 동시에 엉뚱한 상상도 많이 해봐!"라고 명령했습니다.

  • 결과: AI 는 머리가 복잡해져서, 정답을 맞추는 능력도 떨어지고 상상력도 제대로 발휘하지 못했습니다. (정확도 하락 + 엉뚱한 답변)

2. 새로운 방식: "Policy Split" (두 명의 캐릭터)

이 논문은 하나의 AI 모델 안에 두 가지 '성격'을 동시에 키우는 것을 제안합니다.

  • 👨‍🏫 모드 A (일반 모드): "엄격한 수학 선생님"

    • 역할: 오직 정답만 맞춥니다.
    • 특징: 실수를 하지 않도록 조심스럽고, 가장 확실한 길만 갑니다.
    • 목표: 정확도 100% 유지.
  • 🎨 모드 B (고엔트로피 모드): "자유로운 화가"

    • 역할: 새로운 아이디어를 찾아냅니다.
    • 특징: 평소 쓰지 않던 엉뚱한 길, 창의적인 접근법을 시도합니다.
    • 목표: 다양한 가능성을 탐색하되, 결국 정답을 찾아내는 것.

3. 두 모드의 협력 (상호 학습)

이 두 모드는 서로 경쟁하는 게 아니라 함께 일합니다.

  • **화가 (모드 B)**가 엉뚱한 길로 가다가 새로운 정답을 발견하면, 그 정보를 **수학 선생님 (모드 A)**에게 알려줍니다.
  • **수학 선생님 (모드 A)**은 화가가 엉뚱한 길로 너무 멀리 가지 않도록 **기초 체력 (정확도)**을 유지시켜 줍니다.

이처럼 서로의 장점을 공유하면서 훈련하기 때문에, AI 는 정확하면서도 창의적인 두 가지 능력을 모두 갖게 됩니다.


🚀 어떻게 작동하나요? (간단한 원리)

  1. 명령어 (프롬프트) 로 모드 전환:

    • AI 에게 "너는 이제 고엔트로피 모드야! 평소와 다르게 엉뚱하게 생각해보자!"라고 말해주면, AI 는 '화가' 모드로 변합니다.
    • 아무 말도 안 하면 '수학 선생님' 모드로 작동합니다.
  2. 특별한 훈련 규칙:

    • 수학 선생님은 정답을 맞출 때만 칭찬받습니다.
    • 화가는 정답을 맞출 뿐만 아니라, 남들이 생각하지 못한 새로운 길을 갔을 때 더 큰 칭찬을 받습니다.
    • 하지만 화가가 너무 엉뚱해져서 말이 안 되는 소리를 하면, 선생님 모드의 데이터를 참고해서 다시 바로잡습니다.

✨ 이 방법의 놀라운 결과

실험 결과, 이 방법을 사용하면 다음과 같은 변화가 일어났습니다.

  • 정확도는 그대로, 창의성은 폭발: 수학 문제나 논리 문제에서도 정답률은 떨어지지 않으면서, 창의적인 글쓰기나 문제 해결 능력이 크게 향상되었습니다.
  • 다양한 답변: 같은 질문을 받았을 때, '수학 선생님'은 정석적인 답을, '화가'는 전혀 다른 관점의 답을 내놓을 수 있게 되었습니다.
  • Best-of-N (최고의 1 개 고르기): 여러 번 답을 만들어낸 뒤 그중에서 가장 좋은 것을 고르면, 기존 방법보다 훨씬 더 뛰어난 성능을 냈습니다.

💡 요약: 왜 이 연구가 중요한가요?

기존의 AI 는 "정확한 것"과 "창의적인 것" 사이에서 선택해야 했습니다. 하지만 Policy Split"한 번에 둘 다" 가능하게 합니다.

마치 한 명의 배우가 연극에서는 진지한 연기를, 코미디에서는 유쾌한 연기를 모두 완벽하게 해내는 것과 같습니다. 이 기술은 앞으로 AI 가 복잡한 문제를 풀 때, 단순히 정답만 찾는 것이 아니라 새로운 해결책을 발견하는 데 큰 도움을 줄 것입니다.

핵심 메시지: "정답을 찾는 AI"와 "새로운 길을 찾는 AI"를 따로 만들지 말고, 한 AI 안에 두 가지 능력을 공존시켜 서로 도와주게 하라!

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →