← 최신 논문
💬 NLP

Mitigating Exploration Bias in RL for Multi-Instruction Following

이 논문은 어려운 지시문에 활성화 기제를 부여하는 행동 부트스트래핑(behavioral bootstrapping)과 이를 우선순위에 두는 희소성 인지 보상(scarcity-aware rewards)을 결합한 2단계 프레임워크를 제안함으로써, 강화 학습 기반 다중 지시 이행에서의 쉬운 지시문에 대한 탐색 편향 문제를 해결하고 검증 가능한 벤치마크 전반에서 모델 성능을 유의미하게 향상시켰습니다.

원저자: Mian Zhang, Yueqin Yin, Kaiyu He, Peilin Wu, Xinlu Zhang, Mingyuan Zhou, Zhiyu Zoey Chen

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mian Zhang, Yueqin Yin, Kaiyu He, Peilin Wu, Xinlu Zhang, Mingyuan Zhou, Zhiyu Zoey Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 일상생활의 일부가 된 챗봇과 글쓰기 보조 도구의 엔진입니다. 이 시스템의 핵심은 사용자의 요청을 받아 유용한 응답으로 바꾸는, 즉 지시사항을 따르도록 설계된 것입니다. 수년 동안 연구자들은 이러한 모델이 이 작업을 더 잘 수행할 수 있도록 가르치기 위해 강화 학습이라는 훈련 방법을 사용해 왔습니다. 이 접근 방식에서 모델은 문제를 해결하려고 시도하고, 얼마나 잘했는지에 따라 점수를 받으며, 그 피드백을 사용하여 다음 시도를 개선합니다. 이는 마치 간식으로 동물을 훈련시키는 것과 유사하지만, 복잡한 디지털 추론에 적용된 강력한 방식입니다. 그러나 새로운 연구에 따르면, 모델이 여러 가지 서로 다른 규칙이나 제약 조건이 포함된 단일 요청에 직면했을 때 표준 훈련 방식이 모델을 실패하게 만든다고 합니다. 모델은 모든 요구 사항을 충족하는 대신, 어려운 부분은 무시하고 쉬운 부분에만 집중하여 사용자에게 부분적으로만 정답인 응답을 남기게 됩니다.

텍사스와 캘리포니아의 대학 팀들과 함께 연구를 진행한 이 연구진은 왜 이런 현상이 발생하는지, 그리고 이를 어떻게 해결할 수 있는지를 파악하고자 했습니다. 그들은 문제가 두 가지 주요 이슈에서 기인한다는 것을 발견했습니다. 첫째, 모델이 훈련을 시작할 때 복잡한 요청의 가장 어려운 부분을 해결하기에는 너무 약한 경우가 많습니다. 모델이 이러한 어려운 과제를 해결하지 못하기 때문에, 학습에 필요한 긍적인 피드백을 결코 받지 못하게 되고, 결국 단순히 시도를 멈추게 됩니다. 둘째, 훈련 중에 사용되는 점수 산정 방식은 모든 지시사항을 동일하게 취급합니다. 만약 모델이 쉬운 규칙 하나와 어려운 규칙 하나를 모두 만족시킨다면, 두 개의 쉬운 규칙을 만족시킨 경우와 동일한 총점을 받게 됩니다. 이는 모델이 더 많은 노력이 필요한 어려운 제약 조건을 위해 고군분투하기보다는, 점수를 빠르게 높이기 위해 쉬운 승리를 쫓도록 유도합니다. 그 결과, 모델은 어려운 과제들을 탐구하기보다 쉬운 길을 선택하는 편향을 갖게 됩니다.

이를 해결하기 위해 연구팀은 모델이 어려운 지시사항에 주의를 기울이도록 강제하는 두 단계 프레임워크를 제안했습니다. 첫 번째 단계는 그들이 '행동적 부트스트래핑(behavioral bootstrapping)'이라고 부르는 준비 단계입니다. 본격적인 훈련이 시작되기 전, 연구진은 모델이 현재 따르지 못하는 특정 유형의 지시사항들을 식서합니다. 그런 다음 모델이 이러한 특정 어려운 과제들을 성공하도록 유도하는 소수의 집중된 예시 세트를 생성합니다. 이 선별된 데이터로 짧은 시간 동안 훈련함으로써, 모델은 이러한 어려운 제약 조건들을 처리할 수 있는 능력을 "깨우게" 됩니다. 이는 모델에게 처음부터 모든 것을 가르치는 것이 아니라, 본 훈련이 시작되기 전에 성공할 수 있는 기회를 갖도록 작은 밀어주기를 하는 것입니다. 이 단계는 실제 훈련이 시작될 때 모델이 어려운 부분에 대해 즉시 포기하지 않도록 보장합니다.

두 번째 단계는 본 훈련 단계 동안 모델에게 보상을 주는 방식을 바꾸는 것을 포함합니다. 모든 지시사항에 동일한 가중치를 주는 대신, 연구진은 특정 지시사항이 얼마나 희귀하거나 어려운지에 주목하는 새로운 점수 산정 방식을 도입했습니다. 만약 모델이 드물게 성공하는 지시사항을 성공적으로 수행한다면 더 큰 보상을 받습니다. 반면, 이미 쉽게 숙달한 지시사항을 수행한다면 보상은 작아집니다. 이는 모델이 이전에 피했던 어려운 영역을 탐색하도록 강력한 동기를 부여합니다. 또한 연구진은 지시사항을 결합하는 데 성공했을 때 보너스를 추가했습니다. 만약 모델이 두 가지 규칙을 동시에 만족시킨다면, 특히 그 규칙들이 함께 수행하기 어려운 것이라면 추가 점수를 받습니다. 이는 모델이 가장 쉬운 것들만 골라내는 대신, 전체 제약 조건을 충족하는 해결책을 찾도록 장려합니다.

연구팀은 17억 개의 파라미터를 가진 버전과 70억 개의 파라미터를 가진 두 가지 버전의 언어 모델을 사용하여 이 아이디어들을 테스트했습니다. 그들은 각각 3개에서 5개의 지시사항이 포함된 프롬프트 데이터셋으로 이 모델들을 훈련시켰습니다. 결과는 놀라웠습니다. 새로운 두 단계 방식으로 훈련된 모델들은 표준 방식으로 훈련된 모델들보다 성능이 현저히 뛰어났습니다. 지시 이행 여부를 확인하기 위해 설계된 기본 테스트 세트에서, 가장 우수한 모델은 표준 방식에 비해 정확도가 9포인트 이상 향상되었습니다. 이 향상은 매우 상당하여, 이 새로운 방식으로 훈련된 17억 개의 작은 모델이 수십 배 더 많은 컴퓨팅 파워를 가진 훨씬 더 큰 상용 모델들과 대등한 성능을 보였습니다. 연구진은 또한 모델의 성능 균형을 측정하였으며, 새로운 방식이 쉬운 지시와 어려운 지시 사이의 격차를 성공적으로 줄였다는 것을 발견했습니다.

이 연구는 또한 훈련 중에 모델 내부에서 어떤 일이 일어나는지도 살펴보았습니다. 그들은 표준 훈련 방식이 모델로 하여금 다양한 가능성을 탐색하는 능력을 상실하게 만드는 현상, 즉 모델이 안전하고 쉬운 답변의 좁은 루프에 갇히는 '엔트로피 붕괴(entropy collapse)'를 일으킨다는 것을 관찰했습니다. 반면, 새로운 방식은 모델의 탐색 능력을 유지시켜 복잡한 해결책을 계속해서 찾을 수 있게 했습니다. 연구진은 초기 준비 단계에서 데이터가 너무 많으면 나중에 모델의 유연성을 해칠 수 있으므로, 훈련 데이터가 신중하게 균형을 이루어야 할 때 이 방식이 가장 효과적이라고 언급했습니다. 비록 이 방법이 컴퓨터 프로그램으로 확인할 수 있는 지시사항들에 대해 테스트되었지만, 연구진은 스타일이나 어조와 같이 더 개방적인 요청에 적용하려면 추가적인 작업이 필요하다는 점을 인정했습니다. 그럼에도 불구하고, 이 연구 결과는 인공지능이 다면적이고 복잡한 요청에 직면했을 때 더욱 신뢰할 수 있게 만드는 명확한 경로를 제시합니다. 쉬운 길로 향하는 편향을 해결함으로써, 이 작업은 이러한 강력한 도구들이 사용자의 의도를 온전히 따를 수 있도록 돕습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →