← 최신 논문
🤖 machine learning

Representation-Based Exploration for Language Models: From Test-Time to Post-Training

본 논문은 사전 학습된 은닉 상태(hidden states)에서 유도된 단순한 표현 기반 다양성 보너스를 추론 시 샘플링과 사후 강화 학습 모두에 통합하는 것이, 기존의 행동을 단순히 정교화하기보다 새로운 행동의 발견을 촉진함으로써 언어 모델의 성능과 샘플 효율성을 유의미하게 향상시킨다는 것을 입증한다.

원저자: Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

게시일 2026-07-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 지시를 따르는 것을 넘어, 스스로 생각하고 문제를 풀며, 시도하고 실패하고 다시 시도하는 과정을 통해 코드를 작성하는 법을 배우는 세상을 상상해 보십시오. 이것이 바로 인공지능의 한 분야인 **강화 학습(Reinforcement Learning, RL)**의 영역입니다. 강화 학습은 에이전트가 보상을 극대화하기 위해 환경과 상호작용하며 배우는 과정입니다. 이것은 마치 강아지를 훈련시키는 것과 같습니다. 강아지가 앉으면 간식을 주고, 점프하면 아무것도 주지 않는 식입니다. 시간이 흐르면서 강아지는 가장 많은 간식을 얻기 위한 최선의 행동을 배우게 됩니다.

오늘날 우리가 사용하는 초지능형 AI 챗봇과 같은 거대 언어 모델의 세계에서, 이 과정은 "사후 학습(post-training)"이라고 불립니다. 과학자들은 모델에게 수학 문제나 코딩 과제를 입력하고, 모델이 답을 생성하게 한 뒤, 그것이 정답인지 확인합니다. 만약 정답이라면 모델은 "보상"을 받으며 다음에 그 특정 작업을 더 잘 수행하는 법을 배웁니다. 하지만 여기에는 함정이 있습니다. 현재의 방식들은 종종 교과서의 답을 단순히 암기하는 학생처럼 행동합니다. 그들은 이미 알고 있는 특정 기술들을 아주 능숙하게 구사하게 되지만, 새로운 해결 방법을 발견하는 일은 거의 하지 못합니다. 그들은 단지 자신이 이미 하고 있는 일을 더 날카롭게 다듬을 뿐입니다. 과학자들이 던지는 큰 질문은 이것입니다. "우리는 이 AI 모델들을 단순한 암기자가 아니라 호기심 많은 탐험가로 가르칠 수 있을까? 모델이 기존 훈련에서 보여주지 않았던 기발하고, 새롭고, 다양한 접근 방식을 시도하도록 독려할 수 있을까?"

"표현 기반 언어 모델 탐색(Representation-Based Exploration for Language Models)"이라는 제목의 이 논문은 바로 이 질문을 깊이 파고듭니다. 연구진인 Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash는 AI 모델이 탐색을 수행하게 만드는 영리한 새로운 방법을 제안합니다. 모델이 무작위로 추측하거나 단순히 아는 것을 반복하게 하는 대신, 그들에게 "다양성 보너스(diversity bonus)"를 부여하는 것입니다. 당신이 거대한 숲속에서 숨겨진 보물을 찾고 있다고 상상해 보십시오. 무작위로 걷는 사람은 그저 헤맬 뿐이겠지만, 똑똑한 보행자는 단서를 놓치지 않기 위해 모든 서로 다른 종류의 나무를 방문하려고 노력할 것입니다. 이 논문은 AI의 내부적인 "생각"(숨겨진 상태, hidden states)을 사용하여, 새로운 아이디어가 이미 시도했던 아이디어들과 얼마나 다른지를 측정할 것을 제안합니다. 만약 어떤 아이디어가 이전의 시도들과 비교했을 때 "신선"하거나 "새롭다"고 느껴진다면, 모델은 보너스 보상을 받게 되며, 이를 통해 새로운 경로를 계속 탐색하도록 독려됩니다.

연구팀은 이 아이디어를 두 가지 주요 방식으로 테스트했습니다. 첫째, "추론 시점(inference-time)" 탐색을 살펴보았습니다. 이는 일회성 테스트와 같습니다. 그들은 단 하나의 수학 문제에 대해 수천 개의 답을 생성하고, "다양성 보너스"를 사용하여 가장 흥당한 답들을 골라냈습니다. 그들은 이 방법이 매우 효율적이라는 것을 발견했습니다. 예를 들어, Qwen-2.5-14b-Instruct라는 모델을 사용하여 어려운 수학 데이터셋인 MATH를 대상으로 했을 때, 이들의 방법은 무작위로 답을 고르는 것보다 정답을 찾는 효율성을 50% 이상 향ate 개선했습니다. 실제로 어떤 작업에서는 이 탐색 전략을 사용할 때 정답을 찾기 위해 필요한 시도 횟수가 3배에서 13배까지 줄어들었습니다.

둘째, 이 탐색 전략을 실제 학습 과정(사후 학습)에 통합했습니다. 그들은 이 과정이 모델이 기존의 기술을 단순히 날카롭게 만드는 것을 넘어, 새로운 행동을 배우는 데 도움이 될 수 있는지 확인하고자 했습니다. 결과는 유망했습니다. 모델을 이 탐색 보너스와 함께 훈련했을 때, 모델은 단순히 기존의 기술을 더 잘하게 된 것이 아니라 훨씬 더 새롭고 창의적인 답변을 생성하기 시작했습니다. 어려운 수학 경시 대회 데이터셋인 AIME 2024에서, 이들의 탐색 강화 모델은 4배나 더 많은 샘플을 사용한 표준 학습 방법만큼의 성능을 보여주었습니다. 이는 의도적으로 다양성을 독려함으로써, 방대한 양의 추가 데이터나 컴퓨팅 파워 없이도 AI 모델이 새로운 능력을 발견하도록 도울 수 있음을 시사합니다.

하지만 저자들은 이것이 모든 것을 해결하는 마법의 탄환은 아니라는 점을 주의 깊게 언급했습니다. 그들은 이 방법이 더 강력하고 유능한 모델에서 가장 잘 작동한다는 것을 발견했습니다. 약한 모델들은 혜택을 받지 못하거나 오히려 성능이 저하되기도 했습니다. 또한, 이 접근 방식이 모델을 "더 똑똑하게" 만드는 것은 아니며, 그보다는 가능한 답의 광활한 공간을 항해하여 정답을 찾아내는 능력을 개선하는 것이라는 점도 보여주었습니다. 이 논문은 이러한 "의도적인 탐색"이 언어 모델이 단순히 기존의 기술을 연마하는 수준을 넘어 진정으로 새로운 행동을 발견하는 방향으로 나아가기 위한 실질적인 경로를 제공한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →