← 최신 논문
💻 computer science

Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

이 논문은 진화 전략(ES)이 더 넓은 솔루션 커버리지와 더 높은 pass@k 점수를 유지함으로써 발견 영역(discovery domains)을 위한 대규모 언어 모델의 사후 학습에서 강화 학습(RL)보다 우수한 성능을 보인다는 것을 입증하며, 이를 통해 다양한 후보 솔루션을 생성하는 데 있어 RL의 효과를 제한하는 출력 분포 붕괴를 방지한다.

원저자: Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

게시일 2026-08-14
📖 5 분 읽기🧠 심층 분석

원저자: Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

안개가 자욱한 거대한 섬에서 숨겨진 보물을 찾으려 한다고 상상해 보세요. 인공지능의 세계에서 거대 언어 모델(LLM)은 지도를 읽고 보물이 어디에 있을지 추측할 수 있는 매우 똑똑한 탐험가와 같습니다. 오랫동안 이 탐험가들을 훈련시키는 가장 좋은 방법은 문제를 보여주고, 답을 추측하게 한 뒤, 단 하나의 최선의 추측이 완벽할 때만 보상을 주는 것이었습니다. '강화 학습(Reinforcement Learning, RL)'이라고 알려진 이 방식은 틀린 답에는 "틀렸어!"라고 소리치고, 정답일 때만 "완벽해!"라고 외치는 엄격한 코치와 같습니다. 문제는 이 코치가 단 하나의 완벽한 답을 찾는 데 너무 집착한 나머지, 탐험가가 다른 곳을 둘러보는 것을 멈추게 만든다는 점입니다. 탐험가는 다른 보물이 숨겨져 있을지도 모르는 섬의 안개 낀 가장자리로 눈을 돌리는 대신, 자신이 옳다고 생각하는 단 한 지점에만 집중하게 됩니다.

하지만 보물이 단 하나뿐이 아니라면 어떨까요? 수학 문제를 풀거나 새로운 과학적 사실을 발견하는 데 여러 가지 다양한 방법이 존재한다면 어떨까요? 이러한 '발견(discovery)' 영역에서는 단 하나의 완벽한 추측만 있어서는 부족하며, 어떤 정답이라도 잡아낼 수 있는 넓은 그물을 던져야 합니다. 여기서 '테스트 시간 스케일링(test-time scaling)'이라는 새로운 개념이 등장합니다. 단순히 모델에게 하나의 답을 요구하는 대신, 우리는 수십 개 또는 수백 개의 서로 다른 시도를 생성하게 하고 그중 하나라도 맞는지 확인합니다. 여러분이 읽게 될 이 논문은 우리의 엄격한 코치(RL)와 다른 종류의 훈련 방법 중 무엇이 더 넓은 그물을 던지는 데 도움이 되는지를 조사합니다. 연구진은 엄격한 코치가 탐험가를 특정 지점에 매우 확신을 갖게 만들지만, 다른 방식인 '진화 전략(Evolution Strategies, ES)'은 탐험가를 계속 호기심을 갖고 방랑하게 하여, 만약 안개 속에 해결책이 존재한다면 이를 찾아낼 확률을 훨씬 높여준다는 것을 발견했습니다.


논문: 최선의 추측을 넘어서

이 논문은 AI를 훈련시키는 까다로운 문제, 즉 어떻게 하면 AI 모델이 단 하나의 정답을 맞히는 데만 능숙해지는 것이 아니라, 어떤 정답이든 찾아낼 수 있도록 선택지를 열어두게 할 것인가를 다룹니다. 저자들인 Cognizant AI Lab과 텍사스 대학교 오스틴 캠퍼스의 연구진은 두 가지 훈련 방법을 비교했습니다. 표준적인 **강화 학습(RL)**과 **진화 전략(ES)**이라는 새로운 접근 방식입니다.

강强化 학습은 마치 학생이 정답지를 통째로 외워서 시험 공부를 하는 것과 같습니다. 질문에 맞으면 보상을 받고, 틀리면 아무것도 얻지 못합니다. 시간이 흐르면 학생은 그 특정 질문에는 달인이 되겠지만, 근저에 깔린 개념을 이해하는 것은 멈추게 됩니다. AI의 세계에서 이는 '분포 붕괴(distribution collapse)'라고 불리는 현상을 일으킵니다. 모델은 자신의 '최선의 추측'에 너무 집중한 나머지 다양한 답변을 생성하는 것을 멈추게 됩니다. 이는 마치 음악가가 박수를 받을 수 있는 단 하나의 음표만을 연주하다가, 결국 노래 전체를 연주하는 법을 잊어버리는 것과 같습니다.

반면, **진화 전략(ES)**은 자연 생태계와 더 비슷하게 작동합니다. 단 하나의 모델을 훈련시키는 대신, ES는 약간씩 다른 버전의 모델들로 구성된 하나의 '집단(population)'을 만듭니다. 그리고 자연의 유전자 변이처럼 이들의 '두뇌(가중치)'를 무작위로 미세하게 조정하며, 어떤 버전이 가장 성과가 좋은지 살펴봅니다. 결정적으로, ES는 단 한 명의 승자만을 뽑아 나머지를 버리는 것이 아니라, 집단 전체로부터 배웁니다. 이는 AI의 '두뇌'를 유연하고 다양하게 유지하여, 해결책을 향한 다양한 경로를 탐색할 수 있게 해줍니다.

연구진은 다양한 크기의 모델(15억 개에서 320억 개의 파라미터)을 사용하여 산술부터 올림피아드 수준의 복잡한 도전 과제에 이르는 수학 문제들로 이 방법들을 테스트했습니다. 성공 여부는 pass@k라는 지표로 측정했습니다. AI에게 문제에 대한 서로 다른 답변 100개를 생성하도록 요청한다고 상상해 보세요. pass@1은 "첫 번째 답변이 맞는가?"를 묻는 것이고, pass@k는 "100개의 답변 중 적어도 하나가 맞는가?"를 묻는 것입니다.

연구 결과는 다음과 같습니다.

1. "최선의 추측"의 함정
연구진이 pass@1(단 하나의 최선의 추측)을 살펴보았을 때, RL로 훈련된 모델들은 종종 매우 뛰어났습니다. 그들은 예리하고 확신에 차 있었습니다. 하지만 연구진이 추측 횟수(k)를 2, 8, 16, 심지어 128로 늘리자, RL 모델들은 벽에 부딪혔습니다. RL 모델의 성능은 더 이상 향상되지 않았습니다. 실제로 일부 어려운 문제의 경우, 많은 기회를 주었음에도 불구하고 RL 모델은 훈련되지 않은 원래의 모델보다 오히려 성능이 떨어졌습니다. RL 모델은 사고가 너무 좁아져서, 자신의 '가장 좋아하는' 답과는 조금 다른 정답들을 찾는 것을 멈춰버린 것입니다.

2. 다양성의 힘
대조적으로, ES로 훈련된 모델은 다른 패턴을 보였습니다. ES 모델들 역시 첫 번째 추측을 맞히는 데 뛰어났지만, 그들의 진짜 초능력은 추측 횟수가 늘어날 때 나타났습니다. 연구진이 더 많은 샘플(최대 128개)을 요구할수록, ES 모델들은 계속해서 새로운 정답들을 찾아냈습니다. 논문은 ES가 테스트한 모든 모델 크기와 수학 벤치마크에서 RL보다 일관되게 더 높은 pass@k 점수를 달랐음을 보여줍니다.

3. 왜 이런 일이 발생하는가?
저자들은 이런 현상이 일어나는지 깊이 파고들었습니다. 그들은 RL 훈련이 AI의 지식을 '가지치기(pruning)'하는 경 Tendency가 있다는 것을 발견했습니다. 즉, 정답이지만 덜 흔한 답변으로 이어지는 경로들을 삭제하여, AI가 100번을 시도하더라도 특정 문제를 푸는 것을 불가능하게 만든다는 것입니다. 그러나 ES 방식은 AI 지식의 '넓이'를 보존합니다. ES는 단순히 정답을 배우는 것이 아니라, 많은 문을 열어두는 법을 배웁니다. 연구진이 AI의 '엔트로피(답변의 다양성을 측정하는 척도)'를 조사했을 때, RL 모델이 실패할 때는 확신에 찬 채 틀리고 있었지만(낮은 다양성), ES 모델이 실패할 때는 여전히 다양하고 불확실한 상태를 유지하고 있었습니다. 이는 ES가 여전히 탐색 중임을 의미하며, 더 많은 시간이나 계산 자원이 주어진다면 정답을 찾아낼 가능성이 더 높다는 것을 뜻합니다.

4. 현실 세계에 미치는 영향
이 논문은 우리가 새로운 것을 발견해야 하는 문제들—예를 들어 어려운 수학 증명을 풀거나, 코드를 작성하거나, 새로운 과학적 사실을 찾아내는 일—에서, 단 하나의 특정 추측에 매우 능숙한 모델보다는 다양한 정답을 생성할 수 있는 모델을 갖는 것이 더 가치 있다고 제안합니다. ES를 사용함으로써, 우리는 '지역적 함정(local trap)'에 빠질 가능성을 줄이고 전역적 해결책(global solution)을 찾을 가능성을 높임으로써, 이러한 발견 영역에서 더 나은 결과를 얻을 수 있습니다.

요약하자면, 이 논문은 만약 당신이 AI를 미지의 세계를 탐험하는 위대한 탐험가로 만들고 싶다면, 단순히 그날의 최고의 추측가가 되도록 훈련시켜서는 안 된다고 주장합니다. 대신, 선택지를 열어두고, 조금 더 방랑하며, 보물이 어디에 숨어 있든 찾아낼 준비가 되어 있도록 훈련시켜야 한다고 말합니다. 진화 전략(ES)은 그러한 종류의 모험을 위한 더 나은 코치임이 드러났습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →