Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B
이 논문은 다양한 오픈 소스 모델(1.5B에서 7B 파라미터)과 수학 벤치마크 전반에 걸쳐, 동일한 토큰 비용으로 평가했을 때 반복적 샘플링이 복잡한 자기 개선 및 성찰 방법보다 일관되게 더 우수한 성능을 보이거나 대등한 성능을 보인다는 점을 입증하며, 후자의 겉보기 이득은 우수한 추론 전략보다는 증가된 생성량에서 기인하는 경우가 많음을 밝히고 있습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
위대한 AI 브레인 부스트 실험
당신에게 매우 똑똑하지만 약간 산만한 학생이 있다고 상상해 보세요. 당신은 그에게 어려운 수학 문제를 주고, 학생은 그것을 풀려고 노력합니다. 때로는 맞히기도 하고, 때로는 틀리기도 합니다. 인공지능의 세계에서 연구자들은 이 "학생들"(대규모 언어 모델이라고 불림)을 처음부터 다시 만들지 않고도 더 잘 생각하게 만드는 방법을 찾아내기 위해 노력해 왔습니다. 대중적인 아이디어는 AI에게 "더 열심히 생각하라"고 말하는 것이었습니다. 이는 AI에게 단계를 계획하고, 스스로와 논쟁하며, 자신의 실수를 비판하거나, 답을 제출하기 전에 답변을 다시 쓰라고 요청하는 것을 의미합니다. 이것은 마치 학생에게 "그냥 답만 적지 말고, 왜 그 답이 맞다고 생각하는지에 대한 전체 에세이를 쓰고, 검토하고, 어쩌면 다시 시도해 보렴"이라고 말하는 것과 같습니다.
여기서 핵심적인 질문은, 그 모든 추가적인 생각이 실제로 도움이 되는가, 아니면 그저 시간을 낭비하는 것인가 하는 점입니다. 핵심 개념은 **토큰(tokens)**입니다. 토큰을 AI가 사용하는 "단어" 또는 "노력의 단위"라고 생각하세요. AI가 단어를 쓸 때마다 토큰이 소모됩니다. 만약 어떤 방식이 100단어로 해결될 수 있는 문제를 해결하기 위해 1,000단어를 쓰게 만든다면, 그것은 10배의 노력을 들인 것입니다. 과학적 논쟁은 그 추가적인 노력이 전략(예: 자기 비판)에서 오는 것인지, 아니면 단순히 AI가 더 많은 단어를 쓰게 되었다는 사실에서 오는 것인지에 관한 것입니다. 만약 학생에게 열 배의 종이를 준다면, 그 학생은 갑자기 똑똑해져서가 아니라 단지 더 많은 시도 공간을 가졌기 때문에 더 좋은 성적을 받을 수도 있습니다. 이 논문은 정확히 이 점을 테스트하기 위해 설정되었습니다: 당신이 서로 다른 전략들에게 정확히 같은 양의 종이(토큰)를 주었을 때, 어떤 것이 실제로 승리하는가?
논문: 더 많이 샘플링하라, 덜 반성하라
"Sample More, Reflect Less(더 많이 샘플링하라, 덜 반성하라)"라는 제목의 이 논문은 AI가 더 똑똑해지기 위해 자신의 작업을 "반성"해야 하는지에 대한 논쟁을 종결짓기 위해 설계된 거대한 실험입니다. 연구진은 AI가 자신을 비판하거나, 자신의 복사본들과 논쟁하거나, 목록에서 최선의 답을 고르도록 하는 등 AI를 "더 열심히 생각하게" 만드는 일곱 가지의 서로 다른 인기 있는 방법들을 가져와, 매우 단순하고 지루한 베이스라인인 **반복 샘플링(repeated sampling)**과 맞붙였습니다.
이 베이스라인은 동전을 열 번 던지고 가장 많이 나온 면을 선택하는 것과 같습니다. AI 용어로 말하면, 동일한 질문을 열 번 던지고 가장 흔한 답을 취하는 것을 의미합니다. 연구진은 모든 방법이 정확히 동일한 수의 토큰(생성된 단어)을 사용하도록 하여 경기장이 완벽하게 평평하도록 만들었습니다. 그들은 이 실험을 세 가지 크기의 AI 모델(1.5B, 3B, 7B 파라미터)과 두 가지 수학 벤치마크(GSM8K 및 MATH-500, 각 150개 질문)를 대상으로 수행했습니다.
주요 발견:
결과는 놀라웠습니다. 거의 모든 경우에서, AI가 "반성"하거나 "비판"하거나 "논쟁"하게 만드는 화려한 방법들이, 질문을 여러 번 던지고 투표를 세는 단순한 방법에게 패배했습니다.
연구진이 화려한 방법들이 왜 패배했는지 자세히 살펴본 결과, 명확한 패턴을 발견했습니다. AI에게 자신의 작업을 판단하도록 요청하는 방법들(답변을 다시 쓰거나 목록에서 "최선"의 것을 고르는 등)은 일관되게 베이스라인보다 낮은 성능을 보였습니다. 예를 들어, 1.5B 파라미터 모델의 경우, "Best-of-N"(8개의 답변 중 최선을 고르는 방식)이라는 방법은 동일한 8번의 시도 중 가장 흔한 답을 세는 방식보다 약 8~11 퍼센트 포인트 더 낮은 점수를 기록했습니다. 7B 파라미터의 더 큰 모델에서도 그 격차는 사라졌습니다: 즉, 차이가 통계적으로 0과 구별할 수 없는 수준이 되었으며, 이는 "판단자"가 더 이상 "투표수"보다 명확하게 나쁘지 않음을 의미하며, 그 페널티가 0과 구별할 수 없는 수준이 되었음을 뜻합니다.
이 논문은 "더 열심히 생각하기"를 통한 자기 반성이 마법의 비결이라는 생각을 명시적으로 부정합니다. 대신, 이 논문은 자신의 작업에 대해 반성하는 데 토큰을 쓰는 것보다, 다른 시도를 하는 데 토큰을 쓰는 것이 더 나은 투자임을 시사합니다. 만약 당신이 하나의 긴 비판적 에세스를 쓸 만큼의 토큰이 있다면, 그 토큰을 사용하여 두 개 또는 세 개의 새로운 독립적인 답변을 작성하고 그중 가장 인기 있는 것을 고르는 데 쓰는 것이 더 낫습니다.
"유령" 방법과 "크기가 중요하다"는 교훈
실험의 가장 유쾌하면서도 드러내는 바가 많은 부분 중 하나는 **Reflexion(리플렉션)**이라 불리는 방법이었습니다. 이 방법은 다음과 같이 작동하도록 설계되었습니다: AI가 문제를 풀려고 시도한 다음, 자신에게 "내가 이것을 맞혔나?"라고 묻습니다. 만약 "아니오"라고 답하면, 다시 시도합니다. 만약 "예"라고 답하면, 멈춥니다.
연구진은 가장 작은 모델(1.5B)에서 재미있는 결함을 발견했습니다. 이 아주 작은 모델에서 AI는 결코 "아니오"라고 말하지 않았습니다. AI는 심지어 틀렸을 때조차 자신의 첫 번째 답변들을 모두 "정답"이라고 판단했습니다. 따라서 Reflexion 메커니즘은 재시도를 트리거하지 못했습니다. 이는 기능이 작동하지 않고 단일한 저렴한 시도로 조용히 붕괴되었음을 의미합니다. 이 방식은 매우 저렴했기 때문에(추가 토큰을 쓰지 않았기 때문에), 화려한 방법들에 비해 잘하고 있는 것처럼 보였습니다. 하지만 연구진이 AI에게 상관없이 세 번의 재시도를 강제했을 때 성능이 크게 떨어졌으며, 이는 "반성" 메커민즘 자체가 실제로 점수를 깎아먹고 있었다는 것을 증명했습니다.
모델이 커짐에 따라(1.5B에서 7B로), "투표 세기"와 "AI가 판단하게 하기" 사이의 격차는 줄어들기 시작했습니다. 7B 파라미터에 도달했을 때, AI는 판단을 내릴 만큼 충분히 똑똑해져서 "해로운 상태"가 아니게 되었습니다. 즉, 차이가 0과 구별할 수 없게 된 것입니다. 그러나 이 논문은 AI가 판단하는 데 있어 "투표 세기"보다 더 뛰어난 것은 아니며, 단지 "더 나쁘지 않게" 되었을 뿐이라고 언급합니다. 연구진은 AI가 "투표 세기" 방식을 능가하려면, 단순히 즉석에서 판단하도록 요청받는 것이 아니라 판단하는 법을 특별히 훈련받아야 할 수도 있다고 제안합니다.
이것이 미래에 의미하는 바
이 논문은 이러한 AI 시스템을 구축하는 모든 이들에게 강력한 메시지를 남기며 결론을 맺습니다: 너무 복잡하게 만들지 마세요. 만약 당신에게 토큰(단어) 예산이 있다면, 정답을 얻는 가장 효율적인 방법은 종종 여러 번의 시도를 생성하고 다수결을 따르는 것이지, AI에게 자신의 작업을 비판하고 다시 쓰라고 요청하는 것이 아닙니다.
저자들은 또한 어떤 방법들이 서류상으로는 좋아 보일 수 있지만 실제로는 실패할 수 있는데, 그 이유는 그들이 자신의 "진정한 비용"을 "숨기기" 때문이라고 경고합니다. 만약 어떤 방법이 스스로 언제 멈출지를 결정한다면(Reflexion처럼), 그 방법은 즉시 멈춰서 돈을 아낄 수 있고, 이로 인해 효율적으로 보일 수 있지만, 실제로는 설계된 대로의 작업을 수행하고 있는 것이 아닙니다.
궁극적으로, 이 연구는 명확한 정답이 있는 수학 문제의 경우, 자기 반성의 "마법"은 신화라는 점을 시사합니다. 적어도 테스트된 모델들에 대해서는 그렇습니다. 가장 강력한 도구는 더 똑똑한 전략이 아니라, 단순히 더 많이 시도하는 것입니다. 연구진의 표현을 빌리자면, 답변을 재고하는 데 토큰을 쓰는 것은 다른 시도를 하는 데 동일한 토큰을 쓰는 것보다 못한 일입니다. AI에게 더 열심히 생각하라고 말할 필요는 없습니다. 그저 더 많은 기회를 주면 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.