Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve
이 논문은 거대 언어 모델이 발전함에 따라, 표준적인 퓨샷 사고 사슬(few-shot Chain-of-Thought) 프롬프팅이 오히려 주의를 분산시키는 형식 및 스타일 제약을 도입함으로써 성능을 저해하며, 추론 작업에는 단순한 제로샷 접근 방식이 더 효과적이라고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 수수께끼를 푸는 법을 가르치고 있다고 상상해 보세요. 오랫동안 로봇에게 이를 가르치는 가장 좋은 방법은 인간이 사고의 모든 단계를 상세히 적어 놓은 수많은 예시를 보여주는 것이었습니다. 이는 마치 로봇에게 "먼저 이것을 하고, 그다음 저것을 하고, 마지막으로 여기 답이 있다"라고 적힌 상세한 레시피를 주는 것과 같은 '생각의 사슬(Chain-of-Thought)' 프롬프팅 방식이었습니다. 이 방법은 생각 없이 답만 찍으려던 예전의 더 단순한 로봇들에게는 놀라운 효과를 발휘했습니다.
하지만 이제 우리는 더 똑똑하고 진보된 로봇들을 만들었습니다. 이 새로운 모델들은 스스로 수많은 책을 읽고 수많은 퍼즐을 풀었기에, 설령 당신이 매뉴얼을 주지 않더라도 자연스럽게 단계별로 생각하기 시작합니다. 그들은 논리를 향한 내부적인 나침반을 가지고 있습니다. 과학자들이 던지는 핵심 질문은 이것입니다. 만약 로봇이 이미 생각하는 법을 알고 있다면, 여전히 우리에게 상세한 레시피를 통해 손을 잡아달라고 요청해야 할까요? 아니면 그 레시피가 오히려 로봇의 생각을 서술하는 방식에 너무 많은 규칙을 강요하여 로봇을 혼란스럽게 만드는 걸까요? 이 논문은 우리의 옛날 교육 방식이 우리의 가장 새롭고 똑똑한 학생들을 오히려 방해하고 있는 것은 아닌지 확인하기 위해 바로 이 질문을 파고듭니다.
"과잉 가이드된" 로봇: 과도한 도움이 해가 될 때
이 연구에서 연구자들은 현재 사용 가능한 가장 똑똑한 수학 해결 로봇들을 테스트하기로 했습니다. 그들은 예시를 보여주는 전통적인 방식(few-shot prompting)이 여전히 최선의 방법인지, 아니면 실제로 로봇의 성능을 떨어뜨리고 있는지를 확인하고 싶었습니다.
이렇게 생각해 보세요. 당신이 수년간 요리를 해온 숙련된 셰프라고 가정해 봅시다. 당신은 레시피 없이도 완벽한 수플레를 만드는 법을 정확히 알고 있습니다. 그런데 누군가 당신에게 "먼저 달걀을 깨뜨린다. 그다음 휘젓는다. 그다음 350도에서 굽는다"라고 적힌 포스트잇을 건네며 그것을 반드시 그대로 따르라고 강요한다고 상상해 보세요. 당신은 짜증이 날 수도 있고, 혹은 그 메모를 완벽하게 따르는 데 너무 집중한 나머지 자신의 요리 본능을 잊어버릴 수도 있습니다. 심지어 지시 사항에 정신이 팔려 요리를 망칠 수도 있습니다.
연구자들은 현대의 AI에서도 정확히 이런 일이 일어나고 있다는 것을 발견했습니다. 이들은 '추론 특화형' 모델들에게 인간이 푼 유사한 문제의 예시를 보여주는 표준적인 방식을 사용하여 수학 문제를 풀게 했을 때, 모델들의 성능이 오히려 저하되었습니다.
예를 들어, Mathstral이라는 모델을 보겠습니다. 연구자들이 아무런 예시 없이 모델 스스로 문제를 풀게 했을 때(이른바 "zero-shot" 접근법), 이 모델은 약 **83.8%**의 정답률을 기록했습니다. 하지만 표준적인 "훈련 매뉴얼"인 인간이 작성한 예시들을 제공했을 때, 점수는 약 **74.2%**로 떨어졌습니다. 이는 엄청난 차이입니다! 마치 로봇이 인간의 예시 스타일과 형식을 모방하는 데 너무 급급한 나머지, 실제로 수학 문제를 푸는 것을 잊어버린 것과 같습니다.
이 논문은 이러한 현상이 발생하는 이유가 표준적인 예시들이 모델로 하여して 자신의 스타일을 인간의 예시에 맞추도록 강요하기 때문이라고 제안합니다. 모델은 형식, 특정 문장 구조를 따르는 것, 그리고 자신을 위해 만들어지지 않은 틀에 자신을 끼워 맞추는 것에 신경 써야 합니다. 이것은 "가이드-주의 분산(guidance-distraction)" 트레이드오프를 만들어냅니다. 가이드(예시)는 도움을 주기 위한 것이지만, 이 초지능형 모델들에게는 문제 해결이라는 핵심 과제로부터 주의를 돌리게 만드는 방해 요소가 됩니다.
"단계별로 생각하기" 기법: 여전히 유용하지만, 마법은 덜하다
연구자들은 또한 "Let's think step by step(단계별로 생각해 보자)"이라는 문구를 질문에 추가하는 더 단순한 기술인 "Zero-Shot CoT"를 테스트했습니다.
Llama 모델과 같은 예전의 범용 로봇들에게 이 기술은 여ยัง 매우 유용했습니다. 이 문구는 모델의 추론 능력을 깨우는 부드러운 자극제 역할을 하며 점수를 크게 높여주었습니다. 그러나 추론에 특화된 초지능형 모델들에게 이 기술은 아주 미미한 상승만을 가져왔습니다. Mathstral의 경우, 점수가 **83.8%**에서 **86.1%**로 아주 조금 올랐을 뿐입니다.
저자들은 이 모델들이 이미 단계별로 생각하는 능력이 매우 뛰어나기 때문에 예전만큼 이 자극이 필요하지 않기 때문이라고 주장합니다. 그들은 이를 컴퓨터 공학의 초기 시절, 엔지니어들이 프로그램의 모든 기능을 수동으로 설계해야 했던 때에 비유합니다. 결국 컴퓨터는 스스로 그 기능들을 학습할 수 있을 만큼 똑똑해졌고, 수동 설계는 불필ことが 필요 없게 되었습니다. 논문은 "단계별로 생각해보자"라는 문구가 과거의 수동 기능처럼 변해가고 있다고 제안합니다. 한때는 필수적이었지만, 이제는 큰 변화를 주지 못하는 작은 부가 요소가 된 것입니다.
왜 옛날 방식이 실패하는가
가장 놀라운 발견 중 하나는, 연구자들이 모델이 직접 생성한 예시를 사용하여 스타일을 일치시키려고(즉, 모델의 스타일과 맞추려고) 노력했음에도 불구하고, 가장 똑똑한 모델들에게는 여전히 "예시 없는" 방식보다 성적이 좋지 않았다는 점입니다.
결국 문제는 예시가 인간으로부터 왔느냐가 아니라, 예시의 구조에 있다는 것이 밝혀졌습니다. 모델에게 특정 패턴을 따르도록 강요함으로써, 문제를 해결하는 데 가장 적합한 방식으로 문제를 풀 수 있는 모델의 타고난 능력을 제한하게 되는 것입니다. 논문은 더 많은 예시를 보여주거나 더 "좋은" 예시를 선택한다고 해서 추론 특화형 모델들의 이 문제를 해결할 수 없다는 점을 명시적으로 배제했습니다. 사실, 그들은 가장 발전된 모델일수록 예시를 통해 더 많이 가이드하려고 할수록, 오히려 그들을 제약하게 될 수도 있다는 것을 발견했습니다.
결론: 로봇의 본능을 믿으라
그렇다면 이것이 AI 테스트의 미래에 무엇을 의미할까요? 저자들은 우리가 이러한 모델들을 측정하는 방식을 바꿔야 한다고 제고합니다. 오랫동안 표준적인 테스트는 모델에게 몇 가지 예시를 보여주고 그것을 얼마나 잘 복제하는지 보는 것이었습니다. 하지만 이 논문은 최신형의 가장 똑똑한 모델들에게 그 테스트는 불공평하다고 말합니다. 그것은 경주용 자동차 드라이버에게 학교 구역에서 제한 속도를 지키며 운전하라고 테스트하는 것과 같습니다. 그 드라이버의 진짜 속도를 보여주지 못하기 때문입니다.
대신, 연구자들은 예시나 특별한 지시 없이 질문을 직접 던지고, 모델이 스스로 무엇을 내놓는지 확인해야 한다고 주장합니다. 이 "zero-shot" 방식이 모델이 실제로 무엇을 할 수 있는지에 대한 더 진실한 그림을 제공합니다.
이 논문이 'Chain-of-Thought' 프롬프팅이 영원히 사라질 것이라고 주장하는 것은 아닙니다. 더 단순한 모델이나 모델에게 약간의 도움이 필요한 특정 작업에는 여전히 유용할 수 있습니다. 하지만 강력한 성능을 가진 모델들, 즉 추론을 위해 특별히 설계된 모델들에게는 옛날 방식의 가르침이 오히려 방해가 되고 있습니다. 모델이 똑똑해질수록, 그들은 더 적은 가이드와 더 많은 자유로운 사고를 필요로 합니다. 그들이 얼마나 똑똑한지 알아보는 가장 좋은 방법은, 어쩌면 손을 잡아주는 것을 멈추고 그들이 자신만의 방식으로 문제를 풀도록 내버려 두는 것일지도 모릅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.