Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning
이 논문은 오답 궤적을 성찰 프롬프트 및 정답과 적응적으로 융합하여 시행착오 학습을 모델링함으로써 표준 거절 샘플링보다 뛰어난 성능을 보이도록 대규모 언어 모델의 수학적 추론 능력을 향상시키는 미세 조정 전략인 TrajFusion을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 학생에게 매우 어려운 수학 문제를 푸는 법을 가르치고 있다고 상상해 보세요.
과거의 방식 (기각 샘플링 - Rejection Sampling)
전통적으로 AI 모델이 수학을 학습하도록 훈련할 때, 연구자들은 "기각 샘플링"이라는 방법을 사용했습니다. 이것은 마치 학생에게 오직 완벽하고 정답인 풀이만을 보여주는 엄격한 선생님과 같습니다.
만약 선생님이 문제를 열 번 시도했는데 그중 아홉 번을 틀렸다면, 그 아홉 번의 시도는 모두 버려집니다. 선생님은 단 한 번 맞혔을 때의 결과만을 남깁니다. 학생은 오직 최종적인 완벽한 정답만을 보게 됩니다.
- 문제점: 학생은 정답이 무엇인지는 배우지만, 실수를 했을 때 어떻게 회복해야 하는지는 배우지 못합니다. 학생은 흔히 빠지는 함정이나 잘못된 길, 혹은 논리적 오류를 어떻게 수정해야 하는지를 전혀 보지 못합니다. 이는 운전자에게 완벽한 경로의 지도만 보여줄 뿐, 길을 잘못 들거나 막다른 길에 다다랐을 때 어떤 일이 벌어지는지는 전혀 보여주지 않는 것과 같습니다.
새로운 방식 (TrajFusion)
이 논문은 TrajFusion이라는 새로운 방법을 소개합니다. 틀린 시도들을 버리는 대신, 이 방법은 그 시도들을 보존하여 하나의 수업 속에 엮어 넣습니다.
이제 선생님은 학생에게 이렇게 말한다고 상 imagine 해보세요:
"자, 이 문제를 풀어보자.
- 첫 번째 시도: 이 경로로 시도해 봤는데, 여기서 실수를 했다는 걸 깨달았어. (잘못된 경로를 보여줌).
- 성찰(Reflection): '잠깐, 이게 아닌 것 같은데. 다시 해보자.' (이것이 '성찰 프롬프트'입니다).
- 두 번째 시도: 다른 경로로 시도해 봤지만, 단계를 하나 놓쳤어. (또 다른 잘못된 경로를 보여줌).
- 성찰: '음, 뭔가를 놓치고 있네. 좀 더 신중하게 생각해보자.'
- 최종 시도: 좋아, 이제 알겠다! 여기 정답이 있어."
작동 원리 ("융합" 부분)
핵심 혁신은 AI가 아무 잘못된 답이나 보여주는 것이 아니라는 점입니다. AI는 스마트한 필터를 사용합니다:
- 만약 선생님이 똑같은 실수를 연속으로 10번 한다면: 시스템은 이것이 "막다른 길"이거나 단순한 오해라는 것을 깨닫습니다. 이 경우 학생에게 보여주지 않을 수도 있는데, 왜냐하면 이것은 별로 도움이 되지 않기 때문입니다.
- 만약 선생님이 10가지의 서로 다른 종류의 실수를 한다면: 시스템은 "와, 이 문제는 정말 까다롭구나! 틀릴 수 있는 방법이 아주 다양하네!"라고 판단합니다. 그런 다음 이 다양한 오답 경로들을 하나의 학습 수업으로 융합합니다.
이것은 "시행착오(Trial-and-Error)" 시뮬레이션을 만들어냅니다. AI는 단순히 목적지에 도달하는 법뿐만 아니라, 혼란을 헤쳐 나가고 스스로를 교정하는 여정 자체를 학습하게 됩니다.
결과
연구진은 LLaMA3와 DeepSeekMath라는 두 가지 AI 모델을 사용하여 학교 수학부터 까다로운 경시대회 수준의 문제까지 다양한 수학 벤치마크에서 이 방법을 테스트했습니다.
- 어려운 문제에 더 강함: 이 새로운 방법은 가장 어려운 문제들(올림피아드 수학 등)에서 가장 효과적이었습니다. 이러한 문제들은 길을 잃기 쉬운 유형이기에, 길을 다시 찾는 법을 배우는 것이 매우 중요합니다.
- 효율적임: 더 큰 뇌(모델 크기)나 새로운 종류의 컴퓨터 칩을 필요로 하지 않았습니다. 단지 학습 중에 AI가 읽는 '내용'을 바꾼 것뿐입니다.
- 확장성: 적은 양의 데이터를 사용하든 방대한 양의 데이터를 사용하든 잘 작동했습니다. 심지어 많은 정보를 한꺼번에 기억해야 하는 매우 길고 복잡한 문제를 해결하도록 AI를 가르칠 때도 효과적이었습니다.
요약하자면
이 논문은 실수 또한 가치 있는 데이터라고 주장합니다. 틀린 시도들을 버리는 관행을 멈추고, 대신 그것들을 "시도하고, 실패하고, 성찰하고, 다시 시도하는" 구조화된 수업으로 바꿈으로써, AI는 훨씬 더 뛰어난 문제 해결사가 됩니다. AI는 어려운 기술을 배울 때 인간이 그러하듯, 자신의 오류를 인식하고 이를 스스로 수정하는 법을 배우게 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.