From Noise to Diversity: Random Embedding Injection in LLM Reasoning
본 논문은 학습이 불필요한 무작위 임베딩 벡터를 대규모 언어 모델 입력에 주입함으로써 초기 단계 토큰 다양성을 높이고 Pass@N 을 확장하여 학습된 소프트 프롬프트 없이도 추론 정확도와 학습 결과 모두를 개선하는 메커니즘을 통해 추론 성능을 효과적으로 향상시킨다는 것을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 수학 문제를 푸는 데는 뛰어나지만 매우 경직된 천재 사서 (대형 언어 모델) 가 있다고 가정해 봅시다. 이 사서는 항상 같은 경로를 따라 답을 찾지만, 그 길이 막다른 길로 이어지면 포기해 버립니다.
오랜 기간 동안 연구자들은 이 문제를 해결하기 위해 사서를 더 나은 해답으로 이끌 특별한 맞춤형 메모 (소프트 프롬프트) 로 "훈련"시키려 했습니다. 그들은 그 메모의 내용에 마법이 있다고 가정했습니다.
하지만 이 논문은 다른 질문을 던집니다: 만약 그 마법이 메모 자체에 있는 것이 아니라, 사서가 작업을 시작하기 전에 새로운 무작위 종이를 건네주는 단순한 행위에 있다면 어떨까요?
여기서 일상적인 비유를 통해 그들이 발견한 **무작위 소프트 프롬프트 (RSP)**의 내용을 정리해 보겠습니다.
1. "무작위 노이즈" 실험
연구자들은 특별한 메모를 훈련하는 대신, 완전히 무작위이고 의미 없는 낙서 (무작위 숫자) 한 줌을 집어 수학 문제의 앞이나 뒤에 붙였습니다.
- 놀라운 사실: 이 낙서들에는 유용한 정보가 전혀 없었지만, 사서는 갑자기 문제를 더 잘 풀기 시작했습니다. 어떤 경우에는 신중하게 훈련된 완벽한 메모를 받은 것과 똑같은 성과를 내기도 했습니다.
- 교훈: 개선은 새로운 것을 학습해서 나온 것이 아니라, 무언가를 혼합물에 주입하는 행위에서 비롯된 것입니다.
2. 작동 원리: "분기하는 길" 비유
사서의 사고 과정을 여러 문이 있는 복도를 걷는 것으로 생각해 보세요.
- 무작위 종이 없이: 사서는 메인 복도를 곧장 걸어가고, 처음 보는 문을 열어 그 경로를 따라 계속 갑니다. 그 길이 막다른 길이라면 실패합니다.
- 무작위 종이와 함께: 무작위 낙서들은 복도 시작 부분에서 갑자기 불어오는 혼란스러운 바람과 같은 역할을 합니다.
- 초기 단계 (분기): 이 "바람" 때문에 사서는 평소와 다른 문을 보고 멈칫합니다. 그들은 이전에 고려한 적이 없는 문을 열 수도 있습니다. 이렇게 사고에 "분기"가 생겨 해답에 이르는 완전히 다른 경로가 만들어집니다.
- 후기 단계 (안정화): 사서가 이 새로운 길을 더 나아가면, 복도가 길어지고 시작에 대한 기억이 희미해지면서 "바람" (무작위 종이) 은 사라집니다. 그들은 이제 이 새로운 길에서 자신감 있는 걸음걸이를 유지하게 됩니다.
3. "주사위 굴리기" 효과 (Pass@N)
논문은 사서에게 같은 문제를 10 번 시도하게 하되, 매번 서로 다른 무작위 낙서를 주면 10 개의 서로 다른 경로가 나온다는 것을 발견했습니다.
- 결과: 그중 9 개의 경로가 틀리더라도, 사서에게 10 개의 서로 다른 시작점을 강제로 시도하게 했다는 사실은 그중 하나라도 올바른 경로를 찾을 확률을 훨씬 높여줍니다.
- 주의점: 10 번의 시도 모두에 같은 무작위 낙서를 사용하면, 모두 같은 잘못된 경로를 가게 됩니다. 마법은 "바람"이 매번 변할 때만 작동합니다.
4. 왜 이것이 중요한가
- 무료입니다: 모델을 훈련시키거나 새로운 사실을 가르치는 데 몇 주를 보낼 필요가 없습니다. 무작위 노이즈만 추가하면 됩니다.
- 구조적입니다: 이 논문은 이러한 고급 AI 기법의 "마법"이 토큰의 구체적인 내용에 있는 것이 아니라, 추가 토큰을 더하는 구조에서 비롯된다는 것을 증명합니다. 퍼즐 조각 상자를 흔들면 퍼즐을 풀지 않더라도 올바른 모서리 조각을 더 빨리 찾을 수 있는 것과 같은 이치입니다.
- 훈련을 돕습니다: 연구자들은 모델의 훈련 (학습) 단계에서 이 무작위 "바람"을 사용하면 모델이 더 빠르고 잘 학습할 수 있음을 보여주었습니다. 이는 코치가 운동 선수가 지루해하거나 일상에 갇히지 않도록 훈련을 다양하게 하는 것과 유사합니다.
요약
이 논문은 무작위성이 강력한 도구라고 주장합니다. AI 의 입력에 무작위적이고 의미 없는 벡터를 주입함으로써, 초기 단계에서 답에 이르는 서로 다른 "길"을 탐색하도록 강제합니다. 일단 길을 선택하면 그 길에 머무르게 되지만, 평소와 다른 길에서 시작했기 때문에 기존의 경로만 고수했을 때보다 목적지에 더 자주 도달하게 됩니다. 결론적으로 때로는 무언가를 흔들어 섞는 것이 새로운 것을 가르치는 것만큼 효과적이라는 것이 밝혀졌습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.