Deductive Logic in Language Models: Horizontal vs Vertical Reasoning
이 논문은 합성 연역적 과업에 대해 훈련된 소규모 트랜스포머 모델이 어떻게 구별되는 수평적(자기회귀적) 메커니즘과 수직적(암시적) 메커니즘을 통해 추론을 구현하는지 조사하며, 이를 통해 사고 사슬(Chain-of-Thought) 감독이 수평적 설정에서는 진정한 규칙 기반 추론을 촉진하는 반면, 수직적 설정에서는 복잡한 추론 패턴을 발달시키기 위한 커리큘럼 학습으로서 작용함을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 아무것도 모르는 아주 작은 백지 상태의 로봇 뇌(소규모 언어 모델)가 있다고 상상해 보세요. 당신은 이 로봇에게 논리 퍼즐을 푸는 법을 가르치고 싶습니다. 이 논문은 연구자들이 이 로봇의 뇌 내부를 들여다보며 로봇이 어떻게 문제를 해결하는지 관찰하는 탐정 이야기와 같습니다. 그들은 로봇이 어떻게 가르치느냐에 따라 두 가지 매우 다른 방식으로 문제를 해결할 수 있다는 사실을 발견했습니다.
다음은 이들의 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.
두 가지 사고 방식: "걷기" vs "순간이동"
연구진은 로봇에게 두 가지 유형의 퍼즐을 테스트했습니다:
- 체인 퍼즐 (The Chain Puzzle): 점들을 연결하기 (예: A가 B로 이어진다면, B가 C로 이어진다면, A는 C로 이어지는가?).
- 트리 미로 (The Tree Maze): 나무 꼭대기에서 특정 잎사귀까지의 경로 찾기.
그들은 로봇이 두 가지 뚜렷한 사고 모드를 사용한다는 것을 발견했습니다:
1. 수평적 추론 (Horizontal Reasoning): "한 걸음씩 걷는 사람"
비유: 당신이 어두운 숲속을 걷고 있다고 상상해 보세요. 당신은 바로 앞의 다음 한 걸음만 볼 수 있습니다. 끝에 도달하려면 한 걸음을 내딛고, 주변을 살피고, 그다음 걸음을 내딛는 과정을 반복해야 합니다. 앞으로 건너뛸 수는 없습니다.
- 작동 방식: 이는 로봇을 생각의 사슬(Chain-of-Thought, CoT) 방식으로 가르칠 때 발생합니다. 이것은 로봇에게 최종 답을 내놓기 전에 여정의 모든 단계를 반드시 기록해야 하는 공책을 주는 것과 같습니다.
- 로봇이 배우는 것: 로봇은 흔적을 따라가는 탐정처럼 행동하는 법을 배웁니다. 규칙을 찾고(A가 B로 이어진다), 그 결과를 기록한 뒤, 그 결과를 이용해 다음 규칙(B가 C로 이어진다)을 찾아냅니다.
- 비밀 메커니즘: 로봇의 뇌 내부에는 **유도 헤드(Induction Heads)**라고 불리는 작은 "검색 엔진"들이 있는데, 이들은 "복사-붙여넣기" 기능처럼 작동합니다. 이들은 방금 적힌 내용을 되돌아보고, 일치하는 정보 조각을 찾아낸 뒤, 퍼즐의 다음 조각을 앞으로 복사해 나갑니다. 이는 "A를 찾고, B를 얻고, 그다음 C를 찾는다"라는 매우 명확하고 기계적인 과정입니다.
2. 수직적 추론 (Vertical Reasoning): "순간이동하는 생각가"
비유: 당신이 높은 탑 아래에 서 있는데, 첫 발을 떼기도 전에 탑 꼭대기에 무엇이 있는지 알아야 한다고 상상해 보세요. 어떤 계단이 안전한지 아직 모르기 때문에 한 단계씩 걸어 올라갈 수 없습니다. 대신, 머릿속으로 탑 꼭대기까지 통째로 "순간이동"하여 전체 경로를 파악한 뒤, 비로소 말을 시작해야 합니다.
- 작동 방식: 이는 로봇이 중간 단계를 적지 못하도록 제한된 상태에서 트리 미로를 풀어야 할 때 발생합니다. 로봇은 자신의 뉴런 층(layers) 내부에서 전체 문제를 해결해야 하며, 첫 단어를 출력하기 전까지 이 모든 과정을 마쳐야 합니다.
- 비밀 메커니즘: 로봇은 경로를 "걷는" 것이 아니라, 층(layers)을 통해 수직적으로 경로를 구축합니다. 이는 투명한 종이 뭉치와 같습니다. 맨 아래 종이는 시작점을 담고 있고, 다음 종이는 다음 단계를, 그다음은 또 그다음 단계를 담아 계속 위로 쌓아 올립니다. 정보가 맨 위 층에 도달할 때쯤이면 전체 경로가 완성됩니다.
- 교육의 역할: 놀랍게도, 로봇이 중간 단계를 직접 쓰지 않더라도 "생각의 사슬(CoT)" 예시를 주는 것이 학습에 도움이 됩니다. 연구진은 이를 **커리큘럼 학습(Curriculum Learning)**이라고 부릅니다. 이는 마치 선생님이 학생에게 쉬운 퍼즐(짧은 경로)을 먼저 보여준 뒤, 점차 어려운 퍼즐(긴 경로)을 주는 것과 같습니다. 로봇은 먼저 단순한 패턴을 배우고, 그 지식을 사용하여 복잡한 문제를 해결하는 법을 뇌 내부에서 "조용히" 익힙니다.
함정: 스승 없는 "부정행위"
연구진은 로봇에게 단계별 기록(생각의 사슬) 없이 가르쳐 보았습니다.
- 결과: 로봇은 실제 논리를 배우는 데 대부분 실패했습니다. 대신, 로봇은 "부정행위"를 하기 시작했습니다.
- 비유: 어떤 학생이 시험을 치르고 있다고 상상해 보세요. 선생님이 풀이 과정을 요구하지 않는다면, 학생은 수학을 실제로 하는 대신 "숫자가 5개 들어간 질문은 보통 '예'가 답이다"라는 식으로 암기해 버릴 수 있습니다.
- 발견된 사실: 단계별 안내가 없으면, 로봇은 논리의 규칙을 배우는 대신 테스트 데이터의 패턴(편향)을 암기했습니다. 이 로봇은 연습 문제에서는 높은 점수를 받을 수 있었지만, 새로운 까다로운 질문에는 완전히 실패했습니다.
핵심 요약
이 논문은 로봇을 어떻게 가르치느냐가 단순히 로봇 자체가 무엇인지보다 더 중요하다는 것을 보여줍니다.
- 만약 로봇이 자신의 생각을 말하도록(수평적) 강제한다면, 로봇은 우리가 쉽게 이해하고 추적할 수 있는 명확하고 기계적인 논리 체인을 구축합니다.
- 만약 로봇이 조용히 생각하도록(수직적) 강제한다면, 로봇은 여전히 학습할 수 있지만, 매뉴얼을 따르기보다는 숙련도를 쌓아가는 과정처럼 점진적으로 복잡성을 구축하며 학습합니다.
- 만약 아무런 지도 없이 내버려 둔다면, 로봇은 지름길을 암기하는 부정행위를 하게 되어 규칙이 변할 때 신뢰할 수 없게 됩니다.
요약하자면, "생각의 사슬(Chain-of-Thought)"은 단순히 더 나은 답을 얻기 위한 화려한 기술이 아닙니다. 그것은 로봇의 뇌가 문제를 해결하는 방식 자체를 바꾸는 근본적인 도구이며, 로봇을 단순한 암기자에서 논리적인 사고가로 변화시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.